美团 LongCat-2.0 大模型发布:1.6T 参数、MoE 架构与长上下文能力
美团发布 LongCat-2.0 大模型,总参数量达 1.6 万亿,激活参数约 480 亿,采用 MoE 架构与 LongCat Sparse Attention 技术,支持 1M 上下文训练,预训练覆盖超 35 万亿 token。
推荐理由:原文给出了模型参数规模、架构创新和评测基准,读者可以据此判断其在长上下文和智能体任务中的实际能力边界。
内容形态
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
58 条精选近 30 天 24 条共收录 138 条
美团发布 LongCat-2.0 大模型,总参数量达 1.6 万亿,激活参数约 480 亿,采用 MoE 架构与 LongCat Sparse Attention 技术,支持 1M 上下文训练,预训练覆盖超 35 万亿 token。
推荐理由:原文给出了模型参数规模、架构创新和评测基准,读者可以据此判断其在长上下文和智能体任务中的实际能力边界。
美团 LongCat 发布 LongCat-2.0,1.6 万亿参数 MoE 模型,激活参数约 480 亿/Token,支持 1M 上下文,引入 LongCat Sparse Attention 和 N-gram Embedding,提升长序列推理与编码能力。
推荐理由:原文给出了模型参数规模、架构创新和评测基准,读者可以据此判断其在长上下文和智能体任务上的实际能力边界。
Z.ai 发布 GLM-5.2 模型,该模型在社区评测中表现优异,尤其在编码代理场景中与 OpenAI 和 Anthropic 的最新模型竞争,成为首个在实际使用中感觉‘正确’的开放权重通用智能体模型。
推荐理由:原文基于实测和社区反馈,指出GLM-5.2在编码代理场景中达到与闭源模型相当的水平,对开放模型生态构成实质性影响。
智谱发布GLM-5.2大模型,支持1M-token上下文,提升编码与推理能力,引入IndexShare架构降低计算开销,采用MIT开源许可。模型在HLE、AIME、SWE-bench等基准上表现领先,支持SGLang、vLLM等框架本地部署,提供API服务。
推荐理由:原文提供了1M上下文、架构优化和开源许可等关键信息,读者可据此判断其在长上下文任务中的实际可用性与部署潜力。
月之暗面发布 Kimi K3 大模型,参数量 2.8T,支持 100 万 token 上下文窗口,具备原生多模态和智能体能力,采用 KDA 和 AttnRes 架构,开源权重并提供 API 接入。模型在 GPQA Diamond、DeepSWE、FrontierSWE 等多个基准上取得领先成绩,支持 MXFP4 量化,推荐在 vLLM、SGLang 等引擎上部署。
推荐理由:原文提供了模型架构、评测数据和部署方式,读者可据此判断其在长上下文、多模态和智能体任务中的实际能力边界。
月之暗面发布 Kimi-K2.7-Code,一款基于 Kimi K2.6 的编码专用智能体模型,采用 MoE 架构,参数量 1T,激活参数 32B,上下文长度 256K,支持图像与视频输入。
推荐理由:原文提供了模型架构、评测数据和部署方式,读者可据此判断其在长程编程任务和智能体场景中的实际能力与适用性。
MiniMax 发布多模态大模型 MiniMax-M3,拥有约 4280 亿参数和 100 万 token 上下文窗口,采用 MiniMax 稀疏注意力(MSA)技术,在 1M 上下文下实现 9 倍预填充和 15 倍解码加速,推理成本降至 1/20。
推荐理由:原文给出了模型参数、上下文长度、推理速度提升和部署框架,读者可以据此判断其在长上下文和多模态场景下的实际可用性。
百度 ERNIE 团队发布 NAVA 模型,一个 6.3B 参数的联合音视频生成模型,支持从单个提示词生成同步视频与音频,包括多说话人音色控制和图像条件续写。模型采用 Align-then-Fuse MMDiT 架构,在 Verse-Bench 上刷新 Sync-C、Sync-D、视频质量与音频 WER 等多项指标,参数量仅为开源基线的 2–5 倍。
推荐理由:NAVA 是首个在 6.3B 参数下实现高同步性音视频生成的模型,其 Align-then-Fuse 架构和参考音色控制能力可直接用于多模态内容创作。
Mistral 发布 Mistral-Medium-3.5-128B-EAGLE 模型,为 Mistral Medium 3.5 的推测解码版本,支持 256k 上下文窗口、多模态输入、可配置推理强度和智能体功能,采用 Modified MIT License 开源,推荐使用 vLLM 或 SGLang 部署。
推荐理由:原文提供了模型架构、能力细节和部署方式,读者可据此判断其在多模态推理和智能体场景中的适用性。
Ethan Mollick基于早期访问体验,评测GPT-5.5在编码、多模态生成和学术写作上的表现。他指出GPT-5.5 Pro在构建3D模拟、生成带文本的图像、撰写学术论文和设计桌游等方面能力显著提升,完成速度从33分钟缩短至20分钟。
推荐理由:作者通过实测对比展示了GPT-5.5在编码、多模态生成和学术写作上的能力跃迁,读者可据此理解当前AI能力边界与实际应用潜力。
月之暗面发布 Kimi-K2.6,一个开源的原生多模态智能体模型,支持长上下文编码、编码驱动设计、智能体集群协作和主动自主执行。模型采用 MoE 架构,总参数 1T,激活参数 32B,上下文长度 256K,支持图像和视频输入。
推荐理由:原文提供了模型架构、评测数据和部署方式,读者可以据此判断其在长上下文编码、智能体协作和多模态能力上的实际表现与适用场景。
MiniMax 发布新模型 MiniMax-M2.7,支持模型自进化、复杂技能构建与多智能体协作,具备强工程能力,在 SWE-Pro、VIBE-Pro、GDPval-AA 等多个基准上表现优异,开源权重可于 HuggingFace 获取,推荐使用 SGLang、vLLM 或 Transformers 部署。
推荐理由:模型支持自进化机制和多智能体协作,读者可依据其在多个工程与多模态基准上的表现评估其在复杂任务中的实际能力。
百度发布ERNIE-Image文本生成图像模型,基于单流扩散Transformer架构,参数量8B,支持Prompt增强器,具备强视觉质量与可控性,适用于海报、漫画、多面板布局等场景。
推荐理由:原文提供了模型架构、参数规模、基准表现和部署方式,读者可以据此判断其在开放模型中的竞争力和实际可用性。
Gemma 4 系列包含四款模型:E2B、E4B、31B 和 26B A4B,支持图像与音频输入,采用稠密与 MoE 架构。其核心设计包括交错局部与全局注意力、K=V 优化、p-RoPE 位置编码、Per-Layer Embeddings(PLE)和多模态编码器(ViT 与 Conformer)。
推荐理由:原文通过图文结合方式详细拆解了 Gemma 4 的架构设计,包括多模态处理、MoE 与 PLE 技术,读者可据此理解其效率与能力的平衡机制。
百度发布ERNIE-Image-Turbo文生图模型,为ERNIE-Image的蒸馏版本,仅需8步推理即可生成高保真图像,支持复杂指令跟随、文本渲染和结构化生成,适用于海报、漫画等场景。
推荐理由:原文提供了模型架构、推理步数、部署要求和基准数据,读者可据此判断其在效率与质量间的权衡点。
Mistral 发布新模型 Mistral-Medium-3.5-128B,为首个旗舰合并模型,具备 128B 参数、256k 上下文窗口,支持文本与图像输入、推理、编码及智能体功能。
推荐理由:原文给出了模型架构、能力变化和开源入口,读者可以据此判断它在多模态和智能体任务中的实际应用潜力。
月之暗面发布 Kimi K2.5,一个开源的原生多模态智能体模型,基于 Kimi-K2-Base 连续预训练,支持视觉与语言理解、即时与思考模式、以及智能体群集执行。
推荐理由:原文提供了模型架构、评测基准和部署方式,读者可以据此判断其在多模态智能体方向的技术定位和应用潜力。
月之暗面发布 Kimi-K2-Thinking 模型,为开源思考模型最新版本,具备 256k 上下文窗口、INT4 量化和 1T 参数 MoE 架构,支持多步推理与工具调用,在 HLE、AIME25、BrowseComp 等基准上表现领先。
推荐理由:原文提供了模型架构、量化方式、基准评测和部署接口,读者可据此判断其在长链推理和工具调用上的实际能力边界。