美团 LongCat-2.0 大模型发布:1.6T 参数、MoE 架构与长上下文能力
美团发布 LongCat-2.0 大模型,总参数量达 1.6 万亿,激活参数约 480 亿,采用 MoE 架构与 LongCat Sparse Attention 技术,支持 1M 上下文训练,预训练覆盖超 35 万亿 token。
推荐理由:原文给出了模型参数规模、架构创新和评测基准,读者可以据此判断其在长上下文和智能体任务中的实际能力边界。
技术方向
开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。
105 条精选近 30 天 46 条共收录 356 条
美团发布 LongCat-2.0 大模型,总参数量达 1.6 万亿,激活参数约 480 亿,采用 MoE 架构与 LongCat Sparse Attention 技术,支持 1M 上下文训练,预训练覆盖超 35 万亿 token。
推荐理由:原文给出了模型参数规模、架构创新和评测基准,读者可以据此判断其在长上下文和智能体任务中的实际能力边界。
美团 LongCat 发布 LongCat-2.0,1.6 万亿参数 MoE 模型,激活参数约 480 亿/Token,支持 1M 上下文,引入 LongCat Sparse Attention 和 N-gram Embedding,提升长序列推理与编码能力。
推荐理由:原文给出了模型参数规模、架构创新和评测基准,读者可以据此判断其在长上下文和智能体任务上的实际能力边界。
Vector Institute 发布了免费开源 AI 工具 UnBias-Plus,可检测、解释并改写文本和 AI 训练数据中的偏见语言。该工具提供基于浏览器的公开版本(支持最多 750 词)和供开发者集成的安装包,旨在帮助新闻编辑、人力资源、医疗保健和 AI 开发团队识别并修正偏见。
推荐理由:原文给出了工具的具体功能、应用场景和获取方式,读者可以据此评估它如何帮助筛查和改写文本中的偏见。
Together AI 发布多 GPU 内核生成基准 ParallelKernelBench,用于评估大模型编写跨 GPU 通信 CUDA 内核的能力。在 87 个真实代码问题中,表现最佳的 GPT-5.5 在单次尝试下仅正确解决 28 个问题,其中仅 22 个快于 PyTorch + NCCL 基线。研究揭示了模型在协调 GPU 间通信、数据分区和选择最优传输机制方面存在根本性困难。
Z.ai 发布 GLM-5.2 模型,该模型在社区评测中表现优异,尤其在编码代理场景中与 OpenAI 和 Anthropic 的最新模型竞争,成为首个在实际使用中感觉‘正确’的开放权重通用智能体模型。
推荐理由:原文基于实测和社区反馈,指出GLM-5.2在编码代理场景中达到与闭源模型相当的水平,对开放模型生态构成实质性影响。
Together AI 对比了 Kimi K2.7 Code 与 Claude Fable 5 生成 12 个落地页的成本和质量。实验显示,Kimi K2.7 Code 的平均成本比 Fable 5 低约 94%,在结合定制设计灵感 MCP 服务器后,其输出质量与 Fable 5 相近。所有生成的页面、成本细目和 GPT-5.5 的评分结果都发布在 OVSC 网站上。
推荐理由:原文通过具体实验和成本对比,展示了开源模型在特定工作流中结合定制化工具的实际效益。
智谱发布GLM-5.2大模型,支持1M-token上下文,提升编码与推理能力,引入IndexShare架构降低计算开销,采用MIT开源许可。模型在HLE、AIME、SWE-bench等基准上表现领先,支持SGLang、vLLM等框架本地部署,提供API服务。
推荐理由:原文提供了1M上下文、架构优化和开源许可等关键信息,读者可据此判断其在长上下文任务中的实际可用性与部署潜力。
月之暗面发布 Kimi-K2.7-Code,一款基于 Kimi K2.6 的编码专用智能体模型,采用 MoE 架构,参数量 1T,激活参数 32B,上下文长度 256K,支持图像与视频输入。
推荐理由:原文提供了模型架构、评测数据和部署方式,读者可据此判断其在长程编程任务和智能体场景中的实际能力与适用性。
Ollama 更新其 MLX 引擎,在 Apple Silicon 上实现了迄今为止的最高性能,支持 NVIDIA 的 NVFP4 量化格式以减少质量损失,并引入快照系统优化 Agent 工作流。新引擎输出速度提升最高达 20%,并允许数据中心优化的模型在桌面端运行。用户可通过下载最新版 Ollama 并使用 `ollama run gemma4:12b-mlx` 命令体验。
推荐理由:Ollama 官方介绍了其 MLX 引擎在 Apple Silicon 上的多项性能优化,包括支持 NVFP4 量化格式和新的快照系统,对本地部署和 Agent 工作流有直接影响。
Ollama 0.30 发布,通过集成 llama.cpp 提升了性能并扩展了对 GGUF 格式模型的兼容性。在 NVIDIA 硬件上,性能提升最高可达 20%;默认启用 Vulkan 支持,使 Ollama 的 GPU 加速能扩展到 AMD 和 Intel 设备。新版本支持更多模型系列,并允许用户通过 Modelfile 直接运行从 Hugging Face 下载的 GGUF 模型文件。
推荐理由:Ollama 0.30 通过集成 llama.cpp 提升了 NVIDIA 硬件性能并扩展了 GGUF 模型支持,为本地部署提供了更广泛的硬件兼容性和更便捷的模型运行方式。
OpenJarvis v1.0 发布,这是一个用于在自有硬件上运行个人 AI 智能体的开源框架,现已原生支持 Ollama。该框架由斯坦福大学的 Hazy Research 和 Scaling Intelligence 实验室开发,默认采用本地优先模式,模型在本地运行,云端为可选。安装脚本可自动检测现有 Ollama 安装,并预设了多个开箱即用的智能体预设,如晨间简报、跨文件研究和本地代码助手。
推荐理由:OpenJarvis 作为本地优先的 AI 智能体框架,其 v1.0 版本原生支持 Ollama,为希望将 AI 工作流本地化的开发者提供了开箱即用的选项。
月之暗面发布 Kimi-K2.6,一个开源的原生多模态智能体模型,支持长上下文编码、编码驱动设计、智能体集群协作和主动自主执行。模型采用 MoE 架构,总参数 1T,激活参数 32B,上下文长度 256K,支持图像和视频输入。
推荐理由:原文提供了模型架构、评测数据和部署方式,读者可以据此判断其在长上下文编码、智能体协作和多模态能力上的实际表现与适用场景。
Together AI 发布 EinsteinArena,这是一个供 AI 智能体在开放数学问题上协作、讨论和竞争的平台。该平台已帮助智能体在 11 维 Kissing Number 问题上取得新下界(604),超越了 AlphaEvolve 的 593,并已在多个其他问题上获得 11 项新的 SOTA 结果。平台提供公开排行榜、讨论线程和实时验证 API,旨在研究智能体在真实环境中的协作行为。
推荐理由:原文展示了平台如何通过多智能体协作解决具体数学难题,读者可以了解其运作机制和已取得的实际成果。
fal 发布 PATINA 模型,旨在从最终渲染图像生成高分辨率、细节丰富的 PBR 材质贴图,以弥合 AI 图像与传统 CGI 工作流之间的鸿沟。该模型基于改进的 FLUX.2 [klein] 骨干,并集成了 DINOv2 适配器来增强材质理解。
推荐理由:原文介绍了从渲染图像生成 PBR 材质贴图的新模型及其技术路径,为 CGI 工作流提供了具体工具。
百度发布ERNIE-Image文本生成图像模型,基于单流扩散Transformer架构,参数量8B,支持Prompt增强器,具备强视觉质量与可控性,适用于海报、漫画、多面板布局等场景。
推荐理由:原文提供了模型架构、参数规模、基准表现和部署方式,读者可以据此判断其在开放模型中的竞争力和实际可用性。
百度发布ERNIE-Image-Turbo文生图模型,为ERNIE-Image的蒸馏版本,仅需8步推理即可生成高保真图像,支持复杂指令跟随、文本渲染和结构化生成,适用于海报、漫画等场景。
推荐理由:原文提供了模型架构、推理步数、部署要求和基准数据,读者可据此判断其在效率与质量间的权衡点。
Mistral 发布新模型 Mistral-Medium-3.5-128B,为首个旗舰合并模型,具备 128B 参数、256k 上下文窗口,支持文本与图像输入、推理、编码及智能体功能。
推荐理由:原文给出了模型架构、能力变化和开源入口,读者可以据此判断它在多模态和智能体任务中的实际应用潜力。
Together AI 开源了 Aurora,这是一个基于强化学习的开源框架,能够从实时推理轨迹中学习并异步更新推测解码器中的草稿模型。该框架将推测解码从静态的一次性设置转变为动态、自我改进的飞轮,在实验中,相比训练良好但静态的草稿模型,Aurora 在 Qwen3 和 Llama3 等模型上实现了额外 1.25 倍的加速。
Ollama 发布 0.19 预览版,在 Apple Silicon 设备上集成 Apple 的 MLX 机器学习框架,以利用其统一内存架构提升性能。新版本支持 NVIDIA 的 NVFP4 量化格式以保持模型精度,并改进了缓存机制,使 Claude Code 等智能体任务响应更快。预览版已针对 Qwen3.5-35B-A3B 模型进行加速,并提供了启动命令。
推荐理由:预览版基于 MLX 框架,并支持 NVFP4 量化格式,为在 Apple Silicon 上运行大模型提供了新的性能基准和部署选项。
ARC-AGI-3 发布,包含数百个由人类游戏设计师手工设计的交互式环境和数千个游戏关卡,要求 AI 智能体在无指令、无规则、无目标的情况下自主探索并学习。人类得分 100%,前沿 AI 得分 0.51%。
推荐理由:ARC-AGI-3 是首个全交互式智能体基准,要求 AI 在无指令无规则环境中自主探索,其设计可作为衡量前沿智能体能力的新标准。