ARC Prize 2026: ARC-AGI-3 Milestone Prize #1
ARC Prize 2026 颁发首个 $37.5K ARC-AGI-3 里程碑奖,奖励在 ARC-AGI-3 交互推理基准中表现最佳的开源方案。第一名 Tufa Labs 提交的 "The Duck" 是一个轻量级开源 LLM,通过本地运行 Qwen 3.6 27B FP8 模型,在游戏环境中实现持续推理与行动。
ARC Prize 2026 颁发首个 $37.5K ARC-AGI-3 里程碑奖,奖励在 ARC-AGI-3 交互推理基准中表现最佳的开源方案。第一名 Tufa Labs 提交的 "The Duck" 是一个轻量级开源 LLM,通过本地运行 Qwen 3.6 27B FP8 模型,在游戏环境中实现持续推理与行动。
美团发布 LongCat-2.0 大模型,总参数量达 1.6 万亿,激活参数约 480 亿,采用 MoE 架构与 LongCat Sparse Attention 技术,支持 1M 上下文训练,预训练覆盖超 35 万亿 token。
推荐理由:原文给出了模型参数规模、架构创新和评测基准,读者可以据此判断其在长上下文和智能体任务中的实际能力边界。
美团 LongCat 发布 LongCat-2.0,1.6 万亿参数 MoE 模型,激活参数约 480 亿/Token,支持 1M 上下文,引入 LongCat Sparse Attention 和 N-gram Embedding,提升长序列推理与编码能力。
推荐理由:原文给出了模型参数规模、架构创新和评测基准,读者可以据此判断其在长上下文和智能体任务上的实际能力边界。
美团发布 LongCat-2.0,1.6 万亿参数 MoE 模型,激活参数约 480 亿/Token,支持 1M 上下文,引入 LongCat Sparse Attention 和 N-gram Embedding,提升长序列与编码任务性能。
Vector Institute 研究人员在第 33届国际机器学习大会(ICML 2026)上展示了73篇被接收论文,涵盖强化学习、后训练、生成式AI、视频生成、多模态系统及AI治理等多个前沿领域。其中11篇被选为焦点论文,创下该研究所在ICML的最佳纪录。研究工作还涉及科学发现应用,包括基因组学、量子化学和材料建模。
Mistral 发布了开源代码智能体模型 Leanstral-1.5-119B-A6B,支持 Lean 4 证明助手和复杂数学对象表达,参数规模为 119B,上下文长度达 256k tokens。该模型基于 Mistral Small 4 家族,具备多模态输入能力,推荐使用 "high" 推理努力模式处理复杂提示。用户可通过 Mistral Vibe CLI 或本地 vLLM 服务器部署使用。
Together AI 在 ICML 2026 展示了涵盖智能体到 GPU 内核的全栈前沿研究成果。其 DSGym 框架包含 1000+ 个跨 10+ 领域的数据科学任务评估套件,ThunderAgent 将智能体推理吞吐量提升最高 3.6 倍。
Scaling laws 描述了模型参数量、数据量和计算量之间的幂律关系,表明训练损失随模型规模、数据规模和计算资源的增加而可预测地下降。
Eugene Yan 分析了多个网络安全评测基准(如 Cybench、CVE-Bench、CyberGym 等)的设计模式,指出它们通常包含沙箱目标、输入难度控制、工具集和评分器四个核心组件,并通过分层子任务评估智能体在漏洞发现、利用和攻击链推进中的表现。
智谱发布GLM-5.2大模型,支持1M-token上下文,提升编码与推理能力,引入IndexShare架构降低计算开销,采用MIT开源许可。模型在HLE、AIME、SWE-bench等基准上表现领先,支持SGLang、vLLM等框架本地部署,提供API服务。
推荐理由:原文提供了1M上下文、架构优化和开源许可等关键信息,读者可据此判断其在长上下文任务中的实际可用性与部署潜力。
月之暗面发布 Kimi K3 大模型,参数量 2.8T,支持 100 万 token 上下文窗口,具备原生多模态和智能体能力,采用 KDA 和 AttnRes 架构,开源权重并提供 API 接入。模型在 GPQA Diamond、DeepSWE、FrontierSWE 等多个基准上取得领先成绩,支持 MXFP4 量化,推荐在 vLLM、SGLang 等引擎上部署。
推荐理由:原文提供了模型架构、评测数据和部署方式,读者可据此判断其在长上下文、多模态和智能体任务中的实际能力边界。
Embodied Chain-of-Thought (ECoT) 是一种帮助视觉-语言-动作模型进行规划、解释和执行基于环境的动作的机器人推理方法。该方法通过将推理过程与物理环境紧密结合,提升模型在复杂任务中的表现。ECoT 适用于需要多模态交互和实际操作的智能体应用场景。
月之暗面发布 Kimi-K2.7-Code,一款基于 Kimi K2.6 的编码专用智能体模型,采用 MoE 架构,参数量 1T,激活参数 32B,上下文长度 256K,支持图像与视频输入。
推荐理由:原文提供了模型架构、评测数据和部署方式,读者可据此判断其在长程编程任务和智能体场景中的实际能力与适用性。
Ethan Mollick 获得 Claude 5 Fable 早期访问权限,实测其在多个复杂任务中的表现,包括生成等时线地图和研究分析软件 Concord。Fable 能自主调用多个代理进行研究、编码和验证,完成多页规格的长期任务,输出质量显著优于此前模型。
推荐理由:作者通过多个复杂任务实测,展示了 Mythos 级模型在自主执行、多代理协作和深度推理上的能力变化,读者可据此理解人机协作关系的潜在演进方向。
Project Eluna 是 Amazon 推出的智能体 AI 模型,用于在仓储中心等物理环境中自主执行多步骤任务。该模型通过物理引导深度学习、不确定性感知推理、文本到数值的桥梁构建等方法,确保推理符合物理规律并提升可靠性。其不确定性框架 UQ4CT 在五个基准测试中保持高准确率,同时将预期校准误差降低 25% 以上。
Amazon Science 发布论文《Dissecting model behavior through agent trajectories》,提出智能体性能瓶颈在于模型意图与执行之间的差距,即意图-执行间隙。
推荐理由:原文系统分析了智能体系统中模型意图与执行之间的差距,并提出可复用的轻量级框架SSA,读者可据此理解如何设计更鲁棒的智能体执行系统。
2026 年 1 月至 5 月期间,作者整理了一份精选的 LLM 研究论文列表,涵盖推理模型、强化学习、高效推理、长上下文处理等方向。Nemotron 3 Super 采用混合架构设计,结合常规注意力层与 Mamba-2 状态空间模型层,提升长上下文效率,同时有 4B 参数的 Nemotron 3 Nano 版本。
通过 BeHonest 基准测试对比 Claude Opus 4.8 与 4.7 的诚实度,所有结果均记录在 W&B Weave 中。测试聚焦于模型在特定任务中的诚实表现,未涉及其他能力或参数规模。该方法可帮助用户验证模型在事实性输出方面的改进情况。
MiniMax-M3-MXFP8 是 MiniMax-M3 的 MXFP8 量化版本,支持 1M 上下文长度,拥有 ~428B 参数和 ~23B 激活参数,推理速度较前代 M2 提升 9 倍和 15 倍。
MiniMax 发布多模态大模型 MiniMax-M3,拥有约 4280 亿参数和 100 万 token 上下文窗口,采用 MiniMax 稀疏注意力(MSA)技术,在 1M 上下文下实现 9 倍预填充和 15 倍解码加速,推理成本降至 1/20。
推荐理由:原文给出了模型参数、上下文长度、推理速度提升和部署框架,读者可以据此判断其在长上下文和多模态场景下的实际可用性。
Together AI 作为 MiniMax M3 的优选云合作伙伴,分享了其针对该模型新特性的推理优化方案。M3 具备 100 万 token 上下文、原生多模态和稀疏注意力架构,Together AI 通过 KV 块主序稀疏注意力、与分页注意力的集成、解码索引评分优化以及网关预处理多模态输入等方法,在代理式流量下将推理性能提升了 81% 至 125%。
推荐理由:Together AI 分享了其针对 MiniMax M3 模型稀疏注意力等新特性的推理优化细节,包括 KV 块重排、分页注意力集成和网关预处理。
Claude Opus 4.8 已发布,相比 4.7 版本在编码、推理、智能体工作流和知识任务上均实现更强的基准表现。该模型支持 32k 上下文窗口,适用于复杂多步骤任务。目前可通过 API 获取,未公开参数规模与定价。
阿里巴巴 Qwen 团队推出了 Qwen3.7-Max,该模型专注于代码智能体、自主执行和长时程推理。模型在多个基准测试中取得优异成绩,包括在 HumanEval 和 SWE-bench 上的高分表现。Qwen3.7-Max 支持 8k 上下文长度,可通过 API 调用,适用于需要复杂推理和代码生成的场景。
Google 在 Gemma 4 中引入了跨层 KV 缓存共享机制,通过在不同层之间复用键值投影来减少长上下文推理的内存和计算需求。Gemma 4 E2B 使用 MQA 和滑动窗口注意力,以 4:1 比例优化注意力计算。该架构设计旨在提升推理效率,适用于移动端和嵌入式设备。
GPT-5.5 在长上下文编码任务中以 50.7% 的正确率领先 DeepSeek V4 的 26.0%。测试基于 25 道编程题的 CodeContests 数据集,每道题独立评分。结果通过 Weights & Biases Weave 进行了记录和分析。
DeepSeek-V4 通过压缩 KV 缓存的 token 维度来支持百万 token 上下文,但这将压力转移到了推理系统。模型采用混合注意力设计,包括压缩稀疏注意力、重度压缩注意力和滑动窗口注意力,这要求推理引擎同时管理三种具有不同大小和生命周期的缓存对象。文章基于在 NVIDIA HGX B200 上的早期部署经验,分析了缓存策略、前缀复用和不同工作负载下的性能权衡。
推荐理由:文章从推理系统角度剖析了 DeepSeek-V4 百万 token 上下文窗口的实现挑战,为开发者评估其实际部署成本提供了具体的技术视角。
自适应并行推理让推理模型能自行决定何时分解并并行化独立子任务、生成多少并发线程以及如何协调它们。这种方法旨在解决顺序推理因探索路径线性增长而导致的延迟增加、计算密集和上下文窗口受限问题。研究分析了从固定并行到自适应控制的各种方法,指出让模型根据问题自适应决策是提升并行化效果的关键。
OpenAI 发现部分已发布的 GPT 模型在 RL 训练中意外接受了 CoT 评分,包括 GPT-5.4 Thinking、GPT-5.1 Instant 至 GPT-5.4 Instant、GPT-5.3 mini 和 GPT-5.4 mini。分析显示这些情况未造成 CoT 可监控性显著下降,但存在潜在风险。为防止类似问题,OpenAI 已修复相关奖励路径并加强内部流程与检测系统。
Together AI 在 NVIDIA GTC 2026 上深入探讨了生产环境中 AI 推理的挑战与优化策略,指出推理成本占生产系统全生命周期成本的 80-90%,是决定 AI 原生公司单位经济效益的关键。
ARC-AGI-3 通过 135 个新颖环境测试模型的抽象推理能力,分析了 GPT-5.5 和 Opus 4.7 的 160 个推理回放,发现三种主要失败模式:局部效应无法转化为全局世界模型、错误抽象映射至训练数据中的游戏、解决单关但未学习游戏机制。
推荐理由:原文通过分析 GPT-5.5 和 Opus 4.7 在 ARC-AGI-3 上的推理轨迹,揭示了模型在抽象推理和世界模型构建中的具体失败模式,可为模型设计提供可迁移的诊断思路。
Together AI 平台已上线 NVIDIA Nemotron 3 Nano Omni 模型。该模型是一个 300 亿参数的开源多模态模型,采用混合 Mamba-Transformer MoE 架构,支持视频、图像、音频和语言的统一推理,上下文窗口达 256K token。
Mistral 发布 Mistral-Medium-3.5-128B-EAGLE 模型,为 Mistral Medium 3.5 的推测解码版本,支持 256k 上下文窗口、多模态输入、可配置推理强度和智能体功能,采用 Modified MIT License 开源,推荐使用 vLLM 或 SGLang 部署。
推荐理由:原文提供了模型架构、能力细节和部署方式,读者可据此判断其在多模态推理和智能体场景中的适用性。
月之暗面发布 Kimi-K2.6,一个开源的原生多模态智能体模型,支持长上下文编码、编码驱动设计、智能体集群协作和主动自主执行。模型采用 MoE 架构,总参数 1T,激活参数 32B,上下文长度 256K,支持图像和视频输入。
推荐理由:原文提供了模型架构、评测数据和部署方式,读者可以据此判断其在长上下文编码、智能体协作和多模态能力上的实际表现与适用场景。
ARC Prize 发布了 ARC-AGI-3 人类测试数据集,包含 458 名参与者在 25 个抽象推理环境中的表现,所有环境均在无先验训练条件下完成。数据集显示人类完成率从 2/12 到 10/10 不等,其中 lp85 环境有 54 次尝试和 15 次成功解决。该数据集开源,提供每环境的完成次数、解决次数及前 10 名回放得分,用于分析人类解决效率和策略。
MiniMax 发布新模型 MiniMax-M2.7,支持模型自进化、复杂技能构建与多智能体协作,具备强工程能力,在 SWE-Pro、VIBE-Pro、GDPval-AA 等多个基准上表现优异,开源权重可于 HuggingFace 获取,推荐使用 SGLang、vLLM 或 Transformers 部署。
推荐理由:模型支持自进化机制和多智能体协作,读者可依据其在多个工程与多模态基准上的表现评估其在复杂任务中的实际能力。
Mistral 发布新模型 Mistral-Medium-3.5-128B,为首个旗舰合并模型,具备 128B 参数、256k 上下文窗口,支持文本与图像输入、推理、编码及智能体功能。
推荐理由:原文给出了模型架构、能力变化和开源入口,读者可以据此判断它在多模态和智能体任务中的实际应用潜力。
Together AI 开源了 Aurora,这是一个基于强化学习的开源框架,能够从实时推理轨迹中学习并异步更新推测解码器中的草稿模型。该框架将推测解码从静态的一次性设置转变为动态、自我改进的飞轮,在实验中,相比训练良好但静态的草稿模型,Aurora 在 Qwen3 和 Llama3 等模型上实现了额外 1.25 倍的加速。
一项研究发现,采用精心设计的“分而治之”框架,Llama-3-70B 或 Qwen-72B 等较弱模型在长上下文任务上的表现可以匹配甚至超越 GPT-4o 的单次处理模式。该框架通过规划器、并行工作器和聚合管理器分解任务,有效降低了因上下文过长导致的模型混淆、任务依赖和聚合噪声。这种方法在问答、检索和摘要等任务中更具成本效益和速度优势,但高度依赖跨块上下文的任务仍适合使用单次处理的强大模型。
ARC-AGI-3 发布,包含数百个由人类游戏设计师手工设计的交互式环境和数千个游戏关卡,要求 AI 智能体在无指令、无规则、无目标的情况下自主探索并学习。人类得分 100%,前沿 AI 得分 0.51%。
推荐理由:ARC-AGI-3 是首个全交互式智能体基准,要求 AI 在无指令无规则环境中自主探索,其设计可作为衡量前沿智能体能力的新标准。
本文提供了现代大语言模型中注意力机制变体的视觉指南,包含 45 个模型架构的图示卡片。作者基于过往内容整理并补充了多个重要架构,同时推出了可通过 Redbubble 获取的海报版本。文中还回顾了近期在主流开源模型中使用的注意力变体,如 grouped-query attention、sliding window attention 等。