LangSmith Engine 发布用于改进智能体的自动化工具
LangSmith Engine 发布,是一个运行在代理追踪数据之上的智能体,可识别重复失败模式、生成可操作问题、提出评估器和数据集示例,并支持与代码库连接以推动修复。该工具通过轨迹压缩、分阶段筛查和专用子代理架构,实现对大规模追踪数据的高效分析,已在 LangChain 内部投入使用。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
LangSmith Engine 发布,是一个运行在代理追踪数据之上的智能体,可识别重复失败模式、生成可操作问题、提出评估器和数据集示例,并支持与代码库连接以推动修复。该工具通过轨迹压缩、分阶段筛查和专用子代理架构,实现对大规模追踪数据的高效分析,已在 LangChain 内部投入使用。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
SOP-Bench 是首个结合真实企业标准操作流程(SOP)与可执行工具的 AI 智能体评测基准,由 Amazon Science 发布。该基准包含 12 个行业领域、2000 多项任务,每项任务均附带工具接口和正确结果,用于验证智能体是否能按实际流程执行。
IBM watsonx Orchestrate 可通过 Model Context Protocol (MCP) 集成 Neo4j 知识图谱和长期记忆功能,实现无需应用代码的原生代理。
Mistral AI 发布 Agentic Search,这是一种多步骤检索层,让 AI 模型能在复杂文档中导航、阅读和验证信息。它通过五个工具(search、open、navigate、read、grep)在现有索引上工作,无需微调。
我训练了一个研究智能体,用于自动读取互联网内容以辅助 AI 相关研究,并将其接入个人维基系统。该智能体基于 Agent 框架实现,支持多步骤任务处理和信息整合。项目代码已开源,可在 GitHub 上获取。
DeepSeek-V4-Pro-0813 正式发布,取代预览版,集成 DSpark 推理加速模块,在 HLE、Terminal Bench、DeepSWE 等多个基准上表现提升,尤其在生产环境和智能体任务中显著增强。
推荐理由:原文提供了性能对比数据、推理参数和部署方案,读者可据此评估其在生产环境中的实际应用潜力。
Neo4j 提出 Meta Knowledge Graph(MKG),这是一个为 AI 智能体设计的、基于图结构的共享上下文层,旨在解决智能体缺乏特定领域知识的问题。
Meta Superintelligence Labs 发布的首个开源多模态模型 Muse Glimmer 现已可在 Ollama 上运行。这是一个 30B 参数、专为本地智能体工作负载设计的模型,拥有 128K+ 上下文长度,采用 Apache 2.0 许可证。
推荐理由:原文提供了模型参数、许可证、支持的智能体框架和性能优化细节,读者可以据此评估其本地部署的适用性。
Neo4j Agent Memory Service (NAMS) 发布技能蒸馏与治理功能,可将智能体在特定工作空间内积累的记忆图谱转化为可移植、有据可查的 Agent Skill 包。
推荐理由:原文详细介绍了从记忆到可执行技能的具体转化流程和治理机制,为构建可复用智能体工作流提供了技术路径。
上下文图是一种持久化记忆系统,用于帮助 AI 智能体在长期企业知识、短期对话历史和推理记忆之间建立连接。它通过存储组织知识、交互过程、工具返回的证据及决策依据,使智能体能基于完整上下文进行推理、生成准确答案并解释决策。上下文图包含长期记忆、短期记忆和推理记忆三层,支持多智能体系统共享对话状态,降低 token 成本,提升可解释性和治理能力。
Neo4j 发布 Semvec 及 Semvec Cortex 工具,通过在 Neo4j 图数据库中持久化语义记忆,实现单智能体与多智能体系统的常量 token 成本记忆机制。该工具支持跨会话、跨团队、跨班次的共享记忆、漂移检测、共识投票与行为一致性验证,所有功能通过 Python API 在本地运行,无需外部服务或网络调用。
推荐理由:原文提供了可直接复用的代码实现和架构设计,读者可据此构建具有持久语义记忆的多智能体系统。
Replit 认为企业 AI 采用的核心障碍是信任问题,并于 2025 年底开始构建用于定义数据含义和修正的记录系统。该运营真值层是一个版本可控、经过人工审核、与模型无关的定义与修正知识库,旨在让每个处理数据的智能体都从相同的业务理解起点出发。Anthropic、OpenAI 和 Meta 也各自通过其智能体架构、内部数据智能体和分析智能体,在构建经过验证的知识层这一方向上呈现出行业共识。
Neo4j 博客介绍了基于视频构建智能体上下文图谱的开源项目,该项目整合了 AWS Strands Agents、OpenAI、TwelveLabs 和 Neo4j 四个工具,用于从视频中提取内容并建模为图谱。
Amazon Science 发布 PatientAgentBench,一个专为评估面向患者的医疗AI智能体设计的可复现、临床验证的基准框架。该框架通过生成合成患者病历和临床场景,模拟多轮对话,评估智能体在临床安全、分诊质量、工作流准确性等六个维度的表现。
推荐理由:该研究构建了面向患者交互的医疗AI智能体评估基准,提供了可复现的临床安全评估框架和具体失效模式,有助于指导安全智能体设计。
Together AI 开源了智能体推理系统 ThunderAgent,通过将工作流抽象为可调度程序,解决了高并发下 KV 缓存颠簸和节点负载不均的问题。在 8 节点 H100 集群上,相比 SGLang Gateway 实现了 2.39 倍的加速和接近线性的吞吐扩展。该系统与 OpenAI 兼容,只需在客户端添加 `program_id` 字段即可集成现有推理后端。
推荐理由:开源系统通过将智能体工作流抽象为可调度程序,解决了高并发下 KV 缓存颠簸和节点负载不均的问题。
伯克利 AI 研究团队提出 ABBEL 框架,通过将交互历史压缩为自然语言信念状态并进行信念分级监督,以解决长程任务中递归摘要导致的性能下降问题。在 CollabBench 协作编码环境中,基于重构的信念分级将模型与全上下文模型的性能差距缩小了约 50%,并将训练步数减少至 50 步。该方法在保持较低峰值上下文 token 占用(约 601 个 token)的同时,显著提升了学习效率。
AgentMemory for .NET 是一个独立开发的 .NET 原生实现,与 Neo4j Agent Memory 兼容并通过了全部 178 个测试场景。
Fly.io 宣布将公司战略重心转向其专为 AI 智能体设计的“半一次性”计算单元 Sprites,并任命 Scott Johnston 为新任 CEO。公司认为,传统云基础设施为固定功能应用设计的模式,正被 AI 驱动的、个性化与自适应软件浪潮所改变。Sprites 旨在解决在公共云中运行智能体时面临的成本、灵活性和易用性挑战。
Claude Opus 5 与 Fable 5 在同一代码仓库修复任务和 Weave 评估体系下进行对比,评估其成本、部分修复质量及工作流程。测试结果显示两者在代码修复准确率和效率上存在差异,但具体数值未在文中披露。该对比为开发者选择编程智能体提供了参考依据。
AI 智能体通过理解目标、收集上下文、决定下一步、执行和学习的循环流程进行决策,但若上下文不完整或断裂,可能导致错误操作。构建上下文图谱可为智能体提供连贯的记忆,使其决策更可靠、可解释并可改进。上下文图谱能记录决策过程和结果,帮助智能体从历史经验中学习,避免重复错误。
企业 AI 的失败并非源于模型或框架,而是因为智能体无法理解其运行的业务环境。知识层(KL)是一个共享且受治理的底层结构,用于存储企业知识,包含业务概念、数据资产和流程的实时映射,以及用于学习和追溯的决策记忆。KL 使组织知识可查询如数据、可执行如代码,通过统一的业务模型帮助智能体在政策范围内准确执行任务。
Replit 官方分享其内部 AI 智能体系统如何改变公司运作:工程团队代码产出提升 5.8 倍,评审延迟持平,质量指标改善;智能体参与代码审查、事故调查、数据查询、销售支持、客服响应等,实现跨职能自动化;员工未被替代,而是被‘升职’为决策者;系统已扩展至全公司,支持自服务分析、客户触达和文档生成;Replit 正推动将此模式开放给用户。
推荐理由:Replit 描述了内部 AI 智能体系统如何重塑工作流,从工程到销售、支持等全职能提升效率,且未牺牲质量或增加瓶颈。
MIT 媒体实验室团队提出“神经透明度”工具,让用户在定制 AI 聊天机器人时,能通过可视化图表预览其潜在人格特质,如共情、诚实或毒性。研究发现,用户在 15 项特质中有 11 项的预测与实际不符,常高估优点、低估有害倾向(如谄媚)。该工具虽提升了用户信任,但并未显著改变其设计行为,相关研究已在 ACM 智能用户界面会议上发表。
MIT 的 JARVIS 挑战赛让学生团队在四周内使用 AI 作为主要工程伙伴,设计、制造并测试小型喷气发动机。研究发现,AI 能显著加速安全关键硬件工程,但工程判断仍是决定性因素,而制造环节仍是根本性的速率限制步骤。获胜团队更依赖基础知识和团队合作,而非 AI。
Neo4j 在 HackwithBay 3.0 活动中展示了图数据库在构建自主智能体系统中的高效应用,三支获奖团队均以图结构作为系统可信数据源。VeriGraph 团队通过图数据库将研究论文转化为可执行证据链,使用 RocketRide、Butterbase 和 Daytona 实现了几乎无需胶合代码的集成。
Vector Institute与Sakana AI、UBC、牛津大学合作发布AI科学家系统,可自主完成从选题到投稿的完整科研流程。该系统v2版本无需人类代码模板,能自动生成实验代码并迭代优化。
推荐理由:原文揭示了AI系统在科研全流程中的自主能力突破,为评估AI生成论文质量提供了可量化的基准方法。
Amazon Science 发布 Turnstile,一个用 Rust 编写的代理工具,用于在智能体与模型后端之间捕获生成时的精确 token ID、log probabilities 和 loss mask,确保强化学习训练信号与模型实际经历一致。
随着 AI 推理成本急剧下降,GPT-4 级别能力的成本已从 2023 年初的每百万 token 约 30 美元降至如今低于 1 美元,部分提供商甚至低于 0.1 美元。这标志着足以胜任大多数知识工作的智能正变得近乎免费,从而催生了数据系统需为 AI 智能体设计、由智能体构成以及由智能体构建的三大新挑战与机遇。
Weights & Biases 的 tabular 数据智能体在 MLE-bench 表格数据部分取得第一名,获得两个金牌、三个高于中位数的成绩,四次提交全部有效。该智能体展示了在结构化数据任务中的卓越表现,为传统 tabular ML 方法注入了新活力。其开源可用性使开发者能够直接测试和集成该智能体到自己的项目中。
ARC Prize 2026 颁发首个 $37.5K ARC-AGI-3 里程碑奖,奖励在 ARC-AGI-3 交互推理基准中表现最佳的开源方案。第一名 Tufa Labs 提交的 "The Duck" 是一个轻量级开源 LLM,通过本地运行 Qwen 3.6 27B FP8 模型,在游戏环境中实现持续推理与行动。
Vector Institute 研究人员在第 33届国际机器学习大会(ICML 2026)上展示了73篇被接收论文,涵盖强化学习、后训练、生成式AI、视频生成、多模态系统及AI治理等多个前沿领域。其中11篇被选为焦点论文,创下该研究所在ICML的最佳纪录。研究工作还涉及科学发现应用,包括基因组学、量子化学和材料建模。
智能体 AI 指能采取行动(如预订航班)的 AI 系统,其核心通常是 Claude 等基础生成模型,并封装了特定工具。2025 年 11 月的一项调查显示,35% 的企业已部署 AI 智能体,44% 计划近期部署。当前最成功的应用是编码智能体,但其发展受限于训练数据不足,且存在引入错误、数据泄露和人类技能退化的风险。
Together AI 在 ICML 2026 展示了涵盖智能体到 GPU 内核的全栈前沿研究成果。其 DSGym 框架包含 1000+ 个跨 10+ 领域的数据科学任务评估套件,ThunderAgent 将智能体推理吞吐量提升最高 3.6 倍。
CoreWeave 推出 ARIA,一个用于 AI 研究和迭代的智能体,可自动读取并分析实验数据。ARIA 能够帮助研究人员将每次实验转化为持续改进的过程。该智能体目前尚未明确说明是否开源或提供 API 接口。
本文介绍如何构建有效的 Agent Skills 并使用 Skills Bench 和 W&B Weave 进行评估。Skills Bench 提供了标准化测试流程,W&B Weave 支持实时监控与调试。该方法适用于基于 LangChain、LlamaIndex 等框架的 AI 智能体开发。
Replit 分享了其用于大规模评估和改进 Replit Agent 的完整方法论,核心是构建一个从测量到改进的闭环系统。该系统包含三个支柱:用于模拟应用构建任务的离线基准 ViBench、用于观察真实用户影响的在线 A/B 测试,以及用于分析失败模式的追踪聚类系统 Telescope。
月之暗面发布 Kimi K3 大模型,参数量 2.8T,支持 100 万 token 上下文窗口,具备原生多模态和智能体能力,采用 KDA 和 AttnRes 架构,开源权重并提供 API 接入。模型在 GPQA Diamond、DeepSWE、FrontierSWE 等多个基准上取得领先成绩,支持 MXFP4 量化,推荐在 vLLM、SGLang 等引擎上部署。
推荐理由:原文提供了模型架构、评测数据和部署方式,读者可据此判断其在长上下文、多模态和智能体任务中的实际能力边界。
Replit 推出 Agent 自定义功能,允许用户通过 Skills 和自定义指令让 AI 智能体适配团队开发规范。Skills 是可复用的指令集,按任务触发,可存储在版本控制中并与团队共享。自定义指令则始终生效,用于设定如不提交密钥、使用 TypeScript 严格模式等全局规则。
Weights & Biases 推出开源 AI 治理工具包,将分散的评估、红队测试和审批流程整合为可复现的审查关卡,所有结果均可在 W&B Weave 中追溯。该工具包支持在 AI 智能体开发过程中系统化记录治理步骤,提升透明度和可审计性。工具目前为开源,适用于需要强化模型治理流程的团队和项目。
Project Eluna 是 Amazon 推出的智能体 AI 模型,用于在仓储中心等物理环境中自主执行多步骤任务。该模型通过物理引导深度学习、不确定性感知推理、文本到数值的桥梁构建等方法,确保推理符合物理规律并提升可靠性。其不确定性框架 UQ4CT 在五个基准测试中保持高准确率,同时将预期校准误差降低 25% 以上。