跳到正文

技术方向

Agent 智能体 最新动态

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

141 条精选近 30 天 80 条共收录 460 条

更新

精选归档 · 第 6 页

8月26日周三第 101–120 条
  1. LangChain 博客63

    LangChain 与 You.com 联合发布金融研究智能体框架

    LangChain 与 You.com 联合发布基于 Deep Agents 和 Finance Research API 的金融研究智能体框架,支持对欧盟27国2025年GDP数据进行自动化分析,实现异常检测、行业归因与可审计报告生成,完整执行过程通过 LangSmith 可视化追踪,提供可复现、可验证的AI研究工作流。

    推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。

  2. LangChain 博客56

    Harmonic 用 Deep Agents 重构 Scout 实现 4 倍留存

    Harmonic 用 Deep Agents 重构其 AI 产品 Scout,将产品迭代周期从月级缩短至天级,通过单个前沿模型与工具集成实现开放任务处理,支持跨数据层与企业上下文的多步推理。

    推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。

  3. LangChain 博客60

    LangSmith Engine 发布用于改进智能体的自动化工具

    LangSmith Engine 发布,是一个运行在代理追踪数据之上的智能体,可识别重复失败模式、生成可操作问题、提出评估器和数据集示例,并支持与代码库连接以推动修复。该工具通过轨迹压缩、分阶段筛查和专用子代理架构,实现对大规模追踪数据的高效分析,已在 LangChain 内部投入使用。

    推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。

8月25日周二
  1. The Pragmatic Engineer65

    Ramp 构建内部智能体 Inspect 的实践与架构

    Ramp 开发了名为 Inspect 的内部智能体,用于在远程沙箱环境中执行编码、调试、代码审查等任务。该系统基于 Cloudflare Durable Objects 和 Modal 沙箱,支持快速启动(<5秒)和跨功能协作,已覆盖75%的合并PR。Inspect 通过集成内部数据源与工具链,实现对前后端变更的自动验证,并作为平台支撑超过200个上层智能体,如自动修复、监控告警和数据分析代理。

    推荐理由:原文详细展示了内部智能体 Inspect 的构建逻辑与实际应用场景,读者可借鉴其架构设计与落地路径。

8月20日周四
  1. The Register · AI/ML62

    Slack 推出 Slack Code 功能,将 AI 编码智能体引入群聊

    Slack 推出 Slack Code 功能,允许 AI 编码智能体在群聊环境中工作。智能体可以创建专用代码频道,团队成员可实时查看其工作、审查代码变更并指导调整。该功能支持 Anthropic 的 Claude、GitHub Copilot 和 OpenAI 的 ChatGPT 等智能体集成,未来将开放 API 支持更多应用场景。

    推荐理由:Slack 将 AI 编码智能体引入群聊环境,展示了协作开发的新工作流可能性。

8月16日周日
  1. IEEE Spectrum · AI62

    agentic AI 推动 CPU 需求激增

    agentic AI 系统的兴起导致 CPU 需求显著上升,因工具调用、任务调度、tokenization 等环节主要依赖 CPU。Intel、AMD、Arm、Qualcomm 及 Nvidia 均已调整产品策略,强化 CPU 在 AI 工作流中的角色,Amazon Web Services 也已出台限制 CPU 使用的政策,反映出 CPU 资源正面临紧缺压力。

    推荐理由:原文指出 agentic AI 的兴起正推动 CPU 需求激增,且已有企业开始调整产能布局,读者可据此预判硬件资源分配变化。

8月13日周四
  1. DeepSeek 新模型71

    DeepSeek-V4-Pro-0813 模型正式发布,增强智能体能力与推理性能

    DeepSeek-V4-Pro-0813 正式发布,取代预览版,集成 DSpark 推理加速模块,在 HLE、Terminal Bench、DeepSWE 等多个基准上表现提升,尤其在生产环境和智能体任务中显著增强。

    推荐理由:原文提供了性能对比数据、推理参数和部署方案,读者可据此评估其在生产环境中的实际应用潜力。

8月10日周一
  1. Ollama 博客57

    Meta Superintelligence Labs 的 Muse Glimmer 模型已在 Ollama 上线

    Meta Superintelligence Labs 发布的首个开源多模态模型 Muse Glimmer 现已可在 Ollama 上运行。这是一个 30B 参数、专为本地智能体工作负载设计的模型,拥有 128K+ 上下文长度,采用 Apache 2.0 许可证。

    推荐理由:原文提供了模型参数、许可证、支持的智能体框架和性能优化细节,读者可以据此评估其本地部署的适用性。

8月6日周四
8月4日周二
  1. Neo4j 博客57

    Neo4j 发布支持多智能体系统的常量成本语义记忆工具

    Neo4j 发布 Semvec 及 Semvec Cortex 工具,通过在 Neo4j 图数据库中持久化语义记忆,实现单智能体与多智能体系统的常量 token 成本记忆机制。该工具支持跨会话、跨团队、跨班次的共享记忆、漂移检测、共识投票与行为一致性验证,所有功能通过 Python API 在本地运行,无需外部服务或网络调用。

    推荐理由:原文提供了可直接复用的代码实现和架构设计,读者可据此构建具有持久语义记忆的多智能体系统。

8月3日周一
  1. Import AI62

    Import AI 467:自主AI病毒、算力经济学与前沿研究能力争议

    本期Import AI通讯汇总了近期多项AI研究动态。研究人员构建了利用开源大模型在本地GPU上自主推理、传播的计算机病毒原型,攻击链整体成功率约37%。Dwarkesh Patel认为,随着AI能力逼近人类水平,算力价格可能因需求激增而上涨10倍以上。

    推荐理由:原文汇总了多篇关于AI自主威胁、算力经济学和前沿研究能力的近期研究,为读者提供了理解当前AI发展关键争议的集中视角。

7月29日周三
  1. Amazon Science55

    Amazon Science 发布 PatientAgentBench:面向患者交互的医疗AI智能体评估基准

    Amazon Science 发布 PatientAgentBench,一个专为评估面向患者的医疗AI智能体设计的可复现、临床验证的基准框架。该框架通过生成合成患者病历和临床场景,模拟多轮对话,评估智能体在临床安全、分诊质量、工作流准确性等六个维度的表现。

    推荐理由:该研究构建了面向患者交互的医疗AI智能体评估基准,提供了可复现的临床安全评估框架和具体失效模式,有助于指导安全智能体设计。

  2. Together AI63

    Together AI 开源 ThunderAgent,实现 2 倍吞吐的智能体推理系统

    Together AI 开源了智能体推理系统 ThunderAgent,通过将工作流抽象为可调度程序,解决了高并发下 KV 缓存颠簸和节点负载不均的问题。在 8 节点 H100 集群上,相比 SGLang Gateway 实现了 2.39 倍的加速和接近线性的吞吐扩展。该系统与 OpenAI 兼容,只需在客户端添加 `program_id` 字段即可集成现有推理后端。

    推荐理由:开源系统通过将智能体工作流抽象为可调度程序,解决了高并发下 KV 缓存颠簸和节点负载不均的问题。

7月17日周五
  1. Replit 博客71

    Replit 揭示 AI 智能体如何构建‘自动驾驶公司’

    Replit 官方分享其内部 AI 智能体系统如何改变公司运作:工程团队代码产出提升 5.8 倍,评审延迟持平,质量指标改善;智能体参与代码审查、事故调查、数据查询、销售支持、客服响应等,实现跨职能自动化;员工未被替代,而是被‘升职’为决策者;系统已扩展至全公司,支持自服务分析、客户触达和文档生成;Replit 正推动将此模式开放给用户。

    推荐理由:Replit 描述了内部 AI 智能体系统如何重塑工作流,从工程到销售、支持等全职能提升效率,且未牺牲质量或增加瓶颈。

7月10日周五
  1. Vector Institute67

    AI科学家实现科研全周期自动化

    Vector Institute与Sakana AI、UBC、牛津大学合作发布AI科学家系统,可自主完成从选题到投稿的完整科研流程。该系统v2版本无需人类代码模板,能自动生成实验代码并迭代优化。

    推荐理由:原文揭示了AI系统在科研全流程中的自主能力突破,为评估AI生成论文质量提供了可量化的基准方法。

6月24日周三
  1. The Register · AI/ML65

    Anthropic 在 Slack 中推出常驻智能体 Claude Tag

    Anthropic 推出常驻 Slack 的智能体 Claude Tag,取代原有的 Claude for Slack 应用。Claude Tag 可作为团队成员加入频道,根据权限访问频道内的工具、数据和代码库,并能通过持续学习积累上下文,主动更新信息或自主安排任务。现有应用将于 8 月 3 日停服,企业版和团队版客户即日起可迁移,并在 9 月 1 日前迁移可获得最高 25,000 美元的积分。

    推荐理由:原文详细描述了新功能的核心变化、迁移时间表和商业激励,读者可以据此评估其对团队协作流程的实际影响。

6月13日周六
  1. 月之暗面 Kimi 新模型75

    月之暗面发布 Kimi K3 大模型,支持 100 万 token 上下文与原生多模态

    月之暗面发布 Kimi K3 大模型,参数量 2.8T,支持 100 万 token 上下文窗口,具备原生多模态和智能体能力,采用 KDA 和 AttnRes 架构,开源权重并提供 API 接入。模型在 GPQA Diamond、DeepSWE、FrontierSWE 等多个基准上取得领先成绩,支持 MXFP4 量化,推荐在 vLLM、SGLang 等引擎上部署。

    推荐理由:原文提供了模型架构、评测数据和部署方式,读者可据此判断其在长上下文、多模态和智能体任务中的实际能力边界。