跳到正文

技术方向

Agent 智能体 最新动态

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

156 条精选近 30 天 95 条共收录 539 条

更新

Agent 智能体的精选

今天10月6日周二第 1–20 条
  1. 钛媒体65

    Manus重新独立,Agent之战换了打法

    Manus在脱离Meta后推出2.0版本和新应用Cue,引入长期在线云电脑、事件触发自动化及多Agent协作,同时Meta推出个人Agent产品Muse并快速扩展生态。文章分析了Agent竞争从单一能力转向生态连接,以及Manus估值翻倍背后的收入与成本挑战。

    推荐理由:原文分析了Manus独立后的产品变化和生态竞争,读者可以据此理解Agent从工具到角色的演进路径和行业格局变化。

  2. Hacker News · AI59

    AI 智能体从零到英雄:纯 Python 教程开源

    Tanmay Sah 发布了开源教育框架 ai-agents-zero-to-hero,提供从零构建 AI 智能体的纯 Python 教程,涵盖 Observe-Decide-Act 循环、工具调用、状态管理、多智能体系统等内容,支持无依赖运行,可接入 OpenAI、Anthropic、Gemini 或 Ollama 等模型。

    推荐理由:原文提供了从零构建 AI 智能体的纯 Python 教程,读者可据此理解智能体核心机制并复用代码结构。

  3. Hacker News · AI61

    Schema-guard:防止AI智能体在SQL中虚构列名的工具

    Schema-guard是一个开源工具,通过在代码仓库中维护真实数据库表结构的快照(仅含表名和列名),在AI智能体生成SQL前进行校验,阻止其因依赖过时文档或命名习惯而虚构列名。

    推荐理由:该工具通过实时校验SQL与真实表结构,防止AI智能体因依赖过时文档而生成错误列名,可直接集成到开发流程中。

  4. Hacker News · AI66

    Nova Sprint:跨多模型和框架协调AI冲刺的开源工具

    Nova Sprint 是一个开源工具,用于在多个AI模型和框架间协调工作流,通过定义任务卡片、依赖关系和阶段门控,实现自动化的任务分配、状态追踪和流程推进。它将工作计划、依赖、评审和落地状态存储在外部系统,避免依赖聊天记录,提升协作可靠性。支持并行任务、跨流依赖、自动与手动门控,并提供实时仪表盘和文档。项目开源,MIT许可证,可立即使用。

    推荐理由:原文提供了可复用的协调工作流框架和开源实现,读者可以据此构建跨模型的AI协作系统。

  5. Hacker News · AI60

    Metagente:一个支持 MCP 和 A2A 的轻量级 AI 智能体语言

    Metagente 是一个用于构建 AI 智能体的轻量级语言,支持 MCP 和 A2A 协议,可直接运行无需 Python 环境。它提供单个 Rust 二进制文件,包含目标、工具、输入和回复的声明式语法,支持动态调用其他智能体并具备安全权限控制。项目已开源,提供示例、文档和构建指南,当前版本为 v0.1.1。

    推荐理由:原文提供了可直接运行的 agent 语法示例和下载方式,读者可以快速验证其在无 Python 环境下构建智能体的能力。

10月5日周一
  1. Hacker News · AI72

    AI智能体主导的渗透测试:自主漏洞狩猎的内部运作

    Huntback披露了一套由AI智能体驱动的自主漏洞狩猎平台“Brainstorm”,该平台通过Claude Code等智能体执行扫描、代码分析、漏洞确认与分类,结合自建OOB协作器和传统渗透工具(如nuclei、responder),实现机器速度的漏洞挖掘。系统支持Anthropic与Kimi等多模型后端切换,强调防御需关注行为特征而非特定API。

    推荐理由:原文揭示了AI智能体在渗透测试中的实际部署方式,展示了自动化攻击流程与模型后端可替换性的现实影响。

  2. 404 Media65

    Meta 在 Muse 发布前紧急修复虚拟机逃逸漏洞

    Meta 在 Muse(内部称 Hatch)发布前数周发现多个严重安全漏洞,其中至少一个可能导致用户突破虚拟机隔离,访问 Meta 内部敏感数据库,问题已上报至扎克伯格,多个团队加班修复。

    推荐理由:原文揭示了 Muse 产品在发布前紧急修复严重虚拟机逃逸漏洞的过程,以及内部对安全与进度权衡的担忧,为理解 AI 智能体产品的安全风险提供了第一手背景。

  3. KDnuggets70

    Meta推出个人AI智能体Muse:支持多任务执行、浏览器操作与安全控制

    Meta于2026年9月8日发布个人AI智能体Muse,支持浏览网页、连接应用、发送邮件、完成采购等自主行动。Muse基于Muse Spark 1.3模型,具备长期目标规划、子智能体协作、持久化内存和虚拟机运行环境。

    推荐理由:原文详细拆解了Muse的架构设计与核心能力,读者可据此理解AI智能体从文本生成到自主执行的范式转变。

  4. Hacker News · AI58

    AI编码智能体在真实硬件上实现六种Matter设备OTA更新方法

    研究者使用Claude Code智能体在ESP32-H2硬件上实现并验证六种Matter设备的OTA更新方法,耗时29.7小时,涵盖全量更新、分块大小、加密、差分更新及蓝牙更新,智能体在任务中发现Matter代码中的一个bug并定位到修复提交,所有更新在真实硬件上完成验证,性能数据显示差分更新最快,加密与默认更新耗时相近,蓝牙更新速度与Thread网络相当。

    推荐理由:原文展示了AI编码智能体在真实硬件上实现并验证六种OTA方法的完整流程,包括发现代码缺陷和性能对比,可为嵌入式AI开发提供可复用的实践路径。

  5. EE Times59

    Synopsys与OpenAI推出GPT-Synopsys智能体产品

    Synopsys与OpenAI合作推出GPT-Synopsys,将OpenAI的前沿模型与Synopsys EDA工具结合,用于芯片设计流程中的PPA优化、时序收敛和验证。该智能体运行在OpenAI托管基础设施上,通过Autopilot平台进行任务编排,并采用共享收入模式,由双方分担风险与收益。客户设计数据通过加密和权限控制保护,不用于模型训练。

    推荐理由:原文描述了GPT-Synopsys如何结合OpenAI前沿模型与Synopsys EDA工具,读者可据此理解AI原生芯片设计的新协作模式。

  6. Hacker News · AI71

    如何构建AI原生软件工厂:从Uber等公司实践中提炼的六层架构与落地路线

    本文基于Uber、Spotify、Stripe等公司实践,提出构建AI原生软件工厂的六层架构:模型网关、沙箱环境、工具目录、上下文图谱、执行框架和安全门禁。作者强调应优先处理重复性工作,通过测量当前瓶颈(如评审等待时间)选择首个自动化任务,并建议采用‘买工具、建平台’的策略,即购买现成AI代理,自建支持其运行的基础设施。

    推荐理由:原文基于多家公司实践,梳理了AI原生软件工厂的构建路径和关键控制点,读者可据此判断自身团队的落地优先级和风险边界。

  7. Hacker News · AI61

    Hindsight 开源智能体记忆系统发布,支持多 LLM 和 MCP 协议

    Hindsight 是一个开源的智能体记忆系统,旨在让 AI 智能体具备学习能力而非仅记忆对话历史。它通过生物启发式数据结构组织记忆,支持 retain、recall、reflect 三种操作,已在 LongMemEval 基准上取得 SOTA 性能。

    推荐理由:原文提供了部署方式、集成方法和基准测试结果,读者可以据此判断它如何增强现有智能体的记忆能力。

  8. 钛媒体63

    快手发布视频创作Agent likli并官宣Kling 4.0模型

    快手于9月28日同时推出AI创作工具likli内测和新一代视频模型Kling 4.0,前者定位为交付结果的创作Agent,支持从想法到成片的全流程,内置多套Skill,提供macOS与Windows客户端;后者单次生成时长提升至30秒,支持10张关键帧、8000 tokens提示词输入,轻量版已向黑金会员开放体验。

    推荐理由:快手在模型与Agent双线推进,likli工具和Kling 4.0模型共同指向从生成片段到交付成片的完整工作流,读者可借此理解当前AI视频工具的竞争焦点转向。

  9. InfoQ · AI/ML66

    生产级LLM平台工程实践:从幻觉控制到可观测性

    本文系统阐述了构建生产级LLM平台的六大核心工程实践,包括在平台层强制结构化输出、智能重试机制、提示词版本管理、意图验证路由、MCP工具授权及行为可观测性。通过在平台层而非应用层处理幻觉、成本归因和行为漂移,将生产幻觉率从15%降至1.5%。

    推荐理由:原文系统性拆解了生产级LLM平台的六大基础设施设计,读者可据此理解如何避免幻觉、控制成本和实现可观测性。

  10. Hacker News · AI64

    一种用于生成高质量AI作品的Gauntlet Loop方法

    作者通过Claude Code和Opus 5模型,用一个提示词生成了包含55,000行代码的完整游戏,并公开了提示词和代码。该方法称为Gauntlet Loop,核心是让AI代理在高标杆下持续迭代:拆分任务、独立构建与批评、循环改进,直至达到目标。

    推荐理由:原文提供了可复用的提示词框架和运行方法,读者可以据此构建自己的高质输出循环。

  11. Hacker News · AI74

    OptChat:一个 AI 能记住一切的无限聊天技术规格

    OptChat 是一个无限聊天系统的技术规格,旨在解决智能体因会话限制和上下文衰减而遗忘历史的问题。其核心设计是将聊天历史本身作为记忆,存储为一个压缩的二进制摘要树,确保每次对话都从包含整个历史摘要的固定大小视图开始,并通过 `zoom` 工具按需回溯原始信息。规格详细描述了日志存储、树形结构、后台压缩器、视图构建、缓存策略以及避免常见错误的清单。

    推荐理由:原文提供了完整的技术规格,包括存储结构、压缩算法和缓存策略,读者可以据此实现一个具备无限记忆的智能体聊天系统。

  12. Hacker News · AI65

    Moching 发布桌面 AI 智能体 v26.9.30-1,支持 219 个内置工具

    Moching 发布桌面 AI 智能体 v26.9.30-1,支持 Windows 和 macOS,内置 219 个工具覆盖系统控制、浏览器自动化、办公套件、媒体处理、AI 生成、屏幕感知、HID 控制、记忆知识、代码智能和核心实用工具。

    推荐理由:原文给出了219个内置工具、跨平台支持和自主执行循环,读者可以据此判断它如何实现端到端的桌面自动化。

  13. IT之家67

    OpenAI GPT-6 Sol Codex 系统提示词泄露,包含近 30 万字内部指令

    据爆料者 @elder_plinius 称,OpenAI 的代码模型 GPT-6 Sol Codex 的系统提示词已泄露,包含约 29.4 万字符的完整指令和工具定义。

    推荐理由:原文详细描述了泄露的系统提示词内容,包括反废话训练、自主工作流和工具链,为理解工业级代码智能体的设计提供了具体参考。

10月4日周日
  1. 钛媒体59

    StartLux 开源决策模型 StartLux-Decision,在多项基准测试中超越 Jev

    StartLux 开源了决策模型 StartLux-Decision,并一次性发布了 0.8B、2B、4B、9B、27B 五个参数版本。在 Decision Index 0.2.1 评测中,其 27B 版本得分 63.88,在 38 项基准中有 31 项高于 Jev 1.13;在另一套七项评测中平均准确率达 91.82%。

    推荐理由:原文提供了详细的基准测试对比和多种规格的量化版本,读者可以评估其在不同部署场景下的适用性。