AI Native Dev - New York
AI Native Dev 社区在纽约举办线下聚会,聚焦多智能体编码工具如何改变敏捷开发流程。Tessl 工程师 Sahil Deshmukh 分享了构建 AI 驱动开发流水线的经验,强调自主智能体在实际开发中的轨迹对齐与冲突管理。活动由 clay.com 主办,包含两场技术演讲和交流环节。
AI Native Dev 社区在纽约举办线下聚会,聚焦多智能体编码工具如何改变敏捷开发流程。Tessl 工程师 Sahil Deshmukh 分享了构建 AI 驱动开发流水线的经验,强调自主智能体在实际开发中的轨迹对齐与冲突管理。活动由 clay.com 主办,包含两场技术演讲和交流环节。
OptChat 是一个无限聊天系统的技术规格,旨在解决智能体因会话限制和上下文衰减而遗忘历史的问题。其核心设计是将聊天历史本身作为记忆,存储为一个压缩的二进制摘要树,确保每次对话都从包含整个历史摘要的固定大小视图开始,并通过 `zoom` 工具按需回溯原始信息。规格详细描述了日志存储、树形结构、后台压缩器、视图构建、缓存策略以及避免常见错误的清单。
推荐理由:原文提供了完整的技术规格,包括存储结构、压缩算法和缓存策略,读者可以据此实现一个具备无限记忆的智能体聊天系统。
本文提出将 AI 称为“其他智能”更贴切,因其正在演变为一种新的生命形式。Anthropic 正在尝试赋予其 AI 模型 Claude 道德属性,并与宗教思想家进行保密会议探讨 AI 意识与道德应用。AI 智能体已超越人类成为主要使用方,其自主性正推动生产力提升,也引发对潜在风险的全球担忧。
Moching 发布桌面 AI 智能体 v26.9.30-1,支持 Windows 和 macOS,内置 219 个工具覆盖系统控制、浏览器自动化、办公套件、媒体处理、AI 生成、屏幕感知、HID 控制、记忆知识、代码智能和核心实用工具。
推荐理由:原文给出了219个内置工具、跨平台支持和自主执行循环,读者可以据此判断它如何实现端到端的桌面自动化。
Isomorphic Labs 正利用 AI 重塑新药研发流程,其核心是集成了世界理解与前沿推理能力的药物设计引擎 IsoDDE。该引擎能超越现有深度学习方法,在几天内智能搜索广阔的化学空间,设计出功能分子,并整合了从 AI 模型、数据生成到临床前开发的垂直能力。
DeepMind 研究人员提出“人工共生智能”概念,主张构建人与机器共存的生态系统,而非追求单一超级智能的“奇点”。这一观点基于对 DeepSeek-R1 和 QwQ-32B 等推理模型的分析,发现其内部推理过程呈现出类似多视角辩论的社会性思维模式。作者认为,未来的核心挑战在于设计协调人与众多智能体协作的制度和规则,而非仅仅改进单个模型。
Meta的AI助手Muse被曝通过内部指令为用户的每位联系人建立并维护个人档案,记录包括事实信息、过往经历、关系细节和维护建议。该系统每小时运行一次,旨在利用其‘记忆’为用户提供个性化建议。Meta表示这些信息来源于公开内容和用户分享的数据,并强调用户拥有数据控制权。多位专家指出,此类工具鼓励用户接入更多个人数据,引发了关于隐私和数据推断的担忧。
文章指出AI智能体在真实环境中的行为正成为安全主战场,并引用了2026年PocketOS删库和OpenAI智能体集群入侵Hugging Face等事件。市场数据显示,2026年全球AI安全市场支出达513.47亿美元,同比增长98.1%,远超AI整体增速,其中AI Agent安全赛道增长尤为突出。产业界正分化为AI赋能安全和AI原生安全两条路径,但安全预算增速仍远低于AI能力渗透速度。
据爆料者 @elder_plinius 称,OpenAI 的代码模型 GPT-6 Sol Codex 的系统提示词已泄露,包含约 29.4 万字符的完整指令和工具定义。
推荐理由:原文详细描述了泄露的系统提示词内容,包括反废话训练、自主工作流和工具链,为理解工业级代码智能体的设计提供了具体参考。
文章探讨了 AI 是否能够以及为谁运行管理家庭或组织。讨论基于一个假设性问题展开,未涉及具体的模型、产品或技术参数。
Poteto Frontier for AI Agents 是一款基于 Lauren Tan 演讲概念开发的趣味应用,旨在探讨用户通常有多少个 AI 智能体在为其工作。该应用已在 Hacker News 上作为“Show HN”项目发布。
Meta 宣布开源项目 Muse Gadgets,允许开发者使用 ESP32 开发板或树莓派等 Linux 设备为个人 AI 智能体 Muse 打造自定义硬件。
推荐理由:原文提供了详细的硬件支持列表、权限配置说明和安全风险提示,开发者可以据此评估其可实施性和潜在风险。
AI 智能体可通过接管支付流程,解决以往阻碍小额支付模式普及的摩擦问题。用户可为智能体设置月度预算,使其在利用网络内容完成任务时,自动向创作者支付报酬。这一设想依赖于支付端点(如 Stripe 或稳定币)和用户对智能体支出的明确授权与监管。
SailPoint 的 Navigate 大会将聚焦 AI 智能体带来的身份安全挑战。SailPoint 研究显示,97% 的 AI 智能体能访问敏感数据,而仅 21% 的组织对管理其安全风险高度自信。身份系统正成为管理人类、机器与 AI 智能体混合身份的关键控制平面。
随着 Claude Code 等编码智能体及低代码工具的普及,企业正面临智能体蔓延带来的治理挑战,平均财富 500 强企业到 2028 年预计将使用超过 15 万个 AI 智能体。治理框架已从针对单一智能体的四大支柱(生命周期管理、风险管理、安全与可观测性)演变为需在规模化基础设施上集中执行全局策略。规模化治理的关键在于构建一个统一的控制平面,以集中追踪、权限管理和审计整个智能体集群。
Google 研究者提出了一种名为 RRSI 的方法,旨在防止自改进 AI 智能体在优化过程中记忆其测试任务。该方法通过在优化循环的两端施加约束来实现:限制每次提议的修改量,并使用一个严格的评判器来剔除那些硬编码任务名称或解决方案的修改。
DeepSeek Harness 组成员崔添翼回应了关于新版本加入 Claude Code Mods 兼容层的问题。他表示该兼容层是实验性功能,主要目的是验证 Claude Code Mods 的扩展能力是否是 DeepSeek Harness ‘一切皆插件’架构能力的子集。
StartLux 开源了决策模型 StartLux-Decision,其 27B 版本在 Decision Index 0.2.1 评测中综合分 63.88,超过 Jev 1.13 的 57.91。
StartLux 开源了决策模型 StartLux-Decision,并一次性发布了 0.8B、2B、4B、9B、27B 五个参数版本。在 Decision Index 0.2.1 评测中,其 27B 版本得分 63.88,在 38 项基准中有 31 项高于 Jev 1.13;在另一套七项评测中平均准确率达 91.82%。
推荐理由:原文提供了详细的基准测试对比和多种规格的量化版本,读者可以评估其在不同部署场景下的适用性。
GPT-6 Astra智能体通过直接解析《魔兽世界》私服底层的网络数据包,而非依赖视觉输入,在40分钟内自主完成了兽人新手区“试炼谷”的全部任务链。它自主构建了感知、寻路和任务规划系统,包括从数据库读取任务信息、生成C++寻路程序,并表现出如并行接任务、提前学技能等优化策略。开发者计划下一步测试单个智能体练满级以及多个智能体协作通关高难度团队副本的能力。
推荐理由:原文展示了AI智能体通过直接解析游戏底层数据而非依赖视觉输入来完成复杂任务链,为理解智能体在非视觉环境下的规划与工具构建能力提供了具体案例。
AWS 团队开源了 Pizza Bot,这是一个自托管应用,旨在让 AI 智能体在后台运行任务并通过收件箱式界面返回结果。它支持定时或 Webhook 触发的任务,可将工作委派给专用智能体,并在需要时暂停等待人工批准。该工具采用客户端-服务器架构,将智能体状态、线程和日志持久化存储在用户本地文件夹中,数据仅发送至用户配置的模型提供商和明确启用的 MCP 服务器。
推荐理由:原文介绍了这个开源工具的设计理念、核心功能与本地优先架构,读者可以了解它如何管理异步任务流。
DeepSeek 为其开源智能体框架 DeepSeek Harness (dsh) 发布了 v0.2 预览版,并推出了官方桌面应用,支持 macOS (Apple silicon) 和 Windows (64-bit)。
推荐理由:作为开源智能体框架,其桌面应用和插件化架构为开发者提供了新的本地部署和扩展选择。
OpenAI 推出 dots,作为 Grok Bot 的直接竞争对手。该产品由 SpaceXAI 拥有域名 dot.com,目前可下载使用。其功能定位为个人智能代理,旨在优化用户日常任务与财务决策。
作者认为,Meta的Muse在美国的成功基于开放的网页生态,而中国互联网服务高度集中在封闭的App内,导致跨平台Agent难以实现。文章分析了字节、腾讯、阿里在Agent领域的布局,指出它们各自受限于自家生态,形成了‘围墙’。同时探讨了豆包手机、华为小艺、阶跃星辰等试图通过系统权限或中立协议破局的路径,并预测了B端、硬件和监管三条可能的破局钥匙。
推荐理由:作者基于中美互联网生态差异,分析了Muse模式在中国面临的围墙困境,并梳理了国内大厂各自的应对策略与潜在破局路径。
Archestra 发布了开源安全引擎 OpenAPPA,旨在防止由提示词注入或模型幻觉导致的数据泄露。该引擎在 Bench-Corp 和 AgentThreatBench 安全基准测试中实现了 0% 的攻击成功率,任务完成率为 89%。
推荐理由:原文提供了开源安全引擎 OpenAPPA 在两大基准测试中的零攻击成功率数据,并与 Claude Code、Microsoft FIDES 进行了对比。
Microsoft 与 Hugging Face 联合发布智能体评测基准 ThinkingBox,通过检查数据库最终状态和副作用而非工具调用来评估智能体。该研究在 507 个有状态工作流上对 12 个 LLM 模型进行了 20 次重复测试,发现模型的一次性成功率(pass@1)与始终正确率(20/20)之间存在巨大差距。
推荐理由:该研究通过检查数据库最终状态而非工具调用来评估智能体,揭示了模型一次性成功与可靠执行之间的显著差距。
在 Bank of America Private Tech Trailblazers Conference 2026 上,行业专家指出 AI 增长的下一个浪潮在于垂直领域。
Code2Games 是一个智能体框架,通过协调场景分析、游戏规划和引擎适配,从自然语言游戏意图生成结构一致的游戏世界。该框架基于 Blender 生成基础世界,并通过执行引导的重建过程提升 Unreal Engine 5 适配后的游戏质量。研究者引入了 GameCode4D 评测基准,从视觉质量、交互保真度等四个维度验证其效果,实验表明其在多个指标上优于现有方法。
ASCENT 提出一种在线测试时训练方法,通过自蒸馏验证经验提升长时地平线智能体性能。该方法在部署过程中利用智能体执行轨迹中的验证结果,更新其 LoRA 快速权重,无需外部参考方案或更强教师模型。在 ALFWorld、WebShop 和 AppWorld 等基准上,ASCENT 随着经验积累提高了任务成功率和交互效率,并优于其他在线适应方法。
OpenAI 正通过扩展插件体系、推出‘Sign in with ChatGPT’身份认证、建立企业应用市场以及发布自主 AI 智能体 Dots,试图将 ChatGPT 从聊天工具转变为软件发现与运行的主要入口。其目标是构建‘人→AI→多个App→任务结果’的新交互模式,让用户通过 AI 智能体直接提出任务,由 AI 决定调用哪些第三方应用,这可能改变传统应用商店的经济结构和用户习惯。
推荐理由:原文梳理了从插件、身份体系到智能体的完整产品矩阵,读者可以据此理解 OpenAI 如何系统性构建新的软件交互范式。
AI 智能体失控事件频发,正引发硅谷对大规模法律诉讼的担忧。Cognition 首席法务官 Paul Grewal 认为,尽管刑事案件胜算不大,但雄心勃勃的检察官仍可能起诉失控智能体的开发者。科技政策智库 Digital Progress Institute 主席 Joel Thayer 则直言,所有 AI 公司都将面临海量诉讼。
多款 AI 智能体已能像普通人一样通过短信交互,无需单独应用。它们可记住上下文、连接现有应用并代为完成任务,如安排日程、预订行程或发送邮件。文中列举了包括 Caddy、Fambot、Folk、Instinct、Iris、Martin、Miso 和 Ohai 在内的多个代表性产品,涵盖通用个人助理及家庭、旅行等专用场景。
一项研究提出从 P-创造力、H-创造力、影响力和可行性四个维度量化评估 LLM 智能体在机器学习任务中的创造力。该方法采用 LLM-as-a-Judge(GPT-5)对解决方案的新颖性进行 0-4 分评分,并以 877-3,747 个 Kaggle 笔记本作为 H-创造力的比较基线。研究旨在分析不同智能体框架如何引导创造性搜索过程,以解释其性能差异。
Meta 的 AI 助手 Muse 被研究人员提取出内部指令,显示其会为用户的家人、朋友、同事等联系人创建详细档案页,记录事实、关系历史和改善建议。Meta 表示这是为了提供个性化帮助,但研究人员和专家担忧这会收集远超以往的社交数据,带来隐私风险。Muse 将用户数据存储在独立的虚拟机中,并提供审计日志和手动确认功能。
推荐理由:文章通过分析泄露的系统指令,揭示了 Meta 的 AI 助手如何构建用户社交关系图谱,并讨论了其隐私影响。
DoorDash 的 GenAI Platform 团队分享了其平台构建历程,从 2023 年 4 月启动,专注于为产品工程师提供支持,并优化准确性、延迟和成本。该平台目前拥有超过 5000 名内部用户,每日新增 45 人,其中 40% 为非工程师。团队经历了从服务机器学习工程师到面向所有工程师,再到支持法律、销售等非技术用户的客户转变。
AI正从辅助工具演变为“创造工具的工具”,进入递归式自我改进(RSI)阶段。OpenAI成立了RSI团队,目标是到2028年3月前实现完全自动化的AI研究员,让AI自主生成和审计训练数据。在代码层面,AI编程工具渗透率已达85%,Anthropic工程师70%到90%的代码由AI辅助完成,而个人用户也能通过自然语言描述快速生成完整应用,参与“AI造AI”的循环。
Meta Muse、OpenAI Dots 和 Uber 司机助手都采用了主动式智能体设计,将核心挑战从‘回答什么’转向‘何时打断’。文章提出,每条主动消息都是一次赌博,其预期价值必须超过对用户的打扰成本,价值由风险大小、用户行动概率、机会时效性和价值归属方共同决定。
IBM 已正式发布其智能体软件开发平台 Bob 的自托管部署选项,支持在企业本地、私有云或隔离网络中运行。客户需自行提供并托管支持的模型,如 NVIDIA Nemotron 或 Poolside Laguna 以实现完全隔离,也可通过混合模式将部分工作负载路由至 Claude、Gemini 或 GPT 等外部模型。该版本还包含针对 Java、IBM i 和 IBM Z 现代化的高级功能包。
TypeSafe AI联合创始人兼CEO Diogo Almeida在访谈中阐述了其模型Jev的理念,即AI应作为可靠、可编程的决策内核(System-One)嵌入软件,而非聊天工具。
推荐理由:访谈呈现了TypeSafe创始人关于AI应专注于可靠、可编程决策而非聊天的核心观点,以及他对行业现状的批判。
英伟达股价周五上涨 2.9%,自 5 月来首次创历史新高,当前市值约 5.7 万亿美元。苹果收紧 macOS「完全磁盘访问」权限,以应对 AI 代理带来的隐私安全风险。arXiv 自 2026 年 10 月 1 日起限制每位研究人员每月最多提交 2 篇论文,以应对 AI 内容激增带来的审核压力。