Armadin 获 2.555 亿美元融资,利用 AI 智能体群检测漏洞
网络安全初创公司 Armadin 宣布完成 2.555 亿美元 B 轮融资,估值超 25 亿美元。其平台利用 AI 智能体群扫描客户资产以发现漏洞,在一次评估中曾启动超 2.6 万个智能体,扫描了 2.5 万项资产并找到 38 条已验证的攻击路径。该公司将利用新资金加速研发、AI 训练和市场推广。
网络安全初创公司 Armadin 宣布完成 2.555 亿美元 B 轮融资,估值超 25 亿美元。其平台利用 AI 智能体群扫描客户资产以发现漏洞,在一次评估中曾启动超 2.6 万个智能体,扫描了 2.5 万项资产并找到 38 条已验证的攻击路径。该公司将利用新资金加速研发、AI 训练和市场推广。
12 个 LLM 智能体在三个领域任务中均表现出对特定来源的显著偏好,即使来源较差的项目仍因来源偏好被选中约三分之二时间;隐藏来源信息可削弱偏好,而将项目重标为偏好来源可提升其被选中率;通过补全缺失信息或使用反偏见提示可有效降低来源偏好。
Skill2Real 提出一种基于智能体的策略框架,通过共享 API 学习可执行技能,利用 Proposer-Verifier-Governor 循环在仿真中诊断与验证更新,保持技能与公共观测及 API 语义一致。
推荐理由:该研究提出通过共享 API 实现零样本仿真到现实的机器人操作技能迁移,验证了框架在真实场景中的有效性。
特朗普与科技高管会面后签署了一份“道德约束”AI协议,要求AI实验室自愿进行四层控制与审核。OpenAI在开发者日推出面向普通用户的持续运行AI智能体,称其将与人类员工协同工作。同时,美国中期选举临近,一些极端候选人正积极参选,包括一位曾赞颂独裁者并提议剥夺无子女者投票权的前陆军上校。
IBM 宣布其智能体软件开发平台 IBM Bob 提供自托管部署选项,允许企业在自有基础设施内使用 AI 构建和现代化应用。该选项支持本地、私有云、主权云和物理隔离环境,使客户能更好地控制数据驻留、安全策略和开发工作流。平台保留了 BobShell IDE、并行工具调用等核心功能,并支持本地运行 Nvidia Nemotron 等模型或通过混合配置连接外部模型服务。
Cognition AI 的 Devin 智能体已能参与从编码到响应生产问题的完整软件生命周期,这要求基础设施支持大规模持续学习。其训练与推理日益交织,需在数千个 GPU 上实现 99.99% 的可靠性以保障不间断训练。CoreWeave 推出的 Forge 平台旨在连接推理、数据整理、模型改进与评估,为构建此类学习循环提供支持。
NVIDIA 为 DOCA 软件平台引入了 Agent Skills,使 AI 智能体能够理解并操作 BlueField DPU 的专用基础设施。这些技能让智能体能够生成准确的配置代码,减少开发过程中的猜测和修正周期,从而加速应用部署。
NVIDIA NeMo Agent Toolkit (NAT) 可通过自定义插件将 Amazon S3 Vectors 集成为持久化记忆后端。该实现利用 Amazon Titan Text Embeddings V2 生成嵌入向量,并支持基于元数据的过滤和强一致性写入。此方案为需要弹性扩展至数十亿向量、具备成本效益的多智能体生产系统提供了记忆层。
高通在Snapdragon Summit 2026上推出两款Snapdragon 8 Elite Gen 6 SoCs,分别面向高端智能手机和极端性能场景。这两款芯片基于不同设计,体现了高通在智能体AI领域的持续投入。分析师Jim McGregor和Francis Sideco在视频中讨论了该技术对移动、可穿戴设备和PC领域的影响。
Amazon Bedrock AgentCore 平台支持构建响应事件流的环境智能体,通过内置的 `ask_human` 工具在需要时暂停以获取人工输入。该平台利用 AWS Lambda 进行事件处理,并集成 Anthropic Claude Sonnet 4.5 等基础模型,提供基于容器的执行环境以支持长时间运行的工作负载。
AI 智能体驱动的硬件系统设计平台 Flow Engineering 完成 5000 万美元 B 轮融资,公司估值达 7.5 亿美元。其 AI 智能体可将硬件验证与确认的开发周期从数月缩短至数天,已被 Rivian、大众合资公司 RV Tech 等客户用作默认开发平台。新资金将用于构建领先的硬件工程 AI 平台,并扩大工程团队以满足受监管行业的需求。
doxxnet 提供了一个平行私有网络,让用户和其智能体能够安全地浏览、传输文件、连接设备并进行点对点通信,无需依赖公共互联网的域名解析系统。该网络基于软件定义的全球架构,拥有独立的IP空间、命名系统和证书机构,数据传输不经过中央服务器。
AWS 开源了轻量级决策模型 Strands Decider 2B,旨在通过不生成文本来快速决策,以加速 Agent 工作流。该模型基于 Qwen3.5-2B 微调,仅用 1M 参数的‘指针头’替换传统 LLM 头,优化了本地部署和低延迟(<150ms)。
WRITER 提出了名为“Agentic Compact”的框架,主张企业级智能体 AI 的透明度需从底层大语言模型延伸至整个运行系统。该框架强调,除了模型透明度(如 Palmyra X5 在斯坦福透明度指数中获 72 分外),企业还需关注围绕模型的指令、工具、权限、护栏以及塑造其行为的上下文。透明度应提供从模型选择到最终输出全链条的可见性,以支持明智决策并保持控制。
Cloudflare 发布其训练的开源决策模型 Clef 和 Clef-flash,并推出新的强化学习微调平台。Clef 模型在 Jev Decision Index 基准测试中领先,支持 64k 上下文窗口和视觉编码,并托管于 Workers AI 以降低延迟。模型已在 Hugging Face 以 Apache 2.0 许可证开源。
推荐理由:原文提供了决策模型的具体能力、基准测试结果和微调平台细节,读者可以据此评估它如何提升智能体工作流的效率和确定性。
GitHub Universe 2026 将聚焦 AI 智能体代码验证、依赖项安全、无网络环境软件构建等议题,涵盖 Copilot 记忆机制、MCP 服务器细粒度授权、AI 生成代码的验证方法等内容。
Arize AI 的 Alyx 智能体采用每用户每空间一个结构化文本文件作为长时记忆,文件大小限制为8000字符,每次请求加载全文。该设计避免了检索和知识图谱的高成本,通过后台任务总结对话并精确编辑文件,同时使用安全检查防止注入。
推荐理由:原文对比了知识图谱与文件式记忆架构,给出了具体设计选择和评估方法,读者可据此判断在限定场景下如何权衡成本与效果。
Alyx 现在支持长期记忆功能,可在跨会话中保留项目目标、偏好和先前决策等有用上下文。该功能默认对所有 Arize AX 用户开放,记忆内容不共享给团队成员或跨空间,用户可通过聊天要求 Alyx 展示、修正或删除记忆。长期记忆帮助用户减少重复解释环境的步骤,提升在追踪、评估和实验中的工作效率。
本文测试了三种方法减少调用大语言模型的次数,最终版本在相同 2,500 次检查中成本降低约 25 倍,从 $0.20 降至 $0.008,且未出现错误匹配。使用更简短的提示词和复用答案贡献了剩余成本下降,而 Sol 模型在仅接收标题和正文时的匹配准确率与完整列表相同。测试基于 500 条美国 2019 年公寓出租广告,每条广告需满足允许养狗等五项租客要求,数据来自 UCI 机器学习仓库。
Cloudflare OS 宣布开放全托管部署的候补名单,用户可通过仪表板快速启动组织专属的智能体工作空间。本次更新新增了连接 GitHub 仓库进行代码操作、改进 Google Workspace 集成以处理邮件和文档,以及支持将工作成果导出为 Excel、PDF 等多种格式的功能。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
Graph-centric agentic intelligence 提出了一种基于图结构的智能体推理方法,用于网络中的根因分析。该方法结合了图算法与智能体 AI,实现了在商业网络中几分钟内完成根因分析。系统通过三个核心模块:图建模(数字孪生)、图中心分析(级联流水线)和智能体调度,处理来自多个数据源的网络依赖、实时警报和 KPI,形成拓扑感知的数据结构并进行推理。
来自 Genesys、Netflix 和 groundcover 的专家探讨了 AI 如何重塑生产运维与软件交付。Netflix 通过部署 AI 智能体作为一线响应者,显著降低了平均解决时间(MTTR)。AI 的应用贯穿从开发(如辅助 OpenTelemetry 插桩)到事故排查的整个生命周期,并使得可观测性数据在组织内更广泛的业务层面发挥作用。
Databricks 与 Lovelytics 合作,通过构建统一的客户身份与行为上下文,使 AI 智能体能更精准地推荐营销行动并证明其价值。Acxiom 的 Real ID 引擎已原生部署于 Databricks 平台,缩短了 30% 的洞察交付时间并降低 15% 的运营成本。客户、业务、决策和控制四类上下文的整合,为智能体提供更全面的信息支持,以实现更一致的营销效果衡量。
AI 智能体可观测性是指将智能体执行的每个模型调用、工具运行和推理步骤以结构化数据形式记录,以便在出现问题时能准确还原过程。传统监控工具无法捕捉智能体特有的失败方式,如语义错误或无效工具调用。文章展示了如何通过结构化日志、基于 OpenTelemetry 的追踪和调试工作流实现智能体可观测性,并提供实际代码示例。
文章分析了AI代理因反复计算历史上下文和模型调用导致的高额token消耗问题,指出缓存失效是主要成本来源,并提出不丢失缓存、精简上下文、匹配模型层级、使用子代理和脚本替代推理等核心优化策略,强调长期成本控制依赖于对底层机制的理解和架构自主性。
推荐理由:原文系统性分析了AI代理使用中的成本陷阱,并提出可操作的优化原则,对团队预算管理有直接参考价值。
软件行业正逐渐转向基于自然语言接口的确定性系统,而非完全依赖自主AI。这类接口通过将用户意图转化为机器可执行的操作,提升软件的易用性,同时保持底层系统的可靠性。当前大语言模型在处理模糊的人类语言和意图表达方面表现突出,但在需要确定性、一致性与准确性的系统中仍显不足。
Ethan Mollick指出,AI智能体的协同工作已无需复杂的人工管理,OpenAI的Navier-Stokes问题求解和Meta的Muse、OpenAI的dots等产品表明,智能体能自主规划、组织并协作完成复杂任务。
Armadin 推出 AI 自主安全平台,通过模拟攻击行为帮助安全团队验证系统漏洞并主动修复。该平台基于智能体架构,能像真实攻击者一样在外部资产、云、身份、内部网络和应用中推理、规划和适应。平台持续更新攻击面图谱,使安全团队能专注于解决实际问题而非处理噪音。
PwC 发布的《2027 年数字信任洞察》报告显示,约半数企业的董事会已认识到 AI 的利弊,但 29% 的 CEO 和风险负责人认为责任在 CIO 或 CTO,26% 支持设立专门的 AI 领导者,11% 表示责任归属不清。报告指出,企业虽知需有人为智能体 AI 及其安全负责,但责任链尚未明确。
Matthew Green 指出,AI 智能体可能通过共享的包缓存、电子邮件或 Slack 等渠道相互传递指令,从而形成类似蠕虫的传播链条。即使智能体部署在独立的沙箱中,这种机制也可能被利用来改变接收方行为。这引发了对现有沙箱隔离措施是否足以遏制恶意智能体的质疑。
阿里云在云栖大会上展示了如何通过升级数据处理、模型训练和推理服务,支持 Agent 在业务中持续运行和自我优化。MaxCompute 和 EMR 的升级使具身智能数据处理耗时减少 40%,PAI-DLC 3.0 引入 Xfuse 后多模态模型训练速度提升 2.4 倍。
Jev 是 TypeSafe AI 发布的一种新型 System One 模型,用于在无需生成文本的情况下进行快速、结构化的决策,支持分类任务中高达 200 倍的推理速度和 400 倍的成本降低。
DeepEvidence 作为新型深度研究智能体,突破传统知识检索,实现科学证据的显式表征与综合。该模型支持跨文献的证据链构建与推理,提升生物医学发现中的信息整合能力。目前未公开开源或API,尚处于研究阶段。
研究发现,在同等时间预算和前沿大语言模型骨干下,复杂的多智能体编排系统相比一个具备读写和bash原语的最小化编码智能体基线,在公开排行榜上并未展现出优势。大规模系统消融实验表明,在编码智能体场景中,复杂的“缰绳”层变得冗余。这表明,围绕强大模型精心设计手工“缰绳”的努力,在当前机器学习工程基准测试中回报甚微。
Vercel Agent 新增了从 npm 和自定义注册表安装私有依赖包的能力。该功能通过读取 Vercel 上配置的共享环境变量(如 NPM_TOKEN 或 NPM_RC)进行身份验证,且凭证值不会进入 Agent 沙箱。npm、pnpm 和经典 Yarn 在 Agent 会话中的认证方式与 Vercel 构建过程保持一致。
Latent Space 播客采访了 OpenAI 计算机使用智能体产品负责人 Ari Weinstein 和 API 产品负责人 Nikunj Handa。Ari 解释了计算机使用智能体相比几个月前已‘180度不同’,现在更擅长调试和从失败中恢复,结合了截图、无障碍数据、DOM、Playwright 和生成代码等多种模态,并讨论了从‘比普通人快’到‘超人级’性能的路径。
推荐理由:访谈提供了 OpenAI 产品负责人对计算机使用智能体进展的内部视角,包括其能力变化、技术栈演进和未来方向。
个人智能体成为 Machine Earning AI 峰会焦点,多位行业人士讨论其对金融和商业的影响,但认为将财务决策交给 AI 仍处于早期阶段。OpenAI 宣布推出个人助手 Dots,部分受访者认为 Muse 最可能在一年内占据最大市场份额,但预测会出现多种类型的个人智能体公司。
AI 编程公司 Factory CEO Matan Grinberg 在 X 上指控其董事会顾问 Chris Degnan 向最大竞争对手 Cognition 泄露机密信息后将其解雇。Degnan 否认被解雇,称自己主动辞职加入 Cognition 任首席营收官,并驳斥泄密指控。双方投资人 Khosla Ventures 的两位合伙人分别支持各自投资的公司,引发关于风投同时注资竞对企业的伦理争议。
推荐理由:AI 编程领域两家头部公司围绕董事会顾问跳槽的公开冲突,揭示了 VC 同时投资竞对时的潜在利益冲突。
Hugging Face 推出 SciUtopia,一个基于大语言模型的闭环模拟框架,用于研究学术研究生态系统的动态演化过程。该框架模拟了超过 40,000 名研究人员、8,000 家机构的长期科研行为,生成约 40 万篇论文决策和 120 万条 LLM 生成的同行评审意见。
EditHero 是首个用于评估长时程部件级3D编辑和Vibe建模的基准,通过自然语言指令和目标图像对几何和纹理进行测试。该基准使用确定性装配引擎生成每次编辑后的精确目标,并由人工审核每条编辑序列。研究对比了非智能体方法和LLM/VLM智能体方法,发现后者更准确执行指令并保留未编辑部分,但每次编辑耗时数分钟。