Cantina 开源安全研究模型 apex-flash-1 在 60 项漏洞任务中解决 40 项
Cantina Security 与 Yeta Labs 发布了专为漏洞研究训练的开源权重模型 apex-flash-1。该模型基于 GLM-5.3-Flash 微调,拥有 321.3B 总参数,在 60 项保留漏洞任务中解决了 40 项,成本约为 2.38 美元,显著低于 Claude Opus 5 High。
Cantina Security 与 Yeta Labs 发布了专为漏洞研究训练的开源权重模型 apex-flash-1。该模型基于 GLM-5.3-Flash 微调,拥有 321.3B 总参数,在 60 项保留漏洞任务中解决了 40 项,成本约为 2.38 美元,显著低于 Claude Opus 5 High。
Moching 是一个桌面 AI 智能体,可操作整个电脑,包括控制鼠标键盘、自动化浏览器和 Office 套件、处理媒体等。它内置 219 个工具,支持 Windows 10+ 和 macOS 12+,需要用户自备 OpenAI、Claude 或 Gemini 等兼容的 API 密钥。核心架构采用 Rust 和 Python 组合,旨在实现感知、决策、执行、验证的完整闭环。
推荐理由:原文详细列出了 219 个内置工具和跨平台支持,读者可以评估它作为桌面智能体在自动化工作流上的潜力。
Bitcoin Stratigraphy MCP 发布了 1.1.0 开发者分发版本,这是一个独立的远程优先集成仓库,包含注册元数据、OpenAPI 合约、无依赖客户端和原生框架智能体示例。
哈佛大学物理学家 Matthew Schwartz 在 Anthropic 的客座文章中介绍了开源工具 BootLoops,这是一个用于精确科学计算的 harness。
Poteto Frontier for AI Agents 是一款基于 Lauren Tan 演讲概念开发的趣味应用,旨在探讨用户通常有多少个 AI 智能体在为其工作。该应用已在 Hacker News 上作为“Show HN”项目发布。
Meta 宣布开源项目 Muse Gadgets,允许开发者使用 ESP32 开发板或树莓派等 Linux 设备为个人 AI 智能体 Muse 打造自定义硬件。
推荐理由:原文提供了详细的硬件支持列表、权限配置说明和安全风险提示,开发者可以据此评估其可实施性和潜在风险。
RedactPDF.ai 是一个开源、免费的 AI PDF 脱敏工具,通过 Google Gemini 3.8 Flash 识别敏感信息并永久移除。用户上传 PDF 后,工具会标记潜在敏感内容(如姓名、社保号),经用户审核调整后,可下载已移除可见及可选中文本层的最终文件。
Baloo 是一个开源的、自托管的 AI 代码审查 GitHub App,可自动审查 PR 差异并发布可操作的评论。它支持 Claude、Gemini 等多种模型 API,能读取项目约定文件并执行基于上下文的检查。用户需自行部署服务并配置 GitHub App 和 API 密钥。
Recly 是一款免费开源应用,可将 Galaxy Watch 或 Apple Watch 变为 AI 录音笔,支持本地免费转录,并将笔记任务交给用户已有的 AI 智能体。
推荐理由:作者开源了将智能手表变为录音笔的方案,并详细说明了本地转录和与现有AI集成的技术路径。
StartLux 开源了决策模型 StartLux-Decision,其 27B 版本在 Decision Index 0.2.1 评测中综合分 63.88,超过 Jev 1.13 的 57.91。
NASA 与 IBM Research 联合发布了开源的 NASA-IBM 月球基础模型,该模型基于 17 年月球勘测轨道飞行器(LRO)等任务提供的近 200 万个图块数据训练而成。在预测月球极地冰沉积物任务中,该模型将预测误差降低了高达 22%;在粗尺度陨石坑检测任务中,性能也提升了近 19%。该模型旨在帮助科学家更便捷地利用海量观测数据,并可通过少量标注样本适应特定任务。
SCM 是一个 macOS 本地优先的 AI 媒体搜索工具,可对照片和视频的每一帧进行语义搜索。它使用本地视觉模型(如 CLIP、SigLIP)和 Whisper 进行推理,支持基于含义、场景、OCR 文本和对话的搜索,所有数据均不离开设备。项目通过 Homebrew 安装,使用 Electron、Bun、ONNX Runtime 等技术栈构建。
推荐理由:原文详细说明了本地化多模态搜索的实现路径和隐私设计,为有类似需求的开发者提供了可参考的技术栈和架构思路。
StartLux 开源了决策模型 StartLux-Decision,并一次性发布了 0.8B、2B、4B、9B、27B 五个参数版本。在 Decision Index 0.2.1 评测中,其 27B 版本得分 63.88,在 38 项基准中有 31 项高于 Jev 1.13;在另一套七项评测中平均准确率达 91.82%。
推荐理由:原文提供了详细的基准测试对比和多种规格的量化版本,读者可以评估其在不同部署场景下的适用性。
Aleph Alpha 发布了 Kolibri-1,这是一个采用混合专家架构的开源权重英德双语大语言模型。模型总参数量为 781 亿,但每个 token 仅激活 34.6 亿参数,支持长达 1,048,576 token 的上下文,并附带 Apache 2.0 许可证。
AWS 团队开源了 Pizza Bot,这是一个自托管应用,旨在让 AI 智能体在后台运行任务并通过收件箱式界面返回结果。它支持定时或 Webhook 触发的任务,可将工作委派给专用智能体,并在需要时暂停等待人工批准。该工具采用客户端-服务器架构,将智能体状态、线程和日志持久化存储在用户本地文件夹中,数据仅发送至用户配置的模型提供商和明确启用的 MCP 服务器。
推荐理由:原文介绍了这个开源工具的设计理念、核心功能与本地优先架构,读者可以了解它如何管理异步任务流。
研究团队开发的ChromAgeNet系统通过分析细胞核三维图像中的DNA空间组织,能以约77%的准确率区分年轻与衰老的小鼠造血干细胞。该系统关注染色质组织复杂度等过去难以量化的结构特征,并能检测表观遗传药物干预引发的结构变化。团队已公开模型与数据,该技术有望用于高通量药物筛选。
Claude Code 正式上线名为 Mods 的机制,允许开发者通过 TypeScript 函数深度自定义界面、拦截命令甚至将请求转给其他模型。社区已涌现出像素宠物、小恐龙游戏、故事生成器等大量创意 Mod,而 Anthropic 自身也使用同一套机制构建了 /diff 面板等功能。
DeepSeek 为其开源智能体框架 DeepSeek Harness (dsh) 发布了 v0.2 预览版,并推出了官方桌面应用,支持 macOS (Apple silicon) 和 Windows (64-bit)。
推荐理由:作为开源智能体框架,其桌面应用和插件化架构为开发者提供了新的本地部署和扩展选择。
Kimi K3通过美国AI基础设施公司Baseten进入OpenAI企业付费结算体系,企业用户调用费用可直接计入其OpenAI采购额度。这是中国开源模型首次进入该主流企业采购通道。同期,Anthropic提交的IPO文件显示其2025年营收达45.9亿美元,其中近半数依赖亚马逊和谷歌云平台。
亚马逊 Strands Agents 团队开源了 Strands Decider 2B 决策模型,可在本地 CPU/GPU 上运行。该模型基于 Qwen3.5-2B 微调,在 JevBench 数据集上表现良好,在 2B 级别模型中排名第三。在 NVIDIA GeForce RTX 3090 上执行小型决策任务的中位数时延为 153ms。
arXiv 因 AI 论文暴涨,9月投稿达40363篇,cs.AI类别两年增超6倍,审核被拒率升至10%-12%,并实施每人每月限投2篇的临时措施。Tavus 发布 Griffin 实时视频交互模型,自研实验中48%的参与者在一分钟视频通话后被欺骗。
Archestra 发布了开源安全引擎 OpenAPPA,旨在防止由提示词注入或模型幻觉导致的数据泄露。该引擎在 Bench-Corp 和 AgentThreatBench 安全基准测试中实现了 0% 的攻击成功率,任务完成率为 89%。
推荐理由:原文提供了开源安全引擎 OpenAPPA 在两大基准测试中的零攻击成功率数据,并与 Claude Code、Microsoft FIDES 进行了对比。
Meta 宣布开源 Muse Gadgets 项目,允许爱好者自行构建 AI 硬件,包含 ESP32 板固件和连接自制设备至其 AI 智能体 Muse 的 Linux SDK。Meta 还制造了自有设备 Muse Home Link,这款 USB-C 小工具可将 Muse 连接至家庭网络以控制智能设备,并将向 Muse 订阅者免费发放 5000 台。
开源无代码平台 NocoBase 的 AI 员工功能新增了知识库文档引用支持。该功能允许 AI 在回答用户问题时,直接引用并链接到平台知识库中的相关文档。NocoBase 目前提供 main、next 和 develop 三个版本分支,其中 main 分支为最稳定的推荐安装版本。
OpenAI 发布 GPT-6.1 Sol,定价为每百万输入/输出 token 2/10 美元,在 DeepSWE v1.1 上比 GPT-6 Sol 高出 6.4 分,在 Agent Arena 中位任务成本为 0.56 美元。
Meta 推出了开源项目 Muse Gadgets,允许开发者构建连接其个人 AI 助手 Muse 的自定义硬件。该项目提供了开源固件、Linux SDK 及项目构想,支持用户利用树莓派或 ESP32 等开发板连接显示器、按钮和传感器。Meta 已基于此制作了 5000 个名为 Muse Home Link 的 USB-C 设备,免费赠送给 Muse 订阅者以连接家庭网络中的智能设备。
Meta 开源了代码和 SDK,允许开发者使用 ESP32 开发板或 Raspberry Pi 自行构建集成其 AI 智能体 Muse 的硬件设备。该公司还制造了 5000 个预制的 Muse Home Link 设备,用户可加入候补名单,该设备能通过社区技能控制灯光、电视等智能家居。
Allen Institute for AI (Ai2) 发布了用于高效训练混合专家大语言模型的开发框架 Olmo-core 3。该框架使 MoE 模型能在保持计算效率的同时扩展至万亿参数规模,在 Nvidia B3000 GPU 上对 470 亿参数模型的训练吞吐量达到每秒 52,000 个 token,较 Nvidia Megatron-core 架构提升约 2.7 倍。
Vercel 为 Python 开发者发布了 AI SDK 的最新版本,新增了实验性的 `evaluate()` API 以直接调用 Jev 模型。Jev 是一种基于大语言模型构建的通用分类器,旨在快速、低成本地处理结构化分类任务,并返回 JSON 格式的答案和置信度。开发者可通过 `uv add ai` 安装 SDK,并设置 AI Gateway 密钥来使用该功能。
Pi 1.0 和 Pi Durable 发布,前者为 Agent 开发框架增加了对 MCP、Jev 和图像模型的原生支持、扩展支持、缓存预热等功能,后者将 Pi 用 TypeScript 重写,实现了崩溃恢复、可移植性、并发、可扩展性、上下文管理、多人协作和热更新等状态持久化特性。
NVIDIA 开源了 Do Inference Now (DIN) Deploy,这是一个 C++ 示例集合,用于将 AI 模型集成到本地应用中。它结合了 ONNX Runtime 与 NVIDIA TensorRT RTX 执行提供程序,为开发者提供了从模型检查点到原生应用部署的桥梁。
AWS 开源了轻量级决策模型 Strands Decider 2B,旨在通过不生成文本来快速决策,以加速 Agent 工作流。该模型基于 Qwen3.5-2B 微调,仅用 1M 参数的‘指针头’替换传统 LLM 头,优化了本地部署和低延迟(<150ms)。
Cloudflare 发布其训练的开源决策模型 Clef 和 Clef-flash,并推出新的强化学习微调平台。Clef 模型在 Jev Decision Index 基准测试中领先,支持 64k 上下文窗口和视觉编码,并托管于 Workers AI 以降低延迟。模型已在 Hugging Face 以 Apache 2.0 许可证开源。
推荐理由:原文提供了决策模型的具体能力、基准测试结果和微调平台细节,读者可以据此评估它如何提升智能体工作流的效率和确定性。
开发者开源了权限管理工具 Zentrola,旨在解决团队使用 Codex 和 Claude Code 等 AI 编程工具时的 API Key 分发、模型权限控制和成员权限撤销等管理难题。
MateClaw 2.3.0 正式版发布,为 Persistent Goal 功能增加了用户配置的托管 JSON 验收机制。Agent 需发布不可变的产物版本,服务端检查结果并绑定到当前要求与具体生成,所有绑定有效后才允许完成目标。
DeepSeek Harness v0.2 预览版发布,提供了 macOS 和 Windows 桌面端安装包,实现了开箱即用。新版本支持通过 npm 包名安装插件,并具备让 AI 自己编写插件的能力。
推荐理由:原文给出了桌面版发布和插件安装方式的变化,读者可以据此判断它会怎样改变现有工作流。
开源 Windows 多 Agent 工作台 Termexo 发布了 v0.10.9 版本。该版本将工作区内 Agent 的状态集中显示为五种图标:空闲(灰色)、运行/思考(绿色闪动)、异常/等待授权(红色)以及完成(绿色对号)。状态提示旨在帮助开发者快速定位需要处理的终端。
DeepSeek 开源了面向华为昇腾算力平台的基础设施组件,包括 TileLang 高级语言编译工具、计算库和分布式通信库。这些组件与此前面向英伟达平台的开源组件一一对应,旨在建立自主可控的 GPU 软件生态。
Simon Willison 利用 GPT-6 Astra 构建了一个实验性工具 Photo Scrubber,用于在本地自动识别并模糊照片中的人脸。该工具基于 Google 的 MediaPipe C++ 库和 BlazeFace 人脸检测模型,通过 WebAssembly 在浏览器中运行,旨在保护隐私。
Codeaha v1.0.0 正式发布,是一款本地优先、国产大模型友好的 AI 编程智能体。其核心特性包括所有会话、消息与代码变更均存储于本地 SQLite,确保代码数据不出本机,并基于 Eino Graph 实现智能体推理。