Strata 引擎发布:12GB 显存运行 125B Qwen3.8 模型,RTX 5070 达 94 词元/秒
开发者 Niko1221 开源 Strata 引擎,可在 12GB 显存的消费级显卡上运行 125B 参数的 Qwen3.8-Flash-Next 模型,采用 MoE 专家调度和投机解码降低显存占用。
推荐理由:Strata 引擎通过 MoE 专家调度和投机解码,在 12GB 显存下实现 125B 模型推理,读者可据此评估本地部署大模型的可行性。
技术方向
开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。
115 条精选近 30 天 56 条共收录 408 条
开发者 Niko1221 开源 Strata 引擎,可在 12GB 显存的消费级显卡上运行 125B 参数的 Qwen3.8-Flash-Next 模型,采用 MoE 专家调度和投机解码降低显存占用。
推荐理由:Strata 引擎通过 MoE 专家调度和投机解码,在 12GB 显存下实现 125B 模型推理,读者可据此评估本地部署大模型的可行性。
Tanmay Sah 发布了开源教育框架 ai-agents-zero-to-hero,提供从零构建 AI 智能体的纯 Python 教程,涵盖 Observe-Decide-Act 循环、工具调用、状态管理、多智能体系统等内容,支持无依赖运行,可接入 OpenAI、Anthropic、Gemini 或 Ollama 等模型。
推荐理由:原文提供了从零构建 AI 智能体的纯 Python 教程,读者可据此理解智能体核心机制并复用代码结构。
Schema-guard是一个开源工具,通过在代码仓库中维护真实数据库表结构的快照(仅含表名和列名),在AI智能体生成SQL前进行校验,阻止其因依赖过时文档或命名习惯而虚构列名。
推荐理由:该工具通过实时校验SQL与真实表结构,防止AI智能体因依赖过时文档而生成错误列名,可直接集成到开发流程中。
Nova Sprint 是一个开源工具,用于在多个AI模型和框架间协调工作流,通过定义任务卡片、依赖关系和阶段门控,实现自动化的任务分配、状态追踪和流程推进。它将工作计划、依赖、评审和落地状态存储在外部系统,避免依赖聊天记录,提升协作可靠性。支持并行任务、跨流依赖、自动与手动门控,并提供实时仪表盘和文档。项目开源,MIT许可证,可立即使用。
推荐理由:原文提供了可复用的协调工作流框架和开源实现,读者可以据此构建跨模型的AI协作系统。
Reflection AI 发布首个开源权重模型 Beam,参数量501B,上下文窗口达100万token,专为编码、推理和智能体任务设计。模型在Terminal Bench v2.1和SWE-bench Verified上分别取得80.1和80.9分,效率优于GLM-5.2,计划本月开放权重,采用Apache 2.0许可证。
推荐理由:原文提供了模型参数、训练规模、性能基准和开源计划,读者可据此判断其在开源模型中的定位与效率优势。
Metagente 是一个用于构建 AI 智能体的轻量级语言,支持 MCP 和 A2A 协议,可直接运行无需 Python 环境。它提供单个 Rust 二进制文件,包含目标、工具、输入和回复的声明式语法,支持动态调用其他智能体并具备安全权限控制。项目已开源,提供示例、文档和构建指南,当前版本为 v0.1.1。
推荐理由:原文提供了可直接运行的 agent 语法示例和下载方式,读者可以快速验证其在无 Python 环境下构建智能体的能力。
Together AI 推出 Together Link,通过一个命令将 Claude Code、ChatGPT Codex、OpenCode 等现有编码工具连接至其平台上的开源模型,如 Kimi K3、GLM 5.3、DeepSeek V4.1 Flash,实现成本降低超50%。支持自动路由,根据任务难度选择模型,无需更改工作流,费用基于现有 Together API key 计费。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
SlopTotal 是一个开源、自托管的AI文本检测工具,可在CPU上运行,支持粘贴文本、上传PDF/Word文件或输入URL进行检测。它集成23个独立检测引擎(包括神经分类器、统计方法和语言启发式),通过校准集成给出最终评分,并提供每个引擎的详细结果。
推荐理由:原文提供了23个检测引擎的并行评分机制、自托管部署方式和准确率基准,读者可据此评估其在本地AI内容检测中的实际可用性。
Anil Madhavapeddy指出,AI智能体可从公开漏洞线索生成利用代码,导致传统披露禁令失效;GPT-4智能体在15漏洞基准中凭CVE描述成功利用87%。
推荐理由:AI智能体能从公开线索快速生成漏洞利用,迫使开源项目重新思考披露与修复流程。
Hindsight 是一个开源的智能体记忆系统,旨在让 AI 智能体具备学习能力而非仅记忆对话历史。它通过生物启发式数据结构组织记忆,支持 retain、recall、reflect 三种操作,已在 LongMemEval 基准上取得 SOTA 性能。
推荐理由:原文提供了部署方式、集成方法和基准测试结果,读者可以据此判断它如何增强现有智能体的记忆能力。
Moching 发布桌面 AI 智能体 v26.9.30-1,支持 Windows 和 macOS,内置 219 个工具覆盖系统控制、浏览器自动化、办公套件、媒体处理、AI 生成、屏幕感知、HID 控制、记忆知识、代码智能和核心实用工具。
推荐理由:原文给出了219个内置工具、跨平台支持和自主执行循环,读者可以据此判断它如何实现端到端的桌面自动化。
初创公司 TypeSafe AI 发布了决策模型 Jev,其通过强化学习将输入归类到预设输出,而非生成文本,日处理量已达 1 万亿 token。OpenAI、Databricks、Cloudflare 和亚马逊等公司近期也推出了类似功能的工具或模型,形成了一个与生成式模型互补的决策模型新类别。
推荐理由:原文梳理了决策模型的技术路线和多家公司的跟进动作,读者可以了解这一新兴类别如何与生成式模型形成互补。
Meta 宣布开源项目 Muse Gadgets,允许开发者使用 ESP32 开发板或树莓派等 Linux 设备为个人 AI 智能体 Muse 打造自定义硬件。
推荐理由:原文提供了详细的硬件支持列表、权限配置说明和安全风险提示,开发者可以据此评估其可实施性和潜在风险。
Recly 是一款免费开源应用,可将 Galaxy Watch 或 Apple Watch 变为 AI 录音笔,支持本地免费转录,并将笔记任务交给用户已有的 AI 智能体。
推荐理由:作者开源了将智能手表变为录音笔的方案,并详细说明了本地转录和与现有AI集成的技术路径。
SCM 是一款 macOS 上的本地化 AI 搜索工具,支持对照片和视频每一帧进行语义搜索,无需上传或账户。通过本地视觉模型、OCR、Whisper 语音识别和 LLM 问答(可选)实现多模态检索,支持按场景、文本、对话内容搜索,并提供标签、快捷键和智能库管理。
推荐理由:原文详细说明了本地化AI搜索功能、多模态检索模式和隐私设计,读者可据此判断其在个人媒体管理中的实际可用性。
StartLux 开源了决策模型 StartLux-Decision,并一次性发布了 0.8B、2B、4B、9B、27B 五个参数版本。在 Decision Index 0.2.1 评测中,其 27B 版本得分 63.88,在 38 项基准中有 31 项高于 Jev 1.13;在另一套七项评测中平均准确率达 91.82%。
推荐理由:原文提供了详细的基准测试对比和多种规格的量化版本,读者可以评估其在不同部署场景下的适用性。
AWS 团队开源了 Pizza Bot,这是一个自托管应用,旨在让 AI 智能体在后台运行任务并通过收件箱式界面返回结果。它支持定时或 Webhook 触发的任务,可将工作委派给专用智能体,并在需要时暂停等待人工批准。该工具采用客户端-服务器架构,将智能体状态、线程和日志持久化存储在用户本地文件夹中,数据仅发送至用户配置的模型提供商和明确启用的 MCP 服务器。
推荐理由:原文介绍了这个开源工具的设计理念、核心功能与本地优先架构,读者可以了解它如何管理异步任务流。
DeepSeek 为其开源智能体框架 DeepSeek Harness (dsh) 发布了 v0.2 预览版,并推出了官方桌面应用,支持 macOS (Apple silicon) 和 Windows (64-bit)。
推荐理由:作为开源智能体框架,其桌面应用和插件化架构为开发者提供了新的本地部署和扩展选择。
Archestra 发布了开源安全引擎 OpenAPPA,旨在防止由提示词注入或模型幻觉导致的数据泄露。该引擎在 Bench-Corp 和 AgentThreatBench 安全基准测试中实现了 0% 的攻击成功率,任务完成率为 89%。
推荐理由:原文提供了开源安全引擎 OpenAPPA 在两大基准测试中的零攻击成功率数据,并与 Claude Code、Microsoft FIDES 进行了对比。
Microsoft 与 Hugging Face 联合发布智能体评测基准 ThinkingBox,通过检查数据库最终状态和副作用而非工具调用来评估智能体。该研究在 507 个有状态工作流上对 12 个 LLM 模型进行了 20 次重复测试,发现模型的一次性成功率(pass@1)与始终正确率(20/20)之间存在巨大差距。
推荐理由:该研究通过检查数据库最终状态而非工具调用来评估智能体,揭示了模型一次性成功与可靠执行之间的显著差距。