跳到正文
10月4日周日
  1. Hugging Face Blog62

    Microsoft 与 Hugging Face 发布智能体评测基准 ThinkingBox

    Microsoft 与 Hugging Face 联合发布智能体评测基准 ThinkingBox,通过检查数据库最终状态和副作用而非工具调用来评估智能体。该研究在 507 个有状态工作流上对 12 个 LLM 模型进行了 20 次重复测试,发现模型的一次性成功率(pass@1)与始终正确率(20/20)之间存在巨大差距。

    推荐理由:该研究通过检查数据库最终状态而非工具调用来评估智能体,揭示了模型一次性成功与可靠执行之间的显著差距。

10月3日周六
  1. PyTorch 博客42

    使用 Helion 为 vLLM 构建高性能可移植的线性后端

    研究团队将 Helion 集成到 vLLM 的线性后端,以探索其自动调优的高层内核 DSL 如何提升大语言模型推理性能并降低内核实现复杂度。在 NVIDIA Hopper GPU 上,该后端通过逐形状调优与混合调度,在评估的模型中性能超越了 vLLM 默认的 CUTLASS 和 DeepGEMM 后端,部分工作负载的吞吐量提升超过 10%。

  2. PyTorch 博客13

    PyTorch 推出新的 PyTorch Certified Associate (PTCA) 认证路径

    PyTorch 与 Linux Foundation Education 合作推出了新的 PTCA 认证路径,将四个自定进度的学习模块与 PTCA 认证考试整合为一个结构化学习体验。该路径涵盖张量操作、数据处理、神经网络构建和模型优化等核心技能,总计包含 15-17 小时的学习与实践。该认证旨在验证初学者对 PyTorch 核心概念和工作流程的理解。

10月2日周五
10月1日周四
  1. Cloudflare · AI59

    Cloudflare Workers AI 接入 EuroLLM 和 Apertus 两个欧洲开源模型

    Cloudflare 宣布其 Workers AI 平台接入两个欧洲开源大模型 EuroLLM 和 Apertus,并开放访问申请。EuroLLM 支持 35 种语言,包括所有 24 种欧盟官方语言;Apertus 在超过 1500 种语言的 15 万亿 token 上训练,其架构、权重、训练数据和方法均已公开。

    推荐理由:原文介绍了两个欧洲开源模型接入其平台,并提供了具体的技术细节和申请入口,读者可以据此评估其多语言能力和合规设计。

  2. PyTorch 博客38

    PyTorch Conference North America 2026:聚焦 Ray 的分布式 AI 指南

    PyTorch Conference North America 2026 即将在圣何塞举行,为开源 AI 社区提供交流平台。会议指南重点介绍了多场关于分布式计算框架 Ray 的议题,涵盖其与 Kubernetes 的协同演进、在 LinkedIn 和 Uber 等公司的生产级数据与模型训练应用,以及在模型推理与后训练阶段的关键作用。

9月30日周三
  1. PyTorch 博客41

    Torch Spyre 如何通过 PyTorch CRCR 实现上游变更与下游信心的集成

    Torch Spyre 基于 PyTorch 跨仓库 CI 中继(CRCR)实现了 L2 级集成,通过智能体流程从代码和执行证据中筛选并重组测试,并使用声明式 YAML 框架在不修改上游测试的情况下适配它们。这套方法旨在为任何通用的 privateuse1 设备提供可扩展的测试解决方案,并计划与 PyTorch 社区合作,将可复用部分上游化。

  2. Cloudflare · AI65

    Cloudflare AI Gateway 推出 Auto Router 公开测试版以降低 AI 成本

    Cloudflare 在 AI Gateway 中发布 Auto Router 公开测试版,通过自动将请求路由到性价比更高的模型来帮助组织降低 AI 成本。内部测试显示,相比仅使用 OpenAI Sol 和 Anthropic Claude Opus 等前沿模型,Auto Router 可节省高达 30% 的成本。

    推荐理由:Cloudflare 通过其 AI Gateway 推出自动路由功能,旨在为组织在内部部署 AI 时提供成本控制方案。

  3. Hugging Face · 每日论文45

    DEFINE:用于零样本 TTS 的示例引导口音控制框架

    DEFINE 框架通过独立的音频示例分别控制说话人身份和目标口音,在单次推理中实现口音强度的连续调节。该框架基于 F5-TTS 构建,使用参数高效的 LoRA 进行适配,无需推理时的口音标签或后合成波形转换。在训练集内口音上,口音引导可将口音探测准确率从 6.5% 提升至 19.6%,并能将口音控制泛化到训练集外的部分口音上。

9月28日周一
9月25日周五
9月24日周四
9月18日周五
  1. Vercel 博客56

    Vercel 与 Hacktron 合作披露并修复 libheif 远程代码执行漏洞

    Vercel 披露了与安全研究团队 Hacktron 合作处理 libheif 远程代码执行漏洞的完整过程。该漏洞影响 Next.js 图像优化链,Vercel 在平台层面禁用了 AVIF 优化,并协调 sharp、libvips 和 libheif 的维护者发布了上游修复。libheif 于 8 月 25 日发布了修复版本 v1.23.2,Next.js 也同步发布了安全更新。

    推荐理由:原文完整记录了从漏洞发现、协调上游修复到平台级缓解的全过程,为处理开源供应链安全问题提供了具体案例。

9月17日周四
  1. Vercel 博客62

    Vercel AI Gateway 2026年9月生产指数:开源模型处理56%的token量,Astra支出是Fable 5.1的两倍

    Vercel AI Gateway 2026年9月生产指数显示,8月开源模型首次处理了网关56%的token量,而2025年12月这一比例还不到10%。平均token价格连续第三个月下降,8月环比下降23.2%。

    推荐理由:基于网关生产数据的月度分析,揭示了开源模型在用量上首次反超闭源模型、以及用户在不同模型间迁移的成本驱动模式。

9月16日周三
  1. Mistral AI40

    Mistral 与 Mozilla 合作将开放、私密且多语言的 AI 带入网页浏览器

    Mistral AI 与 Mozilla 达成合作,为 Firefox 的 AI 浏览助手 Smart Window(测试版)提供模型支持。该功能将首先在法国和北美推出,预计今年晚些时候扩展至英国和德国。此次合作旨在将基于区域语言和文化背景微调的 Mistral 开放模型,与 Firefox 的隐私优先传统相结合,为用户提供更具控制力和本地化体验的 AI 浏览助手。

  2. Together AI33

    Together AI 推出从闭源到开源模型的迁移策略

    Together AI 发布从闭源模型向开源模型(OSM)迁移的完整策略,支持通过托管服务实现数周至数月的快速迁移,显著降低技术复杂度。该策略强调基于真实业务负载的评估,推荐使用 FrontierCode、LMArena、τ-bench 等基准,并结合实际流量回放进行性能与成本验证。最终目标是实现与闭源模型相当或更优的准确率与延迟表现,支持企业平稳过渡至开源生态。

9月11日周五
  1. Together AI50

    Together AI 扩展微调服务,支持更多模型、实时指标与精细控制

    Together Fine-Tuning 新增对 GLM-5.3、Kimi K2.7、Qwen 3.8-27B 等 15 个开源模型的支持,覆盖 0.8B 至 405B 参数规模。服务提供训练中实时指标追踪、专家层 LoRA 微调、自动早停与任意有效批大小支持,验证损失下降时自动终止训练并退款。部分模型训练价格下调最高达 70%,支持通过 API、CLI 和 UI 全流程管理微调任务。

9月9日周三
9月8日周二
  1. Mistral AI68

    Mistral AI 完成 30 亿欧元 D 轮融资,估值超 210 亿欧元

    Mistral AI 宣布完成 30 亿欧元 D 轮融资,投后估值超过 210 亿欧元,这是欧洲科技公司有史以来规模最大的股权融资轮。本轮融资由三星电子领投,将用于扩展其前沿研究、计算能力和基础设施,以构建集开放权重模型、基础设施和产品于一体的全栈主权AI解决方案。公司目前业务覆盖 20 个国家,为包括空客、ASML 和汇丰在内的超过 125 家全球企业的关键任务 AI 转型提供支持。

    推荐理由:作为欧洲AI公司最大规模的单轮融资,这笔资金将用于扩展其全栈主权AI能力,反映了市场对可控、开放AI基础设施的需求变化。

8月31日周一
  1. Ollama 博客44

    Ollama 推出透明按 token 计费的新订阅计划

    Ollama 的 Pro、Max 和 Team 订阅计划现已采用透明的按 token 计费模式,每个计划均包含每月使用额度。Pro 计划每月 20 美元含 60 美元额度,Max 计划每月 100 美元含 300 美元额度,Team 计划每月 500 美元含 1000 美元共享额度。新定价无服务费和数据保留,支持 Claude Code 和 Codex 等流行编程智能体,并提供 API。

8月29日周六
8月27日周四
8月26日周三
  1. MIT News · 人工智能34

    MIT 研究人员开发 CrysVCD 框架提升 AI 生成材料的稳定性

    MIT 研究人员开发了名为 CrysVCD 的框架,能在材料生成过程初期通过约束化学价态规则,显著提升生成材料的稳定性。在《自然·计算科学》发表的论文中,该框架使近 70% 的计算材料生成通过了严格的晶格动力学稳定性测试,并能生成具有特定目标属性(如高导热率)的材料。该方法可与现有及未来的扩散模型或大语言模型结合,将稳定材料的生成效率提升一个数量级,大幅降低筛选过程的计算成本。

8月25日周二
  1. Mistral AI38

    Mistral 与 HUMAIN 宣布战略合作以推进沙特及中东地区主权 AI

    Mistral 与 HUMAIN 宣布达成一项价值数亿欧元的战略合作,共同推进沙特阿拉伯及中东地区的主权 AI。合作将聚焦于 AI 基础设施、先进模型开发及本地化部署,初期重点包括网络安全和语音领域,并计划开发在阿拉伯语表现强劲的前沿模型。双方还将探索利用 HUMAIN 的数据中心基础设施来满足当地不断增长的计算需求。

8月17日周一
  1. Replit 博客40

    Replit 推出大规模管理功能:Admin API、审计日志和工作区设置

    Replit 发布面向企业的大规模管理功能更新,包括 Admin API、审计日志和工作区设置。Admin API 测试版现已上线,审计日志支持超过 50 种事件并默认保留 30 天,工作区设置的首个功能将于本周末推出。这些更新旨在帮助企业管理员集中管理 AI 工具采用策略、监控活动并实现合规控制。

8月11日周二
  1. Mistral AI68

    Mistral 推出区域推理端点、优先服务层并支持第三方开源模型

    Mistral 宣布推出 Mistral Regional Endpoints 和 Mistral Priority Tier,以增强推理的区域控制和生产级可靠性。其平台将开始支持第三方开源模型,首个为 Z.ai 的 GLM-5.2。Mistral 还联合企业成立联盟,通过欧洲计算单位(ECUs)来确保欧洲的长期 AI 算力供应,目标是到 2030 年建设高达 1 GW 的算力容量。

    推荐理由:Mistral 通过推出区域端点和优先服务层,为欧洲客户提供了符合数据驻留和监管要求的 AI 基础设施选项。

  2. Ollama 博客70

    NVIDIA Nemotron 3.5 Lightning 模型在 Ollama 上可用

    NVIDIA Nemotron 3.5 Lightning 模型已在 Ollama 上提供,这是一个专为长期运行的智能体设计的 300 亿参数开源模型。它采用混合专家架构,每 token 仅激活 30 亿参数,支持高达 100 万 token 的上下文,并针对本地 NVIDIA RTX 设备进行了优化,可实现比同类开源模型高 4 倍的吞吐量。

    推荐理由:原文提供了模型的核心架构、性能基准和本地部署优势,读者可以据此评估它是否适合作为长期运行的智能体基座。

8月10日周一
  1. Ollama 博客57

    Meta Superintelligence Labs 的 Muse Glimmer 模型已在 Ollama 上线

    Meta Superintelligence Labs 发布的首个开源多模态模型 Muse Glimmer 现已可在 Ollama 上运行。这是一个 30B 参数、专为本地智能体工作负载设计的模型,拥有 128K+ 上下文长度,采用 Apache 2.0 许可证。

    推荐理由:原文提供了模型参数、许可证、支持的智能体框架和性能优化细节,读者可以据此评估其本地部署的适用性。

7月29日周三
  1. Berkeley AI Research57

    伯克利研究:K-Search 通过 CUDA 到 MLX 的翻译层将内核优化知识迁移至 Apple Silicon

    伯克利 AI 研究团队扩展了 K-Search 框架,为其增加了 MLX 后端,并开发了一个结构化的 CUDA-to-MLX 翻译层,能够将 NVIDIA CUDA 内核的优化知识自动迁移到 Apple Silicon 上。

    推荐理由:研究提出了一种将 NVIDIA CUDA 内核优化知识自动迁移到 Apple MLX 框架的方法,为跨硬件生态的 AI 计算性能优化提供了新思路。

7月23日周四
  1. Together AI37

    Together AI 推出面向生产环境的开源权重模型推理平台

    Together AI 推出专为生产环境设计的开源权重模型推理平台 Together Dedicated Model Inference。该平台每月处理超 400 万亿 tokens 的经验,可为用户提供对模型、性能、成本和功能的完全控制,并实现部署启动速度提升约 4 倍。企业可部署来自 Together 模型平台或自带的开源权重及微调模型,并选择经过优化的硬件配置。

7月10日周五
  1. fal 博客64

    fal 博客:无损实现亚秒级 Ideogram v4 图像生成的技术路径

    fal 团队通过量化感知蒸馏、时间步蒸馏和内核融合等技术,将 Ideogram v4 在 1K 分辨率下的单图生成时间从 2.75 秒降至 0.44 秒,实现 6 倍加速且无可见质量损失。核心方法包括将模型量化至 FP4 并融合 RMSNorm 等后处理算子、将分类器引导蒸馏为单分支前向,以及通过分布匹配蒸馏将去噪步骤大幅减少。

    推荐理由:原文详细拆解了从量化、蒸馏到内核融合的完整技术路径,为追求极致推理性能的团队提供了可复现的工程方案。

7月9日周四
7月3日周五
  1. Vector Institute35

    Vector Institute 研究人员在 ICML 2026 推进生成式 AI、负责任 AI 与科学发现

    Vector Institute 研究人员在第 33届国际机器学习大会(ICML 2026)上展示了73篇被接收论文,涵盖强化学习、后训练、生成式AI、视频生成、多模态系统及AI治理等多个前沿领域。其中11篇被选为焦点论文,创下该研究所在ICML的最佳纪录。研究工作还涉及科学发现应用,包括基因组学、量子化学和材料建模。

7月1日周三
  1. Berkeley AI Research17

    2026 BAIR 毕业生成果展示

    伯克利人工智能研究实验室(BAIR)庆祝其2026届博士毕业生在人工智能与机器学习前沿领域取得的成就。毕业生研究方向涵盖机器人、大语言模型与推理、计算机视觉、生成模型、AI安全、人机交互及AI在科学与医疗等领域的应用。多位毕业生将前往学术界、工业研究实验室及创业公司继续其职业生涯。

6月30日周二
6月23日周二
  1. Together AI62

    Together AI 发布多 GPU 内核生成基准 ParallelKernelBench,前沿模型表现不佳

    Together AI 发布多 GPU 内核生成基准 ParallelKernelBench,用于评估大模型编写跨 GPU 通信 CUDA 内核的能力。在 87 个真实代码问题中,表现最佳的 GPT-5.5 在单次尝试下仅正确解决 28 个问题,其中仅 22 个快于 PyTorch + NCCL 基线。研究揭示了模型在协调 GPU 间通信、数据分区和选择最优传输机制方面存在根本性困难。

6月17日周三
  1. Together AI57

    Together AI 评测:Kimi K2.7 Code 与 Claude Fable 5 生成落地页的成本与质量对比

    Together AI 对比了 Kimi K2.7 Code 与 Claude Fable 5 生成 12 个落地页的成本和质量。实验显示,Kimi K2.7 Code 的平均成本比 Fable 5 低约 94%,在结合定制设计灵感 MCP 服务器后,其输出质量与 Fable 5 相近。所有生成的页面、成本细目和 GPT-5.5 的评分结果都发布在 OVSC 网站上。

    推荐理由:原文通过具体实验和成本对比,展示了开源模型在特定工作流中结合定制化工具的实际效益。

6月11日周四
  1. Ollama 博客58

    Ollama 发布 MLX 引擎更新,在 Apple Silicon 上实现最高性能

    Ollama 更新其 MLX 引擎,在 Apple Silicon 上实现了迄今为止的最高性能,支持 NVIDIA 的 NVFP4 量化格式以减少质量损失,并引入快照系统优化 Agent 工作流。新引擎输出速度提升最高达 20%,并允许数据中心优化的模型在桌面端运行。用户可通过下载最新版 Ollama 并使用 `ollama run gemma4:12b-mlx` 命令体验。

    推荐理由:Ollama 官方介绍了其 MLX 引擎在 Apple Silicon 上的多项性能优化,包括支持 NVFP4 量化格式和新的快照系统,对本地部署和 Agent 工作流有直接影响。