跳到正文
9月2日周三
  1. 蚂蚁 inclusionAI 新仓库61

    Choruz 发布本地化人机协作空间产品

    Choruz 是一个本地优先的人机协作应用,支持人类与 AI 智能体在类似 Slack 的空间中协同工作。每个智能体运行独立 CLI,可通过消息、线程、任务和文件交接工作,支持 Claude Code、Codex、Grok 及 webhook 驱动的外部智能体,默认集成 Pi、OpenCode、MathCode 插件。

    推荐理由:原文提供了本地化协作空间的架构设计和多智能体协同机制,读者可据此评估其在开发工作流中的集成潜力。

  2. Google · AI Blog34

    Google 2026 年 8 月 AI 新闻汇总:发布 Gemini 3.7 Flash、Gemini 3.5 Transcribe 及 Pixel 11 系列

    Google 在 2026 年 8 月发布了多款 AI 产品,包括面向编程和智能体的高效模型 Gemini 3.7 Flash,以及专为实时转录设计的 Gemini 3.5 Transcribe。同期推出的 Pixel 11 系列设备搭载了 Google Tensor G6 芯片和最新的 Gemini Nano 模型。此外,Gemini 应用的月活用户已超过 10 亿。

9月1日周二
  1. Microsoft Research39

    GigaPath-Flash 与 GigaTIME-Flash:高效病理学基础模型迈向群体规模发现

    Microsoft Research 推出高效病理学基础模型 GigaPath-Flash 和 GigaTIME-Flash,显著降低了计算需求。GigaPath-Flash 参数量为 2200 万,在保持性能的同时将推理成本降至原 GigaPath 的约 1/50。这两个基于 Apache 2.0 协议开源的研究模型旨在支持大规模病理数据分析,推动群体规模的疾病生物学研究。

8月31日周一
  1. 蚂蚁 inclusionAI 新仓库58

    LLaDA-UI:基于块级扩散的多模态 GUI 智能体

    LLaDA-UI 是一个基于 MoE 的块级扩散视觉-语言 GUI 智能体,结合动态分辨率视觉编码器与 LLaDA2.0-mini-base 扩散语言骨干,通过块级扩散解码器生成推理与 GUI 动作。

    推荐理由:该研究提出基于块级扩散的多模态 GUI 智能体,结合动态分辨率视觉编码器与扩散语言骨干,支持跨平台交互,可复现其推理流程与数据生成管道。

  2. 蚂蚁 inclusionAI 新仓库55

    LLaDA-Image:基于全开源训练方案的高质量图像生成与编辑模型

    LLaDA-Image 是一个6B参数的开源统一图像生成与编辑模型家族,包含50步的Base模型和4步的Turbo蒸馏模型,支持文本生成、VQ条件生成、参考图像编辑及中英文文本渲染。模型在Qwen-Image-Bench上取得53.53(英文)和53.38(中文)的SOTA分数,提供Hugging Face和ModelScope的检查点及Diffusers推理代码,训练代码即将发布。

8月27日周四
  1. LangChain 博客49

    2026年8月:LangChain通讯 — 管理深度智能体、LLM网关及其他更新

    LangChain 本月推出管理深度智能体(Managed Deep Agents)和 LLM 网关(LLM Gateway)的公开测试版,支持一键部署、成本控制和敏感数据处理。Deep Agents v0.7 版本减少 65% 的基础输入 token,同时保持性能。Stripe 和 Apollo 已分别基于 Deep Agents 构建了企业级生产力工具和 AI 助手,显著提升了效率。

  2. LangChain 博客60

    LangChain 发布 LangGraph v0.1 与 LangGraph Cloud

    LangChain 发布 LangGraph v0.1,提供对智能体工作流的细粒度控制能力,支持条件分支、循环、人类协作与时间旅行式调试;同时推出 LangGraph Cloud,提供可扩展、容错的部署基础设施,支持一键部署、流式输出、异步任务与定时任务,并集成 LangGraph Studio 用于可视化调试与协作。

    推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。

  3. LangChain 博客58

    LangChain 和 LangGraph 发布 1.0 版本并推出新平台功能

    LangChain 和 LangGraph 发布 1.0 版本,标志着框架稳定化,新增 Insights Agent、Agent Builder(私有预览)及 LangSmith 平台的完整 agent 工程化能力,涵盖可观测性、评估、部署与无代码构建,支持长周期任务与生产级交付。

    推荐理由:原文给出了1.0版本发布、新功能上线和平台能力升级,读者可据此评估其对 agent 工程化的影响。

8月26日周三
  1. IEEE Spectrum · AI44

    新平台 Silico 让 AI 黑箱透明化

    Goodfire 推出的 Silico 平台提供多种工具以解析 AI 模型内部行为,支持用户以自然语言描述需求并自动生成实验计划。该平台已用于解析 Pleiades 表观遗传基础模型,发现其通过 DNA 片段长度模式检测阿尔茨海默病,这是首个通过逆向工程基础模型在自然科学领域取得的重要发现。

8月25日周二
  1. 智谱 GLM 新模型67

    智谱发布 GLM-5.3-Flash 多模态大模型

    智谱发布 GLM-5.3-Flash,为 GLM-5 系列首个原生多模态模型,拥有 320B 总参数和 18B 活跃参数,支持 300,000 token 上下文,采用混合稀疏与线性注意力架构及 mHC 技术,部署框架包括 SGLang、vLLM、TokenSpeed 等,可通过 reasoning_effort 参数控制推理预算,API 服务可在 Z.ai 平台使用。

    推荐理由:原文给出了模型参数、架构创新和部署框架,读者可以据此判断其在多模态和长上下文场景下的实际应用潜力。

  2. Engineering at Meta57

    Meta 发布专为 AI 规模设计的 RDMA 传输协议 MetaRoCE

    Meta 发布 MetaRoCE,这是一种专为 AI 工作负载设计的 RDMA 传输协议,适用于大规模以太网环境。MetaRoCE 通过 Open Compute Project (OCP) 开源了协议规范、参考软件实现和合规测试套件。

    推荐理由:Meta 开源了专为 AI 规模设计的 RDMA 传输协议 MetaRoCE,包含规范、参考实现和测试套件,可提升分布式训练和推理效率。

8月24日周一
  1. Import AI33

    Import AI 470:AI 在网络安全等领域加速科学发现,SPADE 框架实现环境自动生成

    METR 研究显示,AI 在 2026 年显著加速了网络安全漏洞的发现,对数学研究有轻微加速,但对 AI 研究本身的优化尚无显著影响。SPADE 框架利用 Qwen3-30B 等模型通过自我博弈,自动生成可执行的游戏和工具使用环境,以合成数据训练智能体,在 Reasoning Gym 等基准测试上提升性能。

  2. 千问 Qwen 新模型74

    千问 Qwen3.8-Flash-Next-FP8 模型发布

    千问发布 Qwen3.8-Flash-Next-FP8 模型,为基于 Qwen3.8-Flash-Next 架构的 FP8 量化版本,支持 262,144 令牌上下文,可扩展至 100 万令牌。

    推荐理由:原文公开了新架构的量化模型权重、技术细节和基准结果,读者可据此评估其在长上下文和多模态任务中的效率与性能表现。

8月21日周五
  1. Microsoft Research33

    Microsoft Research 的 Skala 1.1 提升预测性密度泛函理论精度并扩大软件集成

    Microsoft Research 发布了深度学习密度泛函交换关联泛函 Skala 1.1,其训练数据量是前代版本的 2.5 倍,在 GMTKN55 基准测试的 55 个类别中,有 32 个类别排名第一。Skala 现已集成于 CP2K,并正在整合到 Psi4、FHI-aims、ORCA 和 VASP 等主流电子结构软件中,以扩大其在科学和工业工作流程中的可及性。

8月20日周四
  1. Google 新模型31

    Google 发布 TIPS — g/14 low-res (v1) 模型

    Google 发布了 TIPS — g/14 low-res (v1) 模型,该模型包含 1.1B 视觉参数和 389M 文本参数,支持生成与文本嵌入对齐的图像空间特征。模型使用 224 分辨率,图像编码无需 ImageNet 归一化,文本编码支持最大 64 个 token。模型基于 Apache 2.0 协议开源,适用于零样本分类和空间特征可视化任务。

8月13日周四
  1. The Register · AI/ML37

    OpenWALDO 项目旨在打破专有 AI 训练模型的壁垒

    OpenWALDO 项目由 Gregory Kurtzer 发起,目标是创建一个任何人都可贡献的开源 AI 训练数据集,提升训练数据的透明度。该项目强调当前开源权重模型仍依赖封闭源训练数据,存在潜在风险与资源浪费问题。目前 OpenWALDO 数据集包含 167.3B 个参考 token,但尚未有模型基于此数据集进行训练。

8月10日周一
8月3日周一
7月31日周五
  1. DeepSeek 新模型66

    DeepSeek-V4-Flash-0731 模型正式发布,增强智能体能力并支持 DSpark 推理加速

    DeepSeek-V4-Flash-0731 正式发布,取代预览版,具备增强的智能体能力,模型结构包含 DSpark 推理加速模块。在 Terminal Bench、NL2Repo、Cybergym 等多个基准上表现优于 DeepSeek-V4-Pro(预览版),且激活参数更少。

    推荐理由:该模型在多个基准上超越了预览版,且参数激活量更小,读者可依据其推理能力与部署方式判断其在智能体场景中的适用性。

  2. Amazon Science34

    How controllers from industrial machinery can coordinate multitask machine learning 的中文标题

    Amazon Science 提出 ControlG 框架,借鉴工业控制系统中的 PID 控制器,用于协调图自监督学习中的多任务训练,避免梯度冲突。该方法通过在不同训练阶段分配计算资源给不同目标,提升了节点聚类任务的性能,随机调度在部分基准上优于 AutoSSL、WAS 等方法。ControlG 通过感知、规划和控制三个循环实现动态资源分配,基于帕累托效率理论优化多目标训练过程。

  3. The Register · AI/ML57

    开源项目 ShieldFont 发布,用投毒字体干扰 AI 网络爬虫

    开源项目 ShieldFont 发布了一种新型字体,旨在干扰 AI 网络爬虫的数据抓取。该字体利用 OpenType 的 GSUB 功能,在 HTML 源码层面对约四分之一的单词进行同词性替换,使其对人类读者显示正常,但对爬虫呈现为语义混乱的文本。项目提供了在线演示、React 组件及 CSS/CDN 集成方式,默认字体基于 Playtype 的 Optik 修改,文件大小约 800 KB。

7月29日周三
  1. Amazon Science55

    Amazon Science 发布 PatientAgentBench:面向患者交互的医疗AI智能体评估基准

    Amazon Science 发布 PatientAgentBench,一个专为评估面向患者的医疗AI智能体设计的可复现、临床验证的基准框架。该框架通过生成合成患者病历和临床场景,模拟多轮对话,评估智能体在临床安全、分诊质量、工作流准确性等六个维度的表现。

    推荐理由:该研究构建了面向患者交互的医疗AI智能体评估基准,提供了可复现的临床安全评估框架和具体失效模式,有助于指导安全智能体设计。

  2. Together AI63

    Together AI 开源 ThunderAgent,实现 2 倍吞吐的智能体推理系统

    Together AI 开源了智能体推理系统 ThunderAgent,通过将工作流抽象为可调度程序,解决了高并发下 KV 缓存颠簸和节点负载不均的问题。在 8 节点 H100 集群上,相比 SGLang Gateway 实现了 2.39 倍的加速和接近线性的吞吐扩展。该系统与 OpenAI 兼容,只需在客户端添加 `program_id` 字段即可集成现有推理后端。

    推荐理由:开源系统通过将智能体工作流抽象为可调度程序,解决了高并发下 KV 缓存颠簸和节点负载不均的问题。

7月25日周六
7月24日周五
7月21日周二
7月16日周四
  1. Mistral 新模型66

    Mistral 发布 Shieldstral-1.0-3B 多模态安全分类模型

    Mistral 发布 Shieldstral-1.0-3B,一个 3B 参数的多模态安全分类模型,支持文本、图像及图文混合内容的动态政策审核,基于自然语言政策输入返回连续安全分数,可在单 GPU 上运行,支持 32k 上下文窗口,开源 Apache 2.0 许可。

    推荐理由:原文提供了模型架构、能力指标和部署方式,读者可以据此判断其在轻量级安全审核场景中的适用性。

7月13日周一
7月10日周五
  1. Vector Institute67

    AI科学家实现科研全周期自动化

    Vector Institute与Sakana AI、UBC、牛津大学合作发布AI科学家系统,可自主完成从选题到投稿的完整科研流程。该系统v2版本无需人类代码模板,能自动生成实验代码并迭代优化。

    推荐理由:原文揭示了AI系统在科研全流程中的自主能力突破,为评估AI生成论文质量提供了可量化的基准方法。