跳到正文
9月7日周一
  1. TLDR AI22

    Claude 证明费马定理 🧮,自动化 AI 研究员 🔬,Z1 效率芯片 ⚡

    Claude 在 11 天内使用 Lean 完成费马大定理的首个完整计算机验证证明,涉及 1300 万行代码并证明了 29500 个中间定理。该证明通过 Prove2Me 和 Lean 验证,展示了 AI 在数学证明形式化中的潜力。OpenAI 计划到 2028 年 3 月开发自动化 AI 研究员,以提升研究效率并保持人类监督。

9月5日周六
  1. Google · Gemini 博客49

    Gemini 中现可创作最佳音轨:Lyria 3.5 可用

    Google 的音乐生成模型 Lyria 3.5 已在 Gemini 应用和 Gemini API 中面向全球用户推出。该模型提供更具表现力的人声和更丰富的编曲,用户可在应用内选择流派、人声/器乐风格,并使用新模板快速创作。Lyria 3.5 也通过 Google Flow Music、Google AI Studio 和 Google Vids 提供给艺术家、开发者和技术人员使用。

9月3日周四
  1. Google DeepMind66

    Google DeepMind 发布 WeatherNext 3 全球气象AI模型

    Google DeepMind 发布 WeatherNext 3,引入实时卫星数据、每小时更新、5公里分辨率,提升降水预测精度,并集成至 Search、Gemini、Maps 等产品。该模型通过直接学习观测数据,实现更精准的局部天气预测,尤其改善了拉丁美洲、非洲和亚太地区覆盖。

    推荐理由:原文给出了实时卫星数据接入、小时级更新和分辨率提升等关键变化,读者可据此评估其对气象服务的影响。

  2. The Register · AI/ML46

    AI 辅助采蘑菇是危险的尝试:主流模型识别毒蘑菇错误率堪忧

    一项测试显示,主流 AI 模型在识别蘑菇物种时错误率很高,可能将致命毒蘑菇误判为可食用。表现最佳的 Gemini-3.8-flash 首次猜测正确率仅为 65%,而 Qwen3.8-27b 将毒蘑菇误判为可食用的比例高达 36%。研究者警告,不应依赖 AI 判断蘑菇安全性,因为单张照片不足以准确识别,错误可能带来致命后果。

9月2日周三
  1. Google · AI Blog34

    Google 2026 年 8 月 AI 新闻汇总:发布 Gemini 3.7 Flash、Gemini 3.5 Transcribe 及 Pixel 11 系列

    Google 在 2026 年 8 月发布了多款 AI 产品,包括面向编程和智能体的高效模型 Gemini 3.7 Flash,以及专为实时转录设计的 Gemini 3.5 Transcribe。同期推出的 Pixel 11 系列设备搭载了 Google Tensor G6 芯片和最新的 Gemini Nano 模型。此外,Gemini 应用的月活用户已超过 10 亿。

9月1日周二
  1. Weaviate 博客50

    Weaviate 如何从PDF中的图表和表格提取语义

    Weaviate 提供一种无需OCR的RAG方法,通过多向量模型直接处理PDF页面图像,提取图表和表格中的语义信息。该方法将每页作为独立对象嵌入,利用MaxSim匹配查询与页面区域,支持拖拽上传和Python部署。示例中对NVIDIA财报的查询返回了包含趋势图表的页面,Query Agent可生成带图像引用的合成答案。

  2. Microsoft Research39

    GigaPath-Flash 与 GigaTIME-Flash:高效病理学基础模型迈向群体规模发现

    Microsoft Research 推出高效病理学基础模型 GigaPath-Flash 和 GigaTIME-Flash,显著降低了计算需求。GigaPath-Flash 参数量为 2200 万,在保持性能的同时将推理成本降至原 GigaPath 的约 1/50。这两个基于 Apache 2.0 协议开源的研究模型旨在支持大规模病理数据分析,推动群体规模的疾病生物学研究。

8月31日周一
  1. 蚂蚁 inclusionAI 新仓库58

    LLaDA-UI:基于块级扩散的多模态 GUI 智能体

    LLaDA-UI 是一个基于 MoE 的块级扩散视觉-语言 GUI 智能体,结合动态分辨率视觉编码器与 LLaDA2.0-mini-base 扩散语言骨干,通过块级扩散解码器生成推理与 GUI 动作。

    推荐理由:该研究提出基于块级扩散的多模态 GUI 智能体,结合动态分辨率视觉编码器与扩散语言骨干,支持跨平台交互,可复现其推理流程与数据生成管道。

  2. 蚂蚁 inclusionAI 新仓库55

    LLaDA-Image:基于全开源训练方案的高质量图像生成与编辑模型

    LLaDA-Image 是一个6B参数的开源统一图像生成与编辑模型家族,包含50步的Base模型和4步的Turbo蒸馏模型,支持文本生成、VQ条件生成、参考图像编辑及中英文文本渲染。模型在Qwen-Image-Bench上取得53.53(英文)和53.38(中文)的SOTA分数,提供Hugging Face和ModelScope的检查点及Diffusers推理代码,训练代码即将发布。

8月27日周四
  1. 千问 Qwen 新模型52

    千问发布Qwen-Drive-1.0-4B自动驾驶多模态模型

    千问发布Qwen-Drive-1.0-4B,一个统一3D感知、视觉问答与运动规划的自动驾驶多模态基础模型。该模型基于Qwen3.5-4B架构,通过外部BEV感知头和Planning Expert模块扩展能力,支持开放环路、伪闭环和闭环评估,在多个自动驾驶基准上表现领先。模型权重与代码已开源,提供SFT和RL两种规划专家版本,支持推理与部署。

8月25日周二
  1. 智谱 GLM 新模型67

    智谱发布 GLM-5.3-Flash 多模态大模型

    智谱发布 GLM-5.3-Flash,为 GLM-5 系列首个原生多模态模型,拥有 320B 总参数和 18B 活跃参数,支持 300,000 token 上下文,采用混合稀疏与线性注意力架构及 mHC 技术,部署框架包括 SGLang、vLLM、TokenSpeed 等,可通过 reasoning_effort 参数控制推理预算,API 服务可在 Z.ai 平台使用。

    推荐理由:原文给出了模型参数、架构创新和部署框架,读者可以据此判断其在多模态和长上下文场景下的实际应用潜力。

8月24日周一
  1. 千问 Qwen 新模型74

    千问 Qwen3.8-Flash-Next-FP8 模型发布

    千问发布 Qwen3.8-Flash-Next-FP8 模型,为基于 Qwen3.8-Flash-Next 架构的 FP8 量化版本,支持 262,144 令牌上下文,可扩展至 100 万令牌。

    推荐理由:原文公开了新架构的量化模型权重、技术细节和基准结果,读者可据此评估其在长上下文和多模态任务中的效率与性能表现。

8月20日周四
  1. Google 新模型31

    Google 发布 TIPS — g/14 low-res (v1) 模型

    Google 发布了 TIPS — g/14 low-res (v1) 模型,该模型包含 1.1B 视觉参数和 389M 文本参数,支持生成与文本嵌入对齐的图像空间特征。模型使用 224 分辨率,图像编码无需 ImageNet 归一化,文本编码支持最大 64 个 token。模型基于 Apache 2.0 协议开源,适用于零样本分类和空间特征可视化任务。

8月13日周四
  1. Microsoft Research38

    MindTopo 揭示多模态大语言模型的空间推理能力

    Microsoft Research 推出 MindTopo 基准,用于评估多模态大语言模型对连通性、包围、顺序、分离和绳结等拓扑关系的理解能力。测试发现,模型在静态图像识别任务上的表现远优于需要规划与交互的任务,表明其难以在动态场景中维持对拓扑结构的一致性理解。这一差距凸显了在机器人学和交互式环境等需要可靠决策的领域,提升 AI 系统拓扑推理能力的重要性。

8月12日周三
  1. IEEE Spectrum · AI32

    Inside the Data Bottleneck Slowing Visual and Physical AI

    超过700名从业者参与的2026年调查显示,数据工作而非数据收集是决定视觉与物理AI系统能否成功部署的关键因素。78%的团队已从该领域获得可衡量价值,但74%仍认为其投资不足。成功落地的团队在数据处理上投入的时间是遇到困难团队的近3倍,而标注工作因大量数据被丢弃而显得低效且成本高昂。

8月10日周一
  1. Ollama 博客57

    Meta Superintelligence Labs 的 Muse Glimmer 模型已在 Ollama 上线

    Meta Superintelligence Labs 发布的首个开源多模态模型 Muse Glimmer 现已可在 Ollama 上运行。这是一个 30B 参数、专为本地智能体工作负载设计的模型,拥有 128K+ 上下文长度,采用 Apache 2.0 许可证。

    推荐理由:原文提供了模型参数、许可证、支持的智能体框架和性能优化细节,读者可以据此评估其本地部署的适用性。

8月7日周五
  1. MiniMax 新模型60

    MiniMax 发布音乐生成模型 MiniMax Music 3

    MiniMax 发布音乐生成模型 MiniMax Music 3,支持基于歌词和音乐描述生成最长五分钟的完整歌曲,采用 8B 全局 LLM 与 0.6B 局部 LLM 的混合架构,结合 Flow Matching 和 Flow-VAE 进行连续隐状态合成,输出 32 kHz 16-bit 立体声 WAV 音频。

    推荐理由:原文详细说明了模型架构、控制方式和部署方法,读者可据此判断其在音乐创作中的实际可用性。

8月1日周六
  1. Together AI72

    月之暗面发布 Kimi K3:2.8万亿参数开源模型,支持1M上下文与多模态

    月之暗面发布 Kimi K3,2.8万亿参数开源模型,为首个3万亿参数级开源模型,支持1M上下文、多模态输入和动态工具加载。Together AI 提供 API 接入,支持 OpenAI 兼容调用,推理深度可调,定价按 token 计费,缓存命中输入价为每百万 token 0.30 美元。模型在 DeepSWE、BrowseComp 等基准上表现领先,支持结构化输出、流式响应和保留思考历史。

    推荐理由:原文提供了模型参数、架构创新、API 使用方式和定价,读者可据此判断其在长上下文、推理和多模态任务中的实际部署潜力。

7月30日周四
  1. Replit 博客52

    Replit 推出 Replit Design 设计套件

    Replit 发布新的创意套件 Replit Design,旨在让用户快速将想法转化为设计。它内置 Ambient Intelligence 引导设计流程,支持调用 Claude、GPT-5、Gemini、Kimi 和 GLM 等模型,并集成了 Mobbin UI/UX 参考库和设计系统。该功能现已对所有用户开放。

7月28日周二
  1. MiniMax 新模型78

    MiniMax 发布新一代开源多模态视频模型 H3

    MiniMax 发布开源多模态视频生成模型 H3,支持文本、图像、视频、音频的统一理解与生成,可输出最高 2K 分辨率、15 秒时长的视频并带有立体声。模型包含 H3-Context-IR、H3-Base 和 H3-Regenerate-2K 三个模块,支持多种输入模式如文本到视频(T2VA)、首尾帧到视频(FL2VA)和参考多模态到视频(Ref2VA)。

    推荐理由:原文提供了模型架构、输入输出规范和部署方式,读者可以据此判断其在多模态视频生成中的实际应用潜力。

7月23日周四
  1. Vector Institute54

    Vector Institute 发布多模态混合专家模型研究论文

    Vector Institute 发布关于多模态混合专家(MoE)模型的研究论文,系统分析了从稀疏路由到多模态部署的架构原理与训练挑战,实证揭示了模型在早期层按模态路由、深层按语义路由的结构演化规律,并提出通过QLoRA、Flash Attention 2与lm_head预钩子实现35.26B参数模型在四张A100 GPU上的可训练性,同时指出专家并行是长期可行方向。

    推荐理由:原文通过实证分析揭示了多模态MoE模型在路由机制与训练实践中的关键规律,为后续优化提供了可复用的方法论。

7月16日周四
  1. Mistral 新模型66

    Mistral 发布 Shieldstral-1.0-3B 多模态安全分类模型

    Mistral 发布 Shieldstral-1.0-3B,一个 3B 参数的多模态安全分类模型,支持文本、图像及图文混合内容的动态政策审核,基于自然语言政策输入返回连续安全分数,可在单 GPU 上运行,支持 32k 上下文窗口,开源 Apache 2.0 许可。

    推荐理由:原文提供了模型架构、能力指标和部署方式,读者可以据此判断其在轻量级安全审核场景中的适用性。

  2. MIT News · 人工智能44

    MIT 与 IBM 研究人员开发 GIFT 系统,提升 AI 将 2D 设计转为 3D CAD 模型的性能

    MIT 与 IBM 等机构的研究人员开发了名为 GIFT 的系统,能指导视觉语言模型自动将 2D 设计图转换为更准确、功能更完善的 CAD 程序。该系统通过让模型从自身错误中学习来生成训练数据,在仅使用约 20% 计算量的情况下,其生成的 CAD 程序准确性超越了其他方法。这一技术有望加速快速原型设计流程并降低成本。

7月15日周三
  1. Together AI63

    Thinking Machines Lab 发布多模态 MoE 模型 Inkling

    Thinking Machines Lab 发布了多模态专家混合模型 Inkling,支持文本、图像和音频输入,具备可控推理深度和广泛的微调能力。Inkling 采用查询条件相对注意力、短因果卷积和共享专家池 MoE 等架构创新,总参数量 975B,活跃参数量 40B,上下文窗口为 1M token。

    推荐理由:原文介绍了新模型的核心架构创新和可控推理特性,读者可以了解其技术路径与现有模型的差异。

7月13日周一
7月10日周五
  1. Vector Institute24

    Vector Institute 与欧洲航天局合作推进地球观测 AI

    Vector Institute 与欧洲航天局(ESA)建立合作伙伴关系,共同开发用于地球观测的人工智能新应用。合作初期将重点聚焦于气候科学和北极监测,Vector 学院教员 Evan Shelhamer 已作为访问教授加入 ESA 的 Φ-lab。此次合作旨在利用 AI 处理 ESA Copernicus Sentinel 卫星群产生的大量数据,并将科学开放性和可及性作为核心设计原则。

7月3日周五
  1. Vector Institute35

    Vector Institute 研究人员在 ICML 2026 推进生成式 AI、负责任 AI 与科学发现

    Vector Institute 研究人员在第 33届国际机器学习大会(ICML 2026)上展示了73篇被接收论文,涵盖强化学习、后训练、生成式AI、视频生成、多模态系统及AI治理等多个前沿领域。其中11篇被选为焦点论文,创下该研究所在ICML的最佳纪录。研究工作还涉及科学发现应用,包括基因组学、量子化学和材料建模。

6月24日周三
6月19日周五
6月12日周五
6月11日周四
  1. Vector Institute31

    Anne Martel:使用 AI 个性化癌症治疗

    Anne Martel 研究开发 AI 系统,从医学影像和临床文本数据中提取可操作信息,以帮助预测癌症患者对不同治疗方案的反应。她的团队近期在 ICCV 展示了如何通过基因组信息微调病理图像大模型,并结合临床记录文本提升预测准确性。该研究推动医疗影像 AI 从单纯应用计算机科学方法转向产生基础性创新,影响更广泛的 AI 社区。

  2. 月之暗面 Kimi 新模型73

    月之暗面 Kimi-K2.7-Code 模型发布

    月之暗面发布 Kimi-K2.7-Code,一款基于 Kimi K2.6 的编码专用智能体模型,采用 MoE 架构,参数量 1T,激活参数 32B,上下文长度 256K,支持图像与视频输入。

    推荐理由:原文提供了模型架构、评测数据和部署方式,读者可据此判断其在长程编程任务和智能体场景中的实际能力与适用性。

6月6日周六
  1. Ahead of AI21

    LLM 研究论文:2026 年列表(1 月至 5 月)

    2026 年 1 月至 5 月期间,作者整理了一份精选的 LLM 研究论文列表,涵盖推理模型、强化学习、高效推理、长上下文处理等方向。Nemotron 3 Super 采用混合架构设计,结合常规注意力层与 Mamba-2 状态空间模型层,提升长上下文效率,同时有 4B 参数的 Nemotron 3 Nano 版本。

6月4日周四
  1. Exploring Language Models49

    Gemma 4 12B 如何兼顾前沿智能与效率

    Google DeepMind 发布了 Gemma 4 12B 模型,该模型移除了音频和视觉编码器但仍保留多模态能力。Gemma 4 12B 采用与 31B 模型相似的解码器结构,通过局部与全局注意力机制的交错实现高效推理。此模型在不依赖编码器的情况下处理多模态输入,降低了推理延迟并简化了微调流程。