跳到正文
9月15日周二
9月14日周一
  1. 千问 Qwen 新模型50

    千问 Qwen-Image-2.1 模型发布

    千问发布 Qwen-Image-2.1,一个统一文本生成图像与图像编辑的模型,参数量为7B,支持透明图生成、多参考图编辑、局部修改和精细纹理,已在 Hugging Face 和 ModelScope 开源,提供完整代码示例和推理优化方案。

9月10日周四
  1. DeepSeek 新模型75

    DeepSeek发布多模态MoE模型DeepSeek-V4.1-Flash,支持百万token上下文与可调推理努力

    DeepSeek发布多模态Mixture-of-Experts模型DeepSeek-V4.1-Flash,拥有552B参数,支持最多100万token上下文。模型采用CED架构,通过SWA Bounded Replay和CSA2技术将全局KV缓存降至890字节/token,约为前代的1/4。

    推荐理由:模型在KV缓存压缩和多模态能力上实现突破,支持百万token上下文和可调推理努力,对长上下文智能体应用有直接价值。

  2. Google · AI Blog31

    Google DeepMind 与电影人合作 AI 重现 70 年爱情故事

    Google DeepMind 与电影制作团队合作,在短片《Love, Rendered》中利用生成式 AI 技术重现了一对夫妇未曾被记录的初遇记忆。团队结合图像修复模型与表演捕捉模型,将老照片复原并映射了当事人当下的细微神态。该项目展示了 AI 作为艺术媒介的潜力,相关照片修复功能已集成至 Gemini 应用中。

9月5日周六
  1. Google · Gemini 博客49

    Gemini 中现可创作最佳音轨:Lyria 3.5 可用

    Google 的音乐生成模型 Lyria 3.5 已在 Gemini 应用和 Gemini API 中面向全球用户推出。该模型提供更具表现力的人声和更丰富的编曲,用户可在应用内选择流派、人声/器乐风格,并使用新模板快速创作。Lyria 3.5 也通过 Google Flow Music、Google AI Studio 和 Google Vids 提供给艺术家、开发者和技术人员使用。

9月3日周四
  1. Google DeepMind66

    Google DeepMind 发布 WeatherNext 3 全球气象AI模型

    Google DeepMind 发布 WeatherNext 3,引入实时卫星数据、每小时更新、5公里分辨率,提升降水预测精度,并集成至 Search、Gemini、Maps 等产品。该模型通过直接学习观测数据,实现更精准的局部天气预测,尤其改善了拉丁美洲、非洲和亚太地区覆盖。

    推荐理由:原文给出了实时卫星数据接入、小时级更新和分辨率提升等关键变化,读者可据此评估其对气象服务的影响。

9月2日周三
  1. Google · AI Blog34

    Google 2026 年 8 月 AI 新闻汇总:发布 Gemini 3.7 Flash、Gemini 3.5 Transcribe 及 Pixel 11 系列

    Google 在 2026 年 8 月发布了多款 AI 产品,包括面向编程和智能体的高效模型 Gemini 3.7 Flash,以及专为实时转录设计的 Gemini 3.5 Transcribe。同期推出的 Pixel 11 系列设备搭载了 Google Tensor G6 芯片和最新的 Gemini Nano 模型。此外,Gemini 应用的月活用户已超过 10 亿。

9月1日周二
  1. Weaviate 博客50

    Weaviate 如何从PDF中的图表和表格提取语义

    Weaviate 提供一种无需OCR的RAG方法,通过多向量模型直接处理PDF页面图像,提取图表和表格中的语义信息。该方法将每页作为独立对象嵌入,利用MaxSim匹配查询与页面区域,支持拖拽上传和Python部署。示例中对NVIDIA财报的查询返回了包含趋势图表的页面,Query Agent可生成带图像引用的合成答案。

  2. Microsoft Research39

    GigaPath-Flash 与 GigaTIME-Flash:高效病理学基础模型迈向群体规模发现

    Microsoft Research 推出高效病理学基础模型 GigaPath-Flash 和 GigaTIME-Flash,显著降低了计算需求。GigaPath-Flash 参数量为 2200 万,在保持性能的同时将推理成本降至原 GigaPath 的约 1/50。这两个基于 Apache 2.0 协议开源的研究模型旨在支持大规模病理数据分析,推动群体规模的疾病生物学研究。

8月31日周一
8月27日周四
  1. 千问 Qwen 新模型52

    千问发布Qwen-Drive-1.0-4B自动驾驶多模态模型

    千问发布Qwen-Drive-1.0-4B,一个统一3D感知、视觉问答与运动规划的自动驾驶多模态基础模型。该模型基于Qwen3.5-4B架构,通过外部BEV感知头和Planning Expert模块扩展能力,支持开放环路、伪闭环和闭环评估,在多个自动驾驶基准上表现领先。模型权重与代码已开源,提供SFT和RL两种规划专家版本,支持推理与部署。

8月25日周二
  1. 智谱 GLM 新模型67

    智谱发布 GLM-5.3-Flash 多模态大模型

    智谱发布 GLM-5.3-Flash,为 GLM-5 系列首个原生多模态模型,拥有 320B 总参数和 18B 活跃参数,支持 300,000 token 上下文,采用混合稀疏与线性注意力架构及 mHC 技术,部署框架包括 SGLang、vLLM、TokenSpeed 等,可通过 reasoning_effort 参数控制推理预算,API 服务可在 Z.ai 平台使用。

    推荐理由:原文给出了模型参数、架构创新和部署框架,读者可以据此判断其在多模态和长上下文场景下的实际应用潜力。

8月24日周一
  1. 千问 Qwen 新模型74

    千问 Qwen3.8-Flash-Next-FP8 模型发布

    千问发布 Qwen3.8-Flash-Next-FP8 模型,为基于 Qwen3.8-Flash-Next 架构的 FP8 量化版本,支持 262,144 令牌上下文,可扩展至 100 万令牌。

    推荐理由:原文公开了新架构的量化模型权重、技术细节和基准结果,读者可据此评估其在长上下文和多模态任务中的效率与性能表现。

8月20日周四
  1. Google 新模型31

    Google 发布 TIPS — g/14 low-res (v1) 模型

    Google 发布了 TIPS — g/14 low-res (v1) 模型,该模型包含 1.1B 视觉参数和 389M 文本参数,支持生成与文本嵌入对齐的图像空间特征。模型使用 224 分辨率,图像编码无需 ImageNet 归一化,文本编码支持最大 64 个 token。模型基于 Apache 2.0 协议开源,适用于零样本分类和空间特征可视化任务。

8月13日周四
  1. Microsoft Research38

    MindTopo 揭示多模态大语言模型的空间推理能力

    Microsoft Research 推出 MindTopo 基准,用于评估多模态大语言模型对连通性、包围、顺序、分离和绳结等拓扑关系的理解能力。测试发现,模型在静态图像识别任务上的表现远优于需要规划与交互的任务,表明其难以在动态场景中维持对拓扑结构的一致性理解。这一差距凸显了在机器人学和交互式环境等需要可靠决策的领域,提升 AI 系统拓扑推理能力的重要性。

8月10日周一
  1. Ollama 博客57

    Meta Superintelligence Labs 的 Muse Glimmer 模型已在 Ollama 上线

    Meta Superintelligence Labs 发布的首个开源多模态模型 Muse Glimmer 现已可在 Ollama 上运行。这是一个 30B 参数、专为本地智能体工作负载设计的模型,拥有 128K+ 上下文长度,采用 Apache 2.0 许可证。

    推荐理由:原文提供了模型参数、许可证、支持的智能体框架和性能优化细节,读者可以据此评估其本地部署的适用性。

8月7日周五
  1. MiniMax 新模型60

    MiniMax 发布音乐生成模型 MiniMax Music 3

    MiniMax 发布音乐生成模型 MiniMax Music 3,支持基于歌词和音乐描述生成最长五分钟的完整歌曲,采用 8B 全局 LLM 与 0.6B 局部 LLM 的混合架构,结合 Flow Matching 和 Flow-VAE 进行连续隐状态合成,输出 32 kHz 16-bit 立体声 WAV 音频。

    推荐理由:原文详细说明了模型架构、控制方式和部署方法,读者可据此判断其在音乐创作中的实际可用性。

8月1日周六
  1. Together AI72

    月之暗面发布 Kimi K3:2.8万亿参数开源模型,支持1M上下文与多模态

    月之暗面发布 Kimi K3,2.8万亿参数开源模型,为首个3万亿参数级开源模型,支持1M上下文、多模态输入和动态工具加载。Together AI 提供 API 接入,支持 OpenAI 兼容调用,推理深度可调,定价按 token 计费,缓存命中输入价为每百万 token 0.30 美元。模型在 DeepSWE、BrowseComp 等基准上表现领先,支持结构化输出、流式响应和保留思考历史。

    推荐理由:原文提供了模型参数、架构创新、API 使用方式和定价,读者可据此判断其在长上下文、推理和多模态任务中的实际部署潜力。

7月30日周四
  1. Replit 博客52

    Replit 推出 Replit Design 设计套件

    Replit 发布新的创意套件 Replit Design,旨在让用户快速将想法转化为设计。它内置 Ambient Intelligence 引导设计流程,支持调用 Claude、GPT-5、Gemini、Kimi 和 GLM 等模型,并集成了 Mobbin UI/UX 参考库和设计系统。该功能现已对所有用户开放。

7月28日周二
  1. MiniMax 新模型78

    MiniMax 发布新一代开源多模态视频模型 H3

    MiniMax 发布开源多模态视频生成模型 H3,支持文本、图像、视频、音频的统一理解与生成,可输出最高 2K 分辨率、15 秒时长的视频并带有立体声。模型包含 H3-Context-IR、H3-Base 和 H3-Regenerate-2K 三个模块,支持多种输入模式如文本到视频(T2VA)、首尾帧到视频(FL2VA)和参考多模态到视频(Ref2VA)。

    推荐理由:原文提供了模型架构、输入输出规范和部署方式,读者可以据此判断其在多模态视频生成中的实际应用潜力。

7月23日周四
  1. Vector Institute54

    Vector Institute 发布多模态混合专家模型研究论文

    Vector Institute 发布关于多模态混合专家(MoE)模型的研究论文,系统分析了从稀疏路由到多模态部署的架构原理与训练挑战,实证揭示了模型在早期层按模态路由、深层按语义路由的结构演化规律,并提出通过QLoRA、Flash Attention 2与lm_head预钩子实现35.26B参数模型在四张A100 GPU上的可训练性,同时指出专家并行是长期可行方向。

    推荐理由:原文通过实证分析揭示了多模态MoE模型在路由机制与训练实践中的关键规律,为后续优化提供了可复用的方法论。

7月16日周四
  1. Mistral 新模型66

    Mistral 发布 Shieldstral-1.0-3B 多模态安全分类模型

    Mistral 发布 Shieldstral-1.0-3B,一个 3B 参数的多模态安全分类模型,支持文本、图像及图文混合内容的动态政策审核,基于自然语言政策输入返回连续安全分数,可在单 GPU 上运行,支持 32k 上下文窗口,开源 Apache 2.0 许可。

    推荐理由:原文提供了模型架构、能力指标和部署方式,读者可以据此判断其在轻量级安全审核场景中的适用性。

  2. MIT News · 人工智能44

    MIT 与 IBM 研究人员开发 GIFT 系统,提升 AI 将 2D 设计转为 3D CAD 模型的性能

    MIT 与 IBM 等机构的研究人员开发了名为 GIFT 的系统,能指导视觉语言模型自动将 2D 设计图转换为更准确、功能更完善的 CAD 程序。该系统通过让模型从自身错误中学习来生成训练数据,在仅使用约 20% 计算量的情况下,其生成的 CAD 程序准确性超越了其他方法。这一技术有望加速快速原型设计流程并降低成本。

7月15日周三
  1. Together AI63

    Thinking Machines Lab 发布多模态 MoE 模型 Inkling

    Thinking Machines Lab 发布了多模态专家混合模型 Inkling,支持文本、图像和音频输入,具备可控推理深度和广泛的微调能力。Inkling 采用查询条件相对注意力、短因果卷积和共享专家池 MoE 等架构创新,总参数量 975B,活跃参数量 40B,上下文窗口为 1M token。

    推荐理由:原文介绍了新模型的核心架构创新和可控推理特性,读者可以了解其技术路径与现有模型的差异。

7月13日周一
7月10日周五
  1. Vector Institute24

    Vector Institute 与欧洲航天局合作推进地球观测 AI

    Vector Institute 与欧洲航天局(ESA)建立合作伙伴关系,共同开发用于地球观测的人工智能新应用。合作初期将重点聚焦于气候科学和北极监测,Vector 学院教员 Evan Shelhamer 已作为访问教授加入 ESA 的 Φ-lab。此次合作旨在利用 AI 处理 ESA Copernicus Sentinel 卫星群产生的大量数据,并将科学开放性和可及性作为核心设计原则。

7月3日周五
  1. Vector Institute35

    Vector Institute 研究人员在 ICML 2026 推进生成式 AI、负责任 AI 与科学发现

    Vector Institute 研究人员在第 33届国际机器学习大会(ICML 2026)上展示了73篇被接收论文,涵盖强化学习、后训练、生成式AI、视频生成、多模态系统及AI治理等多个前沿领域。其中11篇被选为焦点论文,创下该研究所在ICML的最佳纪录。研究工作还涉及科学发现应用,包括基因组学、量子化学和材料建模。

6月24日周三
6月19日周五
6月12日周五
6月11日周四
  1. Vector Institute31

    Anne Martel:使用 AI 个性化癌症治疗

    Anne Martel 研究开发 AI 系统,从医学影像和临床文本数据中提取可操作信息,以帮助预测癌症患者对不同治疗方案的反应。她的团队近期在 ICCV 展示了如何通过基因组信息微调病理图像大模型,并结合临床记录文本提升预测准确性。该研究推动医疗影像 AI 从单纯应用计算机科学方法转向产生基础性创新,影响更广泛的 AI 社区。

  2. 月之暗面 Kimi 新模型73

    月之暗面 Kimi-K2.7-Code 模型发布

    月之暗面发布 Kimi-K2.7-Code,一款基于 Kimi K2.6 的编码专用智能体模型,采用 MoE 架构,参数量 1T,激活参数 32B,上下文长度 256K,支持图像与视频输入。

    推荐理由:原文提供了模型架构、评测数据和部署方式,读者可据此判断其在长程编程任务和智能体场景中的实际能力与适用性。

6月2日周二
  1. Together AI59

    Together AI 详解如何高效推理服务 MiniMax M3 模型

    Together AI 作为 MiniMax M3 的优选云合作伙伴,分享了其针对该模型新特性的推理优化方案。M3 具备 100 万 token 上下文、原生多模态和稀疏注意力架构,Together AI 通过 KV 块主序稀疏注意力、与分页注意力的集成、解码索引评分优化以及网关预处理多模态输入等方法,在代理式流量下将推理性能提升了 81% 至 125%。

    推荐理由:Together AI 分享了其针对 MiniMax M3 模型稀疏注意力等新特性的推理优化细节,包括 KV 块重排、分页注意力集成和网关预处理。

5月20日周三
5月14日周四
  1. Together AI52

    Together AI 开源视频翻译工具 Violin

    Together AI 开源了视频翻译工具 Violin,它通过 Whisper V3、DeepSeek V4 Pro 和 Cartesia Sonic 3 等模型实现语音识别、翻译和语音合成。Violin 还包含基于视频内容的多模态聊天助手,并提供了 Web 应用、CLI 工具和 Agent skill 三种使用方式。所有代码已在 MIT 许可下开源。