Google 2026年9月AI动态汇总:Gemini 4 Argon、Connected Apps等
Google 在2026年9月发布了新一代前沿模型 Gemini 4 Argon,其具备高级推理能力,并拥有行业领先的100万token输出上限,专为应对网络安全防御等复杂挑战而设计。
Google 在2026年9月发布了新一代前沿模型 Gemini 4 Argon,其具备高级推理能力,并拥有行业领先的100万token输出上限,专为应对网络安全防御等复杂挑战而设计。
MIT、Google 和东北大学的研究人员开发了名为 InstructMesh 的 AI 驱动设计软件,让用户能轻松修复 AI 生成的 3D 模型缺陷并按需制造。
Hugging Face 发布 World Embedding Benchmark,包含 8,000 个涵盖流体力学、固体力学、动力学和光学与电磁学的模拟案例,每个案例包含渲染视频和物理注释,用于三项任务:文本-视频检索、物理属性回归和视频描述对分类。
Cloudflare AI Search 现已正式可用,新增了对多模态格式的原生支持,包括图像嵌入、PDF的OCR以及更大的文件处理能力。计费将于2026年11月1日开始,所有 Workers 计划仍提供免费额度。
推荐理由:原文详细说明了新增的多模态嵌入、文件处理和OCR功能,以及从预览到正式可用的计费模式变化。
Google DeepMind 宣布推出前沿模型 Gemini 4 Argon,旨在处理复杂、长周期的跨领域工作流。该模型在 DeepSWE v1.1 上达到 77.9% 的 SOTA 水平,输出 token 上限提升至 100 万,定价为每百万输入 token 2 美元、输出 token 10 美元。
推荐理由:原文详细列举了模型在软件工程、金融法律和网络安全等领域的性能表现及定价,读者可以据此评估其实际应用潜力。
Hugging Face 提出 OctLLM,一种显式3D语言模型,通过将几何信息表示为 octree 占有 token 序列并采用稀疏 octree 结构,解决了现有模型在空间结构保留和参数效率上的不足。
由MIT、卡内基梅隆大学、纽约大学和斯坦福大学研究人员开发的AI系统Ataraxos在《战略棋》比赛中以15-1-4的战绩击败了世界最强人类选手,并以39-2的战绩战胜了锦标赛顶级玩家。
Hugging Face 推出 Open TTS Leaderboard,使用客观指标对开源文本到语音模型进行多语言和语音克隆评估。该榜单通过 Qwen3 ASR 计算词错率(WER)和字符错率(CER),并用 H200 GPU 测量推理速度(RTFx)和首次音频生成时间(TTFA),同时计算生成音频与参考音频的说话人相似度(SIM)。
FrameMorrow 提出一种前瞻性帧选择方法,通过预测代表未来信息需求的小型前瞻性 token 集来从历史中选择相关信息。该方法选择显式的历史帧而非模型内部状态,能以即插即用方式集成到包括闭源模型在内的多种生成器中,且额外推理成本很低。在涵盖长视频生成、交互式生成和动作条件世界模型的 5 个基准测试和 11 个生成模型上的广泛实验表明,其在长程一致性、视觉质量和动作对齐方面均有持续提升。
Condé Nast 与 AWS 生成式 AI 创新中心合作,基于 Amazon Bedrock 和 Amazon OpenSearch Service 构建了 AI 驱动的多模态视频发现解决方案。
微软研究院推出名为Quine的生物AI研究系统,该系统包含一个多模态生物世界模型和一个连接模型、科学工具、文献与研究人员的工作平台。在与Broad Institute的合作中,Quine被用于预测和优先排序能驱动肿瘤细胞状态转变的化合物,其排名靠前的候选物在湿实验室实验中得到了验证。
推荐理由:原文展示了该系统在癌症研究中的具体应用案例和效果,为关注AI在生物科学领域落地的读者提供了实践参考。
布鲁克林杂货店 Edy's Grocer 使用 Gemini 将家庭食谱按需转换为大型餐饮批量配方,并自动生成按货架分类的购物清单。Gemini 还能快速提供符合饮食限制的创意食材替换方案,帮助店主节省行政任务时间,专注于推广黎巴嫩美食与文化。
研究者推出 OpenTumorBoard 基准,包含 611 个患者案例和 19,157 次讨论记录,评估大模型在两种医疗场景下的表现。14 个前沿模型测试显示,最佳模型在临床等效性上仅获 3.43/5 分。该基准将公开发布以支持个性化癌症决策的模型开发。
Google 研究团队提出 AI 视频协导演框架,基于 Gemini 和 Veo 构建统一多代理系统,通过全局优化、视觉记忆追踪、自回归生成与闭环质量评估,解决长视频生成中的语义漂移、特征漂移和内容坍缩问题。
推荐理由:原文系统性地提出了多代理框架解决长视频生成中的连贯性问题,提供了可复现的技术路径和基准测试结果。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,通过低延迟视频流与语音同步,实现企业级虚拟代理的近实时视觉交互。该功能支持多语言无缝切换、异步工具调用与持续对话,具备精确唇形同步与自然表情,企业可通过参考图像定制专属动画形象,目前仅对 Gemini Enterprise 用户开放。所有生成内容均嵌入 SynthID 水印以确保可追溯性。
推荐理由:原文给出了功能组合和企业可用性,读者可以据此判断其在交互场景中的部署价值。
MIT Senseable City Lab研究人员在新书《How AI Sees the City: Urban Visual Intelligence》中探讨了视觉AI在城市研究中的应用潜力与隐私风险。
NVIDIA 发布了专为 3D 计算机断层扫描设计的开源视觉语言模型 NV-Reason-CT Open。该模型旨在支持放射科医生的链式推理,以应对前沿通用模型在体成像上表现不佳、现有开源医疗 AI 模型能力不足的现状。
小米的 MiMo V2.6 Pro、MiMo V2.6 Flash 和 MiMo V2.6 Pro UltraSpeed 三款模型现已在 AI Gateway 平台上线。
Google 的 Envisioning Studio 与设计师 Jane Wade 和 Sergio Hudson 合作,利用 Google Flow AI 创意工作室开发了两款定制工具。
MIT团队开发的xvr系统可在约5分钟内完成患者特异性AI模型训练,实现X射线与3D医学扫描的秒级、亚毫米级精准配准。该模型基于物理仿真生成患者专属合成X射线,避免幻觉,性能较现有AI方法提升一个数量级。系统已通过多类患者、身体部位和手术场景验证,有望提升微创手术的安全性与可及性。
Google DeepMind 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两款新语音模型,支持近实时推理与多语言动态切换。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
Gemini 可通过 4 种方式帮助用户处理家务,如家电维修指导、定制化饮食计划、家庭支出跟踪和大型购物比较。用户可通过上传收据、使用 Gemini Live 拍摄冰箱内容或询问汽车对比信息,获得即时分析与建议。该功能基于 Google AI & Economy ATLAS v1.0 研究,显示超过 86% 的对话式 AI 交互发生在非工作场景。
Google AI 技术现已支持超过 300 种语言,覆盖全球 86% 的人口。其 AlphaGenome Atlas 公开了人类基因组中所有 90 亿种可能的单字母遗传变化的预测影响,WeatherNext 3 天气模型则将提前一天或更久的降水预报准确率提高了 50%。
Google 宣布其技术与产品已支持超过 300 种语言,覆盖全球 86% 的人口。Gemini 3.5 Live Translate 支持 70 种语言的实时口语翻译,而基于 1200 万小时音频训练的通用语音模型正助力实现“千种语言计划”。
NVIDIA 介绍了使用 Encode-Prefill-Decode (EPD) 解耦技术来优化多模态模型推理。该技术将视觉编码器阶段与预填充和解码阶段分离,尤其适用于图像密集型提示词、中短输出及量化 MoE 模型。结合 NVIDIA Dynamo 使用,可实现高达 5 倍的推理加速。
Google DeepMind 与电影制作团队合作,在短片《Love, Rendered》中利用生成式 AI 技术重现了一对夫妇未曾被记录的初遇记忆。团队结合图像修复模型与表演捕捉模型,将老照片复原并映射了当事人当下的细微神态。该项目展示了 AI 作为艺术媒介的潜力,相关照片修复功能已集成至 Gemini 应用中。
Google 的音乐生成模型 Lyria 3.5 已在 Gemini 应用和 Gemini API 中面向全球用户推出。该模型提供更具表现力的人声和更丰富的编曲,用户可在应用内选择流派、人声/器乐风格,并使用新模板快速创作。Lyria 3.5 也通过 Google Flow Music、Google AI Studio 和 Google Vids 提供给艺术家、开发者和技术人员使用。
Google DeepMind 发布 WeatherNext 3,引入实时卫星数据、每小时更新、5公里分辨率,提升降水预测精度,并集成至 Search、Gemini、Maps 等产品。该模型通过直接学习观测数据,实现更精准的局部天气预测,尤其改善了拉丁美洲、非洲和亚太地区覆盖。
推荐理由:原文给出了实时卫星数据接入、小时级更新和分辨率提升等关键变化,读者可据此评估其对气象服务的影响。
Google 在 2026 年 8 月发布了多款 AI 产品,包括面向编程和智能体的高效模型 Gemini 3.7 Flash,以及专为实时转录设计的 Gemini 3.5 Transcribe。同期推出的 Pixel 11 系列设备搭载了 Google Tensor G6 芯片和最新的 Gemini Nano 模型。此外,Gemini 应用的月活用户已超过 10 亿。
Microsoft Research 推出高效病理学基础模型 GigaPath-Flash 和 GigaTIME-Flash,显著降低了计算需求。GigaPath-Flash 参数量为 2200 万,在保持性能的同时将推理成本降至原 GigaPath 的约 1/50。这两个基于 Apache 2.0 协议开源的研究模型旨在支持大规模病理数据分析,推动群体规模的疾病生物学研究。
Microsoft Research 推出 MindTopo 基准,用于评估多模态大语言模型对连通性、包围、顺序、分离和绳结等拓扑关系的理解能力。测试发现,模型在静态图像识别任务上的表现远优于需要规划与交互的任务,表明其难以在动态场景中维持对拓扑结构的一致性理解。这一差距凸显了在机器人学和交互式环境等需要可靠决策的领域,提升 AI 系统拓扑推理能力的重要性。
Meta Superintelligence Labs 发布的首个开源多模态模型 Muse Glimmer 现已可在 Ollama 上运行。这是一个 30B 参数、专为本地智能体工作负载设计的模型,拥有 128K+ 上下文长度,采用 Apache 2.0 许可证。
推荐理由:原文提供了模型参数、许可证、支持的智能体框架和性能优化细节,读者可以据此评估其本地部署的适用性。
Replit 发布新的创意套件 Replit Design,旨在让用户快速将想法转化为设计。它内置 Ambient Intelligence 引导设计流程,支持调用 Claude、GPT-5、Gemini、Kimi 和 GLM 等模型,并集成了 Mobbin UI/UX 参考库和设计系统。该功能现已对所有用户开放。
Vector Institute 发布关于多模态混合专家(MoE)模型的研究论文,系统分析了从稀疏路由到多模态部署的架构原理与训练挑战,实证揭示了模型在早期层按模态路由、深层按语义路由的结构演化规律,并提出通过QLoRA、Flash Attention 2与lm_head预钩子实现35.26B参数模型在四张A100 GPU上的可训练性,同时指出专家并行是长期可行方向。
推荐理由:原文通过实证分析揭示了多模态MoE模型在路由机制与训练实践中的关键规律,为后续优化提供了可复用的方法论。
MIT 与 IBM 等机构的研究人员开发了名为 GIFT 的系统,能指导视觉语言模型自动将 2D 设计图转换为更准确、功能更完善的 CAD 程序。该系统通过让模型从自身错误中学习来生成训练数据,在仅使用约 20% 计算量的情况下,其生成的 CAD 程序准确性超越了其他方法。这一技术有望加速快速原型设计流程并降低成本。
Thinking Machines Lab 发布了多模态专家混合模型 Inkling,支持文本、图像和音频输入,具备可控推理深度和广泛的微调能力。Inkling 采用查询条件相对注意力、短因果卷积和共享专家池 MoE 等架构创新,总参数量 975B,活跃参数量 40B,上下文窗口为 1M token。
推荐理由:原文介绍了新模型的核心架构创新和可控推理特性,读者可以了解其技术路径与现有模型的差异。
fal 团队构建了一个完全可控的AI视频生成管线,从3D分镜设计到最终成片,并开源了核心的3DREAL Strong v2 LoRA适配器。
推荐理由:原文详细拆解了从3D分镜到AI生成视频的完整工作流,包括具体的工具链、验证步骤和迭代经验,可供从业者复现或借鉴其方法。
Vector Institute 与欧洲航天局(ESA)建立合作伙伴关系,共同开发用于地球观测的人工智能新应用。合作初期将重点聚焦于气候科学和北极监测,Vector 学院教员 Evan Shelhamer 已作为访问教授加入 ESA 的 Φ-lab。此次合作旨在利用 AI 处理 ESA Copernicus Sentinel 卫星群产生的大量数据,并将科学开放性和可及性作为核心设计原则。
Vector Institute 研究人员在第 33届国际机器学习大会(ICML 2026)上展示了73篇被接收论文,涵盖强化学习、后训练、生成式AI、视频生成、多模态系统及AI治理等多个前沿领域。其中11篇被选为焦点论文,创下该研究所在ICML的最佳纪录。研究工作还涉及科学发现应用,包括基因组学、量子化学和材料建模。
Vector Institute 发布了 SONIC-O1,一个用于评估多模态大语言模型在真实世界音视频理解能力的开放基准。该基准包含约 60 小时的真实音视频内容,涵盖 13 个对话主题和 5 个领域,支持对模型在不同人群中的表现进行分组分析。