跳到正文
9月16日周三
  1. Google · Gemini 博客21

    Gemini:4 种方式帮你应对家务琐事

    Gemini 可通过 4 种方式帮助用户处理家务,如家电维修指导、定制化饮食计划、家庭支出跟踪和大型购物比较。用户可通过上传收据、使用 Gemini Live 拍摄冰箱内容或询问汽车对比信息,获得即时分析与建议。该功能基于 Google AI & Economy ATLAS v1.0 研究,显示超过 86% 的对话式 AI 交互发生在非工作场景。

9月10日周四
  1. Google · AI Blog31

    Google DeepMind 与电影人合作 AI 重现 70 年爱情故事

    Google DeepMind 与电影制作团队合作,在短片《Love, Rendered》中利用生成式 AI 技术重现了一对夫妇未曾被记录的初遇记忆。团队结合图像修复模型与表演捕捉模型,将老照片复原并映射了当事人当下的细微神态。该项目展示了 AI 作为艺术媒介的潜力,相关照片修复功能已集成至 Gemini 应用中。

9月9日周三
9月7日周一
  1. TLDR AI22

    Claude 证明费马定理 🧮,自动化 AI 研究员 🔬,Z1 效率芯片 ⚡

    Claude 在 11 天内使用 Lean 完成费马大定理的首个完整计算机验证证明,涉及 1300 万行代码并证明了 29500 个中间定理。该证明通过 Prove2Me 和 Lean 验证,展示了 AI 在数学证明形式化中的潜力。OpenAI 计划到 2028 年 3 月开发自动化 AI 研究员,以提升研究效率并保持人类监督。

9月5日周六
  1. Google · Gemini 博客49

    Gemini 中现可创作最佳音轨:Lyria 3.5 可用

    Google 的音乐生成模型 Lyria 3.5 已在 Gemini 应用和 Gemini API 中面向全球用户推出。该模型提供更具表现力的人声和更丰富的编曲,用户可在应用内选择流派、人声/器乐风格,并使用新模板快速创作。Lyria 3.5 也通过 Google Flow Music、Google AI Studio 和 Google Vids 提供给艺术家、开发者和技术人员使用。

9月3日周四
  1. Google DeepMind66

    Google DeepMind 发布 WeatherNext 3 全球气象AI模型

    Google DeepMind 发布 WeatherNext 3,引入实时卫星数据、每小时更新、5公里分辨率,提升降水预测精度,并集成至 Search、Gemini、Maps 等产品。该模型通过直接学习观测数据,实现更精准的局部天气预测,尤其改善了拉丁美洲、非洲和亚太地区覆盖。

    推荐理由:原文给出了实时卫星数据接入、小时级更新和分辨率提升等关键变化,读者可据此评估其对气象服务的影响。

  2. The Register · AI/ML46

    AI 辅助采蘑菇是危险的尝试:主流模型识别毒蘑菇错误率堪忧

    一项测试显示,主流 AI 模型在识别蘑菇物种时错误率很高,可能将致命毒蘑菇误判为可食用。表现最佳的 Gemini-3.8-flash 首次猜测正确率仅为 65%,而 Qwen3.8-27b 将毒蘑菇误判为可食用的比例高达 36%。研究者警告,不应依赖 AI 判断蘑菇安全性,因为单张照片不足以准确识别,错误可能带来致命后果。

9月2日周三
  1. Google · AI Blog34

    Google 2026 年 8 月 AI 新闻汇总:发布 Gemini 3.7 Flash、Gemini 3.5 Transcribe 及 Pixel 11 系列

    Google 在 2026 年 8 月发布了多款 AI 产品,包括面向编程和智能体的高效模型 Gemini 3.7 Flash,以及专为实时转录设计的 Gemini 3.5 Transcribe。同期推出的 Pixel 11 系列设备搭载了 Google Tensor G6 芯片和最新的 Gemini Nano 模型。此外,Gemini 应用的月活用户已超过 10 亿。

9月1日周二
  1. Microsoft Research39

    GigaPath-Flash 与 GigaTIME-Flash:高效病理学基础模型迈向群体规模发现

    Microsoft Research 推出高效病理学基础模型 GigaPath-Flash 和 GigaTIME-Flash,显著降低了计算需求。GigaPath-Flash 参数量为 2200 万,在保持性能的同时将推理成本降至原 GigaPath 的约 1/50。这两个基于 Apache 2.0 协议开源的研究模型旨在支持大规模病理数据分析,推动群体规模的疾病生物学研究。

8月25日周二
8月13日周四
  1. Microsoft Research38

    MindTopo 揭示多模态大语言模型的空间推理能力

    Microsoft Research 推出 MindTopo 基准,用于评估多模态大语言模型对连通性、包围、顺序、分离和绳结等拓扑关系的理解能力。测试发现,模型在静态图像识别任务上的表现远优于需要规划与交互的任务,表明其难以在动态场景中维持对拓扑结构的一致性理解。这一差距凸显了在机器人学和交互式环境等需要可靠决策的领域,提升 AI 系统拓扑推理能力的重要性。

8月12日周三
  1. IEEE Spectrum · AI32

    Inside the Data Bottleneck Slowing Visual and Physical AI

    超过700名从业者参与的2026年调查显示,数据工作而非数据收集是决定视觉与物理AI系统能否成功部署的关键因素。78%的团队已从该领域获得可衡量价值,但74%仍认为其投资不足。成功落地的团队在数据处理上投入的时间是遇到困难团队的近3倍,而标注工作因大量数据被丢弃而显得低效且成本高昂。

8月10日周一
  1. Ollama 博客57

    Meta Superintelligence Labs 的 Muse Glimmer 模型已在 Ollama 上线

    Meta Superintelligence Labs 发布的首个开源多模态模型 Muse Glimmer 现已可在 Ollama 上运行。这是一个 30B 参数、专为本地智能体工作负载设计的模型,拥有 128K+ 上下文长度,采用 Apache 2.0 许可证。

    推荐理由:原文提供了模型参数、许可证、支持的智能体框架和性能优化细节,读者可以据此评估其本地部署的适用性。

7月30日周四
  1. Replit 博客52

    Replit 推出 Replit Design 设计套件

    Replit 发布新的创意套件 Replit Design,旨在让用户快速将想法转化为设计。它内置 Ambient Intelligence 引导设计流程,支持调用 Claude、GPT-5、Gemini、Kimi 和 GLM 等模型,并集成了 Mobbin UI/UX 参考库和设计系统。该功能现已对所有用户开放。

7月23日周四
  1. Vector Institute54

    Vector Institute 发布多模态混合专家模型研究论文

    Vector Institute 发布关于多模态混合专家(MoE)模型的研究论文,系统分析了从稀疏路由到多模态部署的架构原理与训练挑战,实证揭示了模型在早期层按模态路由、深层按语义路由的结构演化规律,并提出通过QLoRA、Flash Attention 2与lm_head预钩子实现35.26B参数模型在四张A100 GPU上的可训练性,同时指出专家并行是长期可行方向。

    推荐理由:原文通过实证分析揭示了多模态MoE模型在路由机制与训练实践中的关键规律,为后续优化提供了可复用的方法论。

7月16日周四
  1. MIT News · 人工智能44

    MIT 与 IBM 研究人员开发 GIFT 系统,提升 AI 将 2D 设计转为 3D CAD 模型的性能

    MIT 与 IBM 等机构的研究人员开发了名为 GIFT 的系统,能指导视觉语言模型自动将 2D 设计图转换为更准确、功能更完善的 CAD 程序。该系统通过让模型从自身错误中学习来生成训练数据,在仅使用约 20% 计算量的情况下,其生成的 CAD 程序准确性超越了其他方法。这一技术有望加速快速原型设计流程并降低成本。

7月15日周三
  1. Together AI63

    Thinking Machines Lab 发布多模态 MoE 模型 Inkling

    Thinking Machines Lab 发布了多模态专家混合模型 Inkling,支持文本、图像和音频输入,具备可控推理深度和广泛的微调能力。Inkling 采用查询条件相对注意力、短因果卷积和共享专家池 MoE 等架构创新,总参数量 975B,活跃参数量 40B,上下文窗口为 1M token。

    推荐理由:原文介绍了新模型的核心架构创新和可控推理特性,读者可以了解其技术路径与现有模型的差异。

7月13日周一
7月10日周五
  1. Vector Institute24

    Vector Institute 与欧洲航天局合作推进地球观测 AI

    Vector Institute 与欧洲航天局(ESA)建立合作伙伴关系,共同开发用于地球观测的人工智能新应用。合作初期将重点聚焦于气候科学和北极监测,Vector 学院教员 Evan Shelhamer 已作为访问教授加入 ESA 的 Φ-lab。此次合作旨在利用 AI 处理 ESA Copernicus Sentinel 卫星群产生的大量数据,并将科学开放性和可及性作为核心设计原则。

7月3日周五
  1. Vector Institute35

    Vector Institute 研究人员在 ICML 2026 推进生成式 AI、负责任 AI 与科学发现

    Vector Institute 研究人员在第 33届国际机器学习大会(ICML 2026)上展示了73篇被接收论文,涵盖强化学习、后训练、生成式AI、视频生成、多模态系统及AI治理等多个前沿领域。其中11篇被选为焦点论文,创下该研究所在ICML的最佳纪录。研究工作还涉及科学发现应用,包括基因组学、量子化学和材料建模。

6月24日周三
6月12日周五
6月11日周四
  1. Vector Institute31

    Anne Martel:使用 AI 个性化癌症治疗

    Anne Martel 研究开发 AI 系统,从医学影像和临床文本数据中提取可操作信息,以帮助预测癌症患者对不同治疗方案的反应。她的团队近期在 ICCV 展示了如何通过基因组信息微调病理图像大模型,并结合临床记录文本提升预测准确性。该研究推动医疗影像 AI 从单纯应用计算机科学方法转向产生基础性创新,影响更广泛的 AI 社区。

6月6日周六
  1. Ahead of AI21

    LLM 研究论文:2026 年列表(1 月至 5 月)

    2026 年 1 月至 5 月期间,作者整理了一份精选的 LLM 研究论文列表,涵盖推理模型、强化学习、高效推理、长上下文处理等方向。Nemotron 3 Super 采用混合架构设计,结合常规注意力层与 Mamba-2 状态空间模型层,提升长上下文效率,同时有 4B 参数的 Nemotron 3 Nano 版本。

6月4日周四
  1. Exploring Language Models49

    Gemma 4 12B 如何兼顾前沿智能与效率

    Google DeepMind 发布了 Gemma 4 12B 模型,该模型移除了音频和视觉编码器但仍保留多模态能力。Gemma 4 12B 采用与 31B 模型相似的解码器结构,通过局部与全局注意力机制的交错实现高效推理。此模型在不依赖编码器的情况下处理多模态输入,降低了推理延迟并简化了微调流程。

6月2日周二
  1. Together AI59

    Together AI 详解如何高效推理服务 MiniMax M3 模型

    Together AI 作为 MiniMax M3 的优选云合作伙伴,分享了其针对该模型新特性的推理优化方案。M3 具备 100 万 token 上下文、原生多模态和稀疏注意力架构,Together AI 通过 KV 块主序稀疏注意力、与分页注意力的集成、解码索引评分优化以及网关预处理多模态输入等方法,在代理式流量下将推理性能提升了 81% 至 125%。

    推荐理由:Together AI 分享了其针对 MiniMax M3 模型稀疏注意力等新特性的推理优化细节,包括 KV 块重排、分页注意力集成和网关预处理。

5月20日周三
5月16日周六
5月14日周四
  1. Together AI52

    Together AI 开源视频翻译工具 Violin

    Together AI 开源了视频翻译工具 Violin,它通过 Whisper V3、DeepSeek V4 Pro 和 Cartesia Sonic 3 等模型实现语音识别、翻译和语音合成。Violin 还包含基于视频内容的多模态聊天助手,并提供了 Web 应用、CLI 工具和 Agent skill 三种使用方式。所有代码已在 MIT 许可下开源。

4月30日周四
4月28日周二
4月1日周三
  1. One Useful Thing39

    Claude Dispatch 和接口的力量

    Anthropic 推出 Claude Cowork 与 Dispatch 接口,允许用户通过手机远程控制桌面端 AI 智能体。用户可从手机发送指令,让 Claude 读取日历、邮件和在线频道,生成晨间简报。Dispatch 与 Claude Code 结合,使 AI 能够直接操作本地文件和应用程序,提升非开发人员的使用效率。

3月20日周五
  1. fal 博客55

    fal 发布 MCP Server,可连接 1000+ 模型

    fal 推出 MCP Server,让 Claude、Cursor 等 AI 助手能直接搜索、运行和串联 fal 平台上的 1000 多个生成模型。该服务器提供 9 个工具,涵盖模型发现、执行和文件上传,用户只需配置 API 密钥即可在对话中完成图像生成、视频制作、语音合成等复杂工作流。服务本身免费,按标准 fal 定价支付模型调用费用。

    推荐理由:通过 MCP 协议将上千个生成模型直接接入 Claude、Cursor 等 AI 助手,简化了多模态创作的工作流。

3月18日周三
  1. Together AI56

    Together AI 扩展微调服务,支持工具调用、推理和视觉模型

    Together AI 扩展其微调服务,新增了对工具调用、推理和视觉语言模型的原生支持。服务升级了训练栈,可更高效地处理 100B+ 参数模型,吞吐量提升最高达 6 倍,并支持最大 100GB 的数据集。

    推荐理由:Together AI 的微调服务新增了对工具调用、推理和视觉模型的支持,并提升了大规模模型训练的效率。

3月3日周二
  1. fal 博客45

    HeyGen 模型现已在 fal 平台上线

    HeyGen 的模型已登陆 fal 平台,提供视频智能体 API、Avatar IV API、视频翻译和 Avatar Video 等核心功能。用户可通过 Video Agent API 输入提示词或 URL,一键生成包含脚本、素材和剪辑的完整视频。Avatar IV API 能将单张照片转换为具备自然表情和手势的说话头像,无需专业工作室。

2月26日周四
  1. Vector Institute26

    Vector Institute 2026 海报展示会:60 个研究项目塑造 AI 未来

    Vector Institute 2026 海报展示会呈现了 60 个研究项目,涵盖医疗健康、AI 安全与基础模型创新三大主题。其中近 20% 的研究聚焦医疗 AI,包括语音控制手术导航、癌症检测和医学影像技术。加拿大在 AI 领域的领导地位通过政府支持与产业合作得以体现,研究强调负责任的 AI 发展与技术落地。

1月22日周四