跳到正文

公司与模型

Google / Gemini 最新动态

Google 与 DeepMind 的 AI 动态:Gemini 系列、Veo 视频模型、研究成果与产品生态的持续追踪。

25 条精选近 30 天 18 条共收录 119 条

更新

精选归档 · 第 2 页

9月2日周三第 21–25 条
  1. Google · Gemini 博客62

    Google 为 Gemini Flash 系列模型推出智能体视频理解功能

    Google 为 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 模型推出了智能体视频理解功能。该功能通过动态搜索视频片段,将分析成本降低高达 66%,token 消耗减少高达 88%,同时将准确性提升高达 7%。

    推荐理由:原文给出了新功能在成本、效率和准确性上的具体提升数据,以及支持的模型和开放入口,读者可以据此评估其对视频分析工作流的影响。

  2. Google · AI Blog57

    Google Workspace 推出 AI 图像创作与编辑工具 Google Pics

    Google Workspace 推出 AI 图像创作与编辑工具 Google Pics,基于 Nano Banana 模型,提供对象分割、图内文字编辑与翻译、协作和多版本生成等功能。未来几周将向 Google AI Pro 和 Ultra 订阅者以及大多数 Workspace 商业客户开放,并将集成到 Slides、Docs 和 Drive 中,用户可在 pics.new 试用。

    推荐理由:原文明确了产品定位、核心功能、集成路径和开放范围,读者可以据此判断它如何融入现有工作流。

7月17日周五
  1. The Register · AI/ML68

    欧盟强制谷歌向竞争对手分享搜索数据并开放安卓AI接口

    欧盟委员会发布两项规范决定,要求谷歌向竞争对手分享搜索数据以改善其服务,并强制安卓系统向第三方AI助手开放关键功能接口。谷歌对此表示反对,认为此举会威胁用户隐私、安全和设备完整性。根据决定,搜索数据共享将从2027年1月开始实施,AI互操作性要求则从2027年7月生效。

    推荐理由:欧盟强制要求谷歌分享搜索数据并开放安卓AI接口,具体措施和双方争议点都已在原文中阐明。

4月4日周六
  1. Exploring Language Models62

    Gemma 4 架构详解:多模态、MoE 与高效推理设计

    Gemma 4 系列包含四款模型:E2B、E4B、31B 和 26B A4B,支持图像与音频输入,采用稠密与 MoE 架构。其核心设计包括交错局部与全局注意力、K=V 优化、p-RoPE 位置编码、Per-Layer Embeddings(PLE)和多模态编码器(ViT 与 Conformer)。

    推荐理由:原文通过图文结合方式详细拆解了 Gemma 4 的架构设计,包括多模态处理、MoE 与 PLE 技术,读者可据此理解其效率与能力的平衡机制。

11月19日周三
  1. One Useful Thing70

    Google 推出 Gemini 3.0 及智能体工具 Antigravity

    Google 发布 Gemini 3.0 模型及配套智能体工具 Antigravity,作者实测其能自主构建交互游戏、分析旧数据并撰写学术论文,通过代码执行和多工具调用完成复杂任务,展现从聊天机器人向数字协作者的转变。

    推荐理由:作者通过实测展示了 Gemini 3 在智能体能力、代码执行和自主研究方面的进展,读者可据此理解其作为数字协作者的潜力与边界。