跳到正文
  1. Google DeepMind54

    Gemini 3.8 Live 与 Live Avatar 功能上线

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,通过低延迟视频流与语音同步,实现企业级虚拟代理的近实时视觉交互。该功能支持多语言无缝切换、异步工具调用与持续对话,具备精确唇形同步与自然表情,企业可通过参考图像定制专属动画形象,目前仅对 Gemini Enterprise 用户开放。所有生成内容均嵌入 SynthID 水印以确保可追溯性。

    推荐理由:原文给出了功能组合和企业可用性,读者可以据此判断其在交互场景中的部署价值。

  1. Google · Gemini 博客58

    Google 推出 Gemini 3.8 Live with Live Avatar

    Google 推出 Gemini 3.8 Live with Live Avatar,支持实时视频生成与语音同步,具备自然唇形同步、表情和多语言切换能力,可在对话中异步调用工具,适用于企业客户服务和交互式场景,当前仅在 Gemini Enterprise 中提供。

    推荐理由:原文说明了实时视频生成与语音同步、多语言支持和异步工具调用能力,企业用户可据此评估其在客户服务或交互式场景中的应用潜力。

  1. Vercel 博客59

    OpenAI GPT-Live 1 语音模型在 Vercel AI Gateway 上线

    OpenAI 的全双工语音模型 GPT-Live 1 已在 Vercel AI Gateway 上线,支持同时听与说,无需等待对方说完。该模型还支持客户端委托,允许应用在语音会话进行时,调用 AI Gateway 上的任何文本模型(如 GPT-5.6-sol)处理深度任务,委托请求单独计费。

    推荐理由:原文介绍了全双工语音交互和客户端委托的具体实现方式,读者可以据此评估其技术特点和应用潜力。

  1. Google · Gemini 博客70

    Google 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 实时对话模型

    Google 发布了 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两款实时对话模型,旨在提升语音智能体的智能和协作体验。

    推荐理由:Google 官方博客宣布了其最新的实时对话模型,提供了详细的性能基准和面向不同场景的部署方案。

  1. MiniMax 新模型60

    MiniMax 发布音乐生成模型 MiniMax Music 3

    MiniMax 发布音乐生成模型 MiniMax Music 3,支持基于歌词和音乐描述生成最长五分钟的完整歌曲,采用 8B 全局 LLM 与 0.6B 局部 LLM 的混合架构,结合 Flow Matching 和 Flow-VAE 进行连续隐状态合成,输出 32 kHz 16-bit 立体声 WAV 音频。

    推荐理由:原文详细说明了模型架构、控制方式和部署方法,读者可据此判断其在音乐创作中的实际可用性。

  1. 百度文心 新模型60

    百度发布 NAVA:6.3B 参数音视频生成模型

    百度 ERNIE 团队发布 NAVA 模型,一个 6.3B 参数的联合音视频生成模型,支持从单个提示词生成同步视频与音频,包括多说话人音色控制和图像条件续写。模型采用 Align-then-Fuse MMDiT 架构,在 Verse-Bench 上刷新 Sync-C、Sync-D、视频质量与音频 WER 等多项指标,参数量仅为开源基线的 2–5 倍。

    推荐理由:NAVA 是首个在 6.3B 参数下实现高同步性音视频生成的模型,其 Align-then-Fuse 架构和参考音色控制能力可直接用于多模态内容创作。

  2. Together AI59

    Together AI 如何构建全球最快的语音转文本技术栈

    Together AI 分享了其构建低延迟、高吞吐语音转文本(ASR)服务栈的工程优化细节,以支持 NVIDIA Parakeet-TDT 0.6B v3 和 OpenAI Whisper Large v3 等模型。

    推荐理由:原文详细拆解了从模型编译到运行时优化的全链路工程实践,为构建低延迟语音AI服务提供了具体的技术路径参考。

  1. Together AI55

    Together AI 推出构建实时语音智能体的统一解决方案

    Together AI 推出了一个统一的解决方案,用于在共置的 STT、LLM 和 TTS 基础设施上构建实时语音智能体。该架构将整个语音技术栈保留在同一云上,旨在将端到端延迟降至 500 毫秒以下,并简化部署。平台原生集成了 Cartesia 和 Deepgram 的领先语音模型,为开发者提供了模型选择和配置的灵活性。

    推荐理由:Together AI 将语音识别、大模型和语音合成整合在同一集群,为构建实时语音智能体提供了一个低延迟、可灵活选模的解决方案。

已经到底了