跳到正文
10月2日周五
  1. Apple · 机器学习研究27

    Apple 研究:语言区分能力提升多语言语音模型的语音学习效果

    研究显示,在预训练中增强多语言语音模型的语言区分能力,能缩小其与单语模型在语音和词汇任务上的性能差距。在英语/法语 HuBERT 实验中,引入辅助语言分类器等方法后,phone-ABX 错误率从 11.6% 降至 10.4%(单语基线 10.8%),sWUGGY 词汇任务得分从 52.1% 提升至 56.7%(单语 58.5%)。结果表明,语言区分能力对降低多语言学习的额外成本具有因果作用。

10月1日周四
  1. NVIDIA · 开发者博客34

    微调 NVIDIA Nemotron 以适应沙特阿拉伯方言,并拓展至其他语言

    NVIDIA 展示了如何微调其 Nemotron 自动语音识别模型以适配沙特阿拉伯方言。该方法旨在解决区域方言和本地录音条件在预训练数据中代表性不足的问题,确保模型能处理人们的实际口语,而不仅仅是基准测试中表现良好的主流语言。此微调路径也可应用于其他语言。

  2. Vercel 博客35

    Microsoft AI 模型现已在 AI Gateway 上可用

    Vercel 与 Microsoft AI 合作,将 MAI 模型引入其 AI Gateway 平台。平台新增支持 MAI-Voice-2.1、MAI-Voice-2.1-Flash 和 MAI-Transcribe-2 Streaming 三款音频模型,分别用于生成多语言语音、低延迟语音交互和实时音频转录。AI Gateway 按模型官方费率计费,不收取平台费用或推理加价。

9月30日周三
  1. Hugging Face Blog39

    Open TTS Leaderboard:面向开源和多语言的文本到语音及语音克隆可扩展评估体系

    Hugging Face 推出 Open TTS Leaderboard,使用客观指标对开源文本到语音模型进行多语言和语音克隆评估。该榜单通过 Qwen3 ASR 计算词错率(WER)和字符错率(CER),并用 H200 GPU 测量推理速度(RTFx)和首次音频生成时间(TTFA),同时计算生成音频与参考音频的说话人相似度(SIM)。

  2. Hugging Face · 每日论文45

    DEFINE:用于零样本 TTS 的示例引导口音控制框架

    DEFINE 框架通过独立的音频示例分别控制说话人身份和目标口音,在单次推理中实现口音强度的连续调节。该框架基于 F5-TTS 构建,使用参数高效的 LoRA 进行适配,无需推理时的口音标签或后合成波形转换。在训练集内口音上,口音引导可将口音探测准确率从 6.5% 提升至 19.6%,并能将口音控制泛化到训练集外的部分口音上。

9月25日周五
  1. Google DeepMind54

    Gemini 3.8 Live 与 Live Avatar 功能上线

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,通过低延迟视频流与语音同步,实现企业级虚拟代理的近实时视觉交互。该功能支持多语言无缝切换、异步工具调用与持续对话,具备精确唇形同步与自然表情,企业可通过参考图像定制专属动画形象,目前仅对 Gemini Enterprise 用户开放。所有生成内容均嵌入 SynthID 水印以确保可追溯性。

    推荐理由:原文给出了功能组合和企业可用性,读者可以据此判断其在交互场景中的部署价值。

9月24日周四
  1. Apple · 机器学习研究35

    A Practical Recipe for Semi-Supervised Federated ASR: Online Pseudo-Labels with Server Update Stabilization

    本文提出一种半监督联邦语音识别(ASR)训练方法,通过在线伪标签与服务器更新稳定化实现模型训练。研究显示,使用客户端本地模型作为教师生成伪标签,并结合服务器端对有标签数据的持续训练,可显著提升模型性能。该方法在9个中的11个数据对上优于最强先前方法,平均在域内提升20.8%,跨域提升10.0%。

9月23日周三
9月17日周四
  1. Vercel 博客59

    OpenAI GPT-Live 1 语音模型在 Vercel AI Gateway 上线

    OpenAI 的全双工语音模型 GPT-Live 1 已在 Vercel AI Gateway 上线,支持同时听与说,无需等待对方说完。该模型还支持客户端委托,允许应用在语音会话进行时,调用 AI Gateway 上的任何文本模型(如 GPT-5.6-sol)处理深度任务,委托请求单独计费。

    推荐理由:原文介绍了全双工语音交互和客户端委托的具体实现方式,读者可以据此评估其技术特点和应用潜力。

9月16日周三
5月29日周五
3月25日周三
3月12日周四
  1. Together AI55

    Together AI 推出构建实时语音智能体的统一解决方案

    Together AI 推出了一个统一的解决方案,用于在共置的 STT、LLM 和 TTS 基础设施上构建实时语音智能体。该架构将整个语音技术栈保留在同一云上,旨在将端到端延迟降至 500 毫秒以下,并简化部署。平台原生集成了 Cartesia 和 Deepgram 的领先语音模型,为开发者提供了模型选择和配置的灵活性。

    推荐理由:Together AI 将语音识别、大模型和语音合成整合在同一集群,为构建实时语音智能体提供了一个低延迟、可灵活选模的解决方案。