跳到正文
今天10月5日周一1 条
10月3日周六
10月2日周五
  1. Apple · 机器学习研究27

    Apple 研究:语言区分能力提升多语言语音模型的语音学习效果

    研究显示,在预训练中增强多语言语音模型的语言区分能力,能缩小其与单语模型在语音和词汇任务上的性能差距。在英语/法语 HuBERT 实验中,引入辅助语言分类器等方法后,phone-ABX 错误率从 11.6% 降至 10.4%(单语基线 10.8%),sWUGGY 词汇任务得分从 52.1% 提升至 56.7%(单语 58.5%)。结果表明,语言区分能力对降低多语言学习的额外成本具有因果作用。

10月1日周四
  1. NVIDIA · 开发者博客34

    微调 NVIDIA Nemotron 以适应沙特阿拉伯方言,并拓展至其他语言

    NVIDIA 展示了如何微调其 Nemotron 自动语音识别模型以适配沙特阿拉伯方言。该方法旨在解决区域方言和本地录音条件在预训练数据中代表性不足的问题,确保模型能处理人们的实际口语,而不仅仅是基准测试中表现良好的主流语言。此微调路径也可应用于其他语言。

  2. Vercel 博客35

    Microsoft AI 模型现已在 AI Gateway 上可用

    Vercel 与 Microsoft AI 合作,将 MAI 模型引入其 AI Gateway 平台。平台新增支持 MAI-Voice-2.1、MAI-Voice-2.1-Flash 和 MAI-Transcribe-2 Streaming 三款音频模型,分别用于生成多语言语音、低延迟语音交互和实时音频转录。AI Gateway 按模型官方费率计费,不收取平台费用或推理加价。

9月30日周三
  1. Hugging Face · 每日论文45

    DEFINE:用于零样本 TTS 的示例引导口音控制框架

    DEFINE 框架通过独立的音频示例分别控制说话人身份和目标口音,在单次推理中实现口音强度的连续调节。该框架基于 F5-TTS 构建,使用参数高效的 LoRA 进行适配,无需推理时的口音标签或后合成波形转换。在训练集内口音上,口音引导可将口音探测准确率从 6.5% 提升至 19.6%,并能将口音控制泛化到训练集外的部分口音上。

9月28日周一
9月26日周六
  1. TechCrunch · 融资并购34

    Synthesia 为记者创建可交互数字分身

    视频生成初创公司 Synthesia 为一名记者创建了其专属的可交互数字分身,该分身仅能回答关于其特定报道《为何风投支持的初创公司欺诈更多》的问题。该交互分身结合了语音转文本、视频、语言和文本转语音模型,企业客户还可选择集成 Cartesia、ElevenLabs、Google 或 OpenAI 的模型。

  2. CNET · AI49

    Gemini Live Avatar 为 AI 智能体配上虚拟形象,引发用户不适

    Google 为 Gemini Enterprise 用户推出了 Live Avatar 功能,能将 AI 智能体与可交互的虚拟形象结合,用于视频聊天处理保险理赔等任务。该功能支持唇形同步、实时音频视频处理,并能同时运行工具和 API 调用。目前仅提供预制的虚拟形象供企业选择,所有音视频内容均使用 SynthID 进行水印以验证其 AI 生成属性。

9月25日周五
  1. CNET · AI44

    Google 的 Gemini AI 新增“帮我打电话”功能及其潜在问题

    Google 为移动端 Gemini AI 推出了可代用户进行日常电话呼叫的智能体功能。该功能目前仅限美国、18岁以上、拥有 Pixel 11 或更新机型并订阅 Google AI 服务(每月 5 美元起)的用户使用,且设计上不会进行支付或分享信用卡号等敏感信息。其实际效果受限于企业是否愿意与 AI 对话、每日呼叫次数限制以及处理语音信箱等常见场景的能力。

9月23日周三
9月17日周四
  1. Vercel 博客59

    OpenAI GPT-Live 1 语音模型在 Vercel AI Gateway 上线

    OpenAI 的全双工语音模型 GPT-Live 1 已在 Vercel AI Gateway 上线,支持同时听与说,无需等待对方说完。该模型还支持客户端委托,允许应用在语音会话进行时,调用 AI Gateway 上的任何文本模型(如 GPT-5.6-sol)处理深度任务,委托请求单独计费。

    推荐理由:原文介绍了全双工语音交互和客户端委托的具体实现方式,读者可以据此评估其技术特点和应用潜力。

9月16日周三
5月29日周五
3月25日周三
3月12日周四
  1. Together AI55

    Together AI 推出构建实时语音智能体的统一解决方案

    Together AI 推出了一个统一的解决方案,用于在共置的 STT、LLM 和 TTS 基础设施上构建实时语音智能体。该架构将整个语音技术栈保留在同一云上,旨在将端到端延迟降至 500 毫秒以下,并简化部署。平台原生集成了 Cartesia 和 Deepgram 的领先语音模型,为开发者提供了模型选择和配置的灵活性。

    推荐理由:Together AI 将语音识别、大模型和语音合成整合在同一集群,为构建实时语音智能体提供了一个低延迟、可灵活选模的解决方案。