Recly:将 Galaxy Watch 或 Apple Watch 变为 Plaud 式 AI 录音笔
Recly 是一款免费开源应用,可将 Galaxy Watch 或 Apple Watch 变为 AI 录音笔,支持本地免费转录,并将笔记任务交给用户已有的 AI 智能体。
推荐理由:作者开源了将智能手表变为录音笔的方案,并详细说明了本地转录和与现有AI集成的技术路径。
Recly 是一款免费开源应用,可将 Galaxy Watch 或 Apple Watch 变为 AI 录音笔,支持本地免费转录,并将笔记任务交给用户已有的 AI 智能体。
推荐理由:作者开源了将智能手表变为录音笔的方案,并详细说明了本地转录和与现有AI集成的技术路径。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,通过低延迟视频流与语音同步,实现企业级虚拟代理的近实时视觉交互。该功能支持多语言无缝切换、异步工具调用与持续对话,具备精确唇形同步与自然表情,企业可通过参考图像定制专属动画形象,目前仅对 Gemini Enterprise 用户开放。所有生成内容均嵌入 SynthID 水印以确保可追溯性。
推荐理由:原文给出了功能组合和企业可用性,读者可以据此判断其在交互场景中的部署价值。
OpenAI 的全双工语音模型 GPT-Live 1 已在 Vercel AI Gateway 上线,支持同时听与说,无需等待对方说完。该模型还支持客户端委托,允许应用在语音会话进行时,调用 AI Gateway 上的任何文本模型(如 GPT-5.6-sol)处理深度任务,委托请求单独计费。
推荐理由:原文介绍了全双工语音交互和客户端委托的具体实现方式,读者可以据此评估其技术特点和应用潜力。
Google DeepMind 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两款新语音模型,支持近实时推理与多语言动态切换。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
Google 发布了 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两款实时对话模型,旨在提升语音智能体的智能和协作体验。
推荐理由:Google 官方博客宣布了其最新的实时对话模型,提供了详细的性能基准和面向不同场景的部署方案。
Together AI 分享了其构建低延迟、高吞吐语音转文本(ASR)服务栈的工程优化细节,以支持 NVIDIA Parakeet-TDT 0.6B v3 和 OpenAI Whisper Large v3 等模型。
推荐理由:原文详细拆解了从模型编译到运行时优化的全链路工程实践,为构建低延迟语音AI服务提供了具体的技术路径参考。
Together AI 推出了一个统一的解决方案,用于在共置的 STT、LLM 和 TTS 基础设施上构建实时语音智能体。该架构将整个语音技术栈保留在同一云上,旨在将端到端延迟降至 500 毫秒以下,并简化部署。平台原生集成了 Cartesia 和 Deepgram 的领先语音模型,为开发者提供了模型选择和配置的灵活性。
推荐理由:Together AI 将语音识别、大模型和语音合成整合在同一集群,为构建实时语音智能体提供了一个低延迟、可灵活选模的解决方案。