跳到正文
Hacker News · AI· onemiketwelve·· 14 小时前AI 评分29

生成声音的 AI 模型:文本与参考音频输入能否输出新声音?

Ask HN: Are there AI models for generating sounds based on a text and reference?

AI 导读

用户询问是否存在能通过文本和参考音频生成新声音的商业 AI 模型,目前图像生成已能通过多模态输入实现,但音频领域尚未有成熟方案。尝试过 ElevenLabs SFX 和 Stable Audio 3,前者仅支持文本到音频,后者生成效果不佳。用户认为音频生成技术仍停留在 2016 年图像生成的水平,尚未出现类似图像生成的成熟工作流。

来源:Hacker News · AI · news.ycombinator.com