跳到正文
Hugging Face · 每日论文·· 2 天前精选AI 评分56

Kandinsky 6.0 Video:同步音视频生成基础模型

Kandinsky 6.0 Video: Foundation Models for Synchronized Video and Audio Generation

AI 导读

Kandinsky 6.0 Video 是一套用于同步文本到音视频生成的基础扩散模型,包含 Lite(3B参数)和 Pro(29B参数)两个版本,支持5秒视频与44kHz音频同步生成,含唇形同步,支持T2AV和I2AV模式,输出分辨率可提升至Full-HD。

推荐理由

原文提供了模型架构、训练策略和评测结果,读者可以据此理解同步音视频生成的技术路径和性能边界。

来源:Hugging Face · 每日论文 · huggingface.co