跳到正文
百度文心 新模型·· 2026-05-29精选AI 评分60

百度发布 NAVA:6.3B 参数音视频生成模型

baidu/NAVA

AI 导读

百度 ERNIE 团队发布 NAVA 模型,一个 6.3B 参数的联合音视频生成模型,支持从单个提示词生成同步视频与音频,包括多说话人音色控制和图像条件续写。模型采用 Align-then-Fuse MMDiT 架构,在 Verse-Bench 上刷新 Sync-C、Sync-D、视频质量与音频 WER 等多项指标,参数量仅为开源基线的 2–5 倍。

推荐理由

NAVA 是首个在 6.3B 参数下实现高同步性音视频生成的模型,其 Align-then-Fuse 架构和参考音色控制能力可直接用于多模态内容创作。

来源:百度文心 新模型 · huggingface.co