跳到正文
NVIDIA 新模型·· 3 天前精选AI 评分61

NVIDIA 发布 PixelUMM:无编码器统一多模态模型

nvidia/PixelUMM

AI 导读

NVIDIA 发布 PixelUMM,一个无编码器的统一多模态模型,支持文本、图像和视频的联合理解与生成,直接在像素空间处理,参数量 151.99 亿,基于 Qwen3-8B 语言骨干,仅限非商业研究或评估使用。

推荐理由

原文给出了模型架构、参数量和开放入口,读者可以据此判断它在像素空间统一理解与生成的实现路径。

来源:NVIDIA 新模型 · huggingface.co