跳到正文
10月2日周五
  1. NVIDIA 新模型61

    NVIDIA 发布 PixelUMM:无编码器统一多模态模型

    NVIDIA 发布 PixelUMM,一个无编码器的统一多模态模型,支持文本、图像和视频的联合理解与生成,直接在像素空间处理,参数量 151.99 亿,基于 Qwen3-8B 语言骨干,仅限非商业研究或评估使用。

    推荐理由:原文给出了模型架构、参数量和开放入口,读者可以据此判断它在像素空间统一理解与生成的实现路径。

9月20日周日
  1. 千问 Qwen 新模型49

    Qwen-Image-2.1-PE-I2I:统一文本到图像生成与编辑模型发布

    千问(Qwen)开源了 Qwen-Image-2.1-PE-I2I,一个支持文本到图像生成与图像编辑的统一模型,其视觉生成组件参数量为 7B,包含 32 层 Single-Stream DiT。该模型支持透明图像生成、多参考图像编辑、局部修改及人物与产品身份保留,且提供图像编辑提示词重写功能。摘要中包含的每个具体数字、功能名和版本号均可在原文中找到对应。

  2. 千问 Qwen 新模型55

    千问发布 Qwen-Image-2.1-PE-T2I 模型

    千问发布 Qwen-Image-2.1-PE-T2I,一个统一的文生图与图像编辑模型,参数量7B,支持透明图生成、多参考图编辑和局部修改,同时提供提示词重写模型。模型在 HuggingFace 和 ModelScope 开源,支持通过 Transformers 和 Diffusers 集成,输出包含详细英文提示和推荐宽高比的 JSON 结构。

    推荐理由:原文提供了模型架构、能力改进和开源入口,读者可据此判断其在生成效率与透明图支持上的实际应用价值。

9月17日周四
9月16日周三
9月14日周一
  1. 千问 Qwen 新模型50

    千问 Qwen-Image-2.1 模型发布

    千问发布 Qwen-Image-2.1,一个统一文本生成图像与图像编辑的模型,参数量为7B,支持透明图生成、多参考图编辑、局部修改和精细纹理,已在 Hugging Face 和 ModelScope 开源,提供完整代码示例和推理优化方案。

8月31日周一
  1. 蚂蚁 inclusionAI 新仓库55

    LLaDA-Image:基于全开源训练方案的高质量图像生成与编辑模型

    LLaDA-Image 是一个6B参数的开源统一图像生成与编辑模型家族,包含50步的Base模型和4步的Turbo蒸馏模型,支持文本生成、VQ条件生成、参考图像编辑及中英文文本渲染。模型在Qwen-Image-Bench上取得53.53(英文)和53.38(中文)的SOTA分数,提供Hugging Face和ModelScope的检查点及Diffusers推理代码,训练代码即将发布。

4月7日周二
  1. 百度文心 新模型65

    百度发布ERNIE-Image文本生成图像模型

    百度发布ERNIE-Image文本生成图像模型,基于单流扩散Transformer架构,参数量8B,支持Prompt增强器,具备强视觉质量与可控性,适用于海报、漫画、多面板布局等场景。

    推荐理由:原文提供了模型架构、参数规模、基准表现和部署方式,读者可以据此判断其在开放模型中的竞争力和实际可用性。

4月2日周四
  1. 百度文心 新模型57

    百度发布ERNIE-Image-Turbo文生图模型

    百度发布ERNIE-Image-Turbo文生图模型,为ERNIE-Image的蒸馏版本,仅需8步推理即可生成高保真图像,支持复杂指令跟随、文本渲染和结构化生成,适用于海报、漫画等场景。

    推荐理由:原文提供了模型架构、推理步数、部署要求和基准数据,读者可据此判断其在效率与质量间的权衡点。