跳到正文
10月2日周五
  1. NVIDIA 新模型61

    NVIDIA 发布 PixelUMM:无编码器统一多模态模型

    NVIDIA 发布 PixelUMM,一个无编码器的统一多模态模型,支持文本、图像和视频的联合理解与生成,直接在像素空间处理,参数量 151.99 亿,基于 Qwen3-8B 语言骨干,仅限非商业研究或评估使用。

    推荐理由:原文给出了模型架构、参数量和开放入口,读者可以据此判断它在像素空间统一理解与生成的实现路径。

9月30日周三
  1. Google Research53

    Google Research 发布 Diffusion Controller:统一简化 AI 图像生成控制框架

    Google Research 提出 Diffusion Controller 框架,将图像生成过程重构为连续控制问题,通过轻量级附加网络动态调整生成轨迹,实现用户意图与图像质量的平衡。该框架在灰盒和白盒环境下均优于 LoRA 等现有方法,在 HPS-v2 评测中取得 90% 胜率,支持运行时通过单一参数调节控制强度,适用于闭源模型。

9月23日周三
9月20日周日
  1. 千问 Qwen 新模型49

    Qwen-Image-2.1-PE-I2I:统一文本到图像生成与编辑模型发布

    千问(Qwen)开源了 Qwen-Image-2.1-PE-I2I,一个支持文本到图像生成与图像编辑的统一模型,其视觉生成组件参数量为 7B,包含 32 层 Single-Stream DiT。该模型支持透明图像生成、多参考图像编辑、局部修改及人物与产品身份保留,且提供图像编辑提示词重写功能。摘要中包含的每个具体数字、功能名和版本号均可在原文中找到对应。

  2. 千问 Qwen 新模型55

    千问发布 Qwen-Image-2.1-PE-T2I 模型

    千问发布 Qwen-Image-2.1-PE-T2I,一个统一的文生图与图像编辑模型,参数量7B,支持透明图生成、多参考图编辑和局部修改,同时提供提示词重写模型。模型在 HuggingFace 和 ModelScope 开源,支持通过 Transformers 和 Diffusers 集成,输出包含详细英文提示和推荐宽高比的 JSON 结构。

    推荐理由:原文提供了模型架构、能力改进和开源入口,读者可据此判断其在生成效率与透明图支持上的实际应用价值。

9月16日周三
9月14日周一
  1. 千问 Qwen 新模型50

    千问 Qwen-Image-2.1 模型发布

    千问发布 Qwen-Image-2.1,一个统一文本生成图像与图像编辑的模型,参数量为7B,支持透明图生成、多参考图编辑、局部修改和精细纹理,已在 Hugging Face 和 ModelScope 开源,提供完整代码示例和推理优化方案。

9月10日周四
  1. Google · AI Blog31

    Google DeepMind 与电影人合作 AI 重现 70 年爱情故事

    Google DeepMind 与电影制作团队合作,在短片《Love, Rendered》中利用生成式 AI 技术重现了一对夫妇未曾被记录的初遇记忆。团队结合图像修复模型与表演捕捉模型,将老照片复原并映射了当事人当下的细微神态。该项目展示了 AI 作为艺术媒介的潜力,相关照片修复功能已集成至 Gemini 应用中。

9月2日周三
  1. Google · AI Blog57

    Google Workspace 推出 AI 图像创作与编辑工具 Google Pics

    Google Workspace 推出 AI 图像创作与编辑工具 Google Pics,基于 Nano Banana 模型,提供对象分割、图内文字编辑与翻译、协作和多版本生成等功能。未来几周将向 Google AI Pro 和 Ultra 订阅者以及大多数 Workspace 商业客户开放,并将集成到 Slides、Docs 和 Drive 中,用户可在 pics.new 试用。

    推荐理由:原文明确了产品定位、核心功能、集成路径和开放范围,读者可以据此判断它如何融入现有工作流。

7月11日周六
  1. fal 博客37

    FASHN AI:重新构想时尚与摄影

    FASHN 为时尚品牌提供规模化生成模特图与虚拟试穿的技术方案。其系统支持企业客户并行处理 500 个并发请求,能一次性处理整个产品目录。该方案旨在解决传统摄影的物流限制,并满足品牌对产品纹理、图案和颜色精确呈现的高要求。

7月10日周五
  1. fal 博客64

    fal 博客:无损实现亚秒级 Ideogram v4 图像生成的技术路径

    fal 团队通过量化感知蒸馏、时间步蒸馏和内核融合等技术,将 Ideogram v4 在 1K 分辨率下的单图生成时间从 2.75 秒降至 0.44 秒,实现 6 倍加速且无可见质量损失。核心方法包括将模型量化至 FP4 并融合 RMSNorm 等后处理算子、将分类器引导蒸馏为单分支前向,以及通过分布匹配蒸馏将去噪步骤大幅减少。

    推荐理由:原文详细拆解了从量化、蒸馏到内核融合的完整技术路径,为追求极致推理性能的团队提供了可复现的工程方案。

6月24日周三
5月18日周一
  1. 百度文心 新模型32

    百度 ERNIE-Image-Aes:平衡类别泛化的图像美学评分模型

    百度推出 ERNIE-Image-Aes,一个基于 ArtiMuse 初始化并微调的 8B 视觉-语言模型,用于图像美学评分,在 ERIA-1K 基准测试中 SRCC 达 0.7445、PLCC 达 0.7598。该模型通过专业背景标注者参与的瑞士锦标赛式成对标注协议,避免了对特定图像类型的系统性偏见。其训练数据涵盖摄影、动漫、设计、日常快照和电影摄影等多种类别,确保评分结果的平衡性。

4月11日周六
  1. fal 博客68

    fal 发布 PATINA 模型,可从渲染图像生成 PBR 材质贴图

    fal 发布 PATINA 模型,旨在从最终渲染图像生成高分辨率、细节丰富的 PBR 材质贴图,以弥合 AI 图像与传统 CGI 工作流之间的鸿沟。该模型基于改进的 FLUX.2 [klein] 骨干,并集成了 DINOv2 适配器来增强材质理解。

    推荐理由:原文介绍了从渲染图像生成 PBR 材质贴图的新模型及其技术路径,为 CGI 工作流提供了具体工具。

4月7日周二
  1. 百度文心 新模型65

    百度发布ERNIE-Image文本生成图像模型

    百度发布ERNIE-Image文本生成图像模型,基于单流扩散Transformer架构,参数量8B,支持Prompt增强器,具备强视觉质量与可控性,适用于海报、漫画、多面板布局等场景。

    推荐理由:原文提供了模型架构、参数规模、基准表现和部署方式,读者可以据此判断其在开放模型中的竞争力和实际可用性。

4月2日周四
  1. 百度文心 新模型57

    百度发布ERNIE-Image-Turbo文生图模型

    百度发布ERNIE-Image-Turbo文生图模型,为ERNIE-Image的蒸馏版本,仅需8步推理即可生成高保真图像,支持复杂指令跟随、文本渲染和结构化生成,适用于海报、漫画等场景。

    推荐理由:原文提供了模型架构、推理步数、部署要求和基准数据,读者可据此判断其在效率与质量间的权衡点。

2月26日周四
  1. fal 博客61

    Seedream 5.0 Lite 提示词指南

    本文是基于独立测试的 Seedream 5.0 Lite 图像生成模型提示词指南。核心发现是该模型在生成前会进行多步推理,并能处理复杂场景、文本渲染、HEX 颜色控制和多语言提示。

    推荐理由:文章基于大量测试,将复杂的图像生成技巧提炼为可复用的结构化公式和具体示例。

1月20日周二