NVIDIA 发布 PixelUMM:无编码器统一多模态模型
NVIDIA 发布 PixelUMM,一个无编码器的统一多模态模型,支持文本、图像和视频的联合理解与生成,直接在像素空间处理,参数量 151.99 亿,基于 Qwen3-8B 语言骨干,仅限非商业研究或评估使用。
推荐理由:原文给出了模型架构、参数量和开放入口,读者可以据此判断它在像素空间统一理解与生成的实现路径。
NVIDIA 发布 PixelUMM,一个无编码器的统一多模态模型,支持文本、图像和视频的联合理解与生成,直接在像素空间处理,参数量 151.99 亿,基于 Qwen3-8B 语言骨干,仅限非商业研究或评估使用。
推荐理由:原文给出了模型架构、参数量和开放入口,读者可以据此判断它在像素空间统一理解与生成的实现路径。
Google Research 提出 Diffusion Controller 框架,将图像生成过程重构为连续控制问题,通过轻量级附加网络动态调整生成轨迹,实现用户意图与图像质量的平衡。该框架在灰盒和白盒环境下均优于 LoRA 等现有方法,在 HPS-v2 评测中取得 90% 胜率,支持运行时通过单一参数调节控制强度,适用于闭源模型。
GTR 是一种无需 softmax 的视觉主干模型,结合门控线性注意力、交替空间扫描方向和空间增强的 SwiGLU 模块,用于高效密集预测。GTR-L 在 COCO val2017 上达到 58.9 box AP,使用 RTX 4090 编译后的 FP16 执行时,单批次推理延迟为 1.908 ms。
千问(Qwen)开源了 Qwen-Image-2.1-PE-I2I,一个支持文本到图像生成与图像编辑的统一模型,其视觉生成组件参数量为 7B,包含 32 层 Single-Stream DiT。该模型支持透明图像生成、多参考图像编辑、局部修改及人物与产品身份保留,且提供图像编辑提示词重写功能。摘要中包含的每个具体数字、功能名和版本号均可在原文中找到对应。
千问发布 Qwen-Image-2.1-PE-T2I,一个统一的文生图与图像编辑模型,参数量7B,支持透明图生成、多参考图编辑和局部修改,同时提供提示词重写模型。模型在 HuggingFace 和 ModelScope 开源,支持通过 Transformers 和 Diffusers 集成,输出包含详细英文提示和推荐宽高比的 JSON 结构。
推荐理由:原文提供了模型架构、能力改进和开源入口,读者可据此判断其在生成效率与透明图支持上的实际应用价值。
NVIDIA 发布了 RT-DETR-Hand-Detector-v1 手部检测模型,用于从 RGB 图像中直接检测和定位双手。该模型基于 RT-DETRv2-S 架构,包含 HGNetv2-S 主干网络、高效混合编码器和 TransformerDecoder 头,参数量约为 20M,支持 Linux 系统和 NVIDIA Lovelace 架构。
千问发布 Qwen-Image-2.1,一个统一文本生成图像与图像编辑的模型,参数量为7B,支持透明图生成、多参考图编辑、局部修改和精细纹理,已在 Hugging Face 和 ModelScope 开源,提供完整代码示例和推理优化方案。
Google DeepMind 与电影制作团队合作,在短片《Love, Rendered》中利用生成式 AI 技术重现了一对夫妇未曾被记录的初遇记忆。团队结合图像修复模型与表演捕捉模型,将老照片复原并映射了当事人当下的细微神态。该项目展示了 AI 作为艺术媒介的潜力,相关照片修复功能已集成至 Gemini 应用中。
Google Workspace 推出 AI 图像创作与编辑工具 Google Pics,基于 Nano Banana 模型,提供对象分割、图内文字编辑与翻译、协作和多版本生成等功能。未来几周将向 Google AI Pro 和 Ultra 订阅者以及大多数 Workspace 商业客户开放,并将集成到 Slides、Docs 和 Drive 中,用户可在 pics.new 试用。
推荐理由:原文明确了产品定位、核心功能、集成路径和开放范围,读者可以据此判断它如何融入现有工作流。
FASHN 为时尚品牌提供规模化生成模特图与虚拟试穿的技术方案。其系统支持企业客户并行处理 500 个并发请求,能一次性处理整个产品目录。该方案旨在解决传统摄影的物流限制,并满足品牌对产品纹理、图案和颜色精确呈现的高要求。
fal 团队通过量化感知蒸馏、时间步蒸馏和内核融合等技术,将 Ideogram v4 在 1K 分辨率下的单图生成时间从 2.75 秒降至 0.44 秒,实现 6 倍加速且无可见质量损失。核心方法包括将模型量化至 FP4 并融合 RMSNorm 等后处理算子、将分类器引导蒸馏为单分支前向,以及通过分布匹配蒸馏将去噪步骤大幅减少。
推荐理由:原文详细拆解了从量化、蒸馏到内核融合的完整技术路径,为追求极致推理性能的团队提供了可复现的工程方案。
Weights & Biases 推出方法帮助用户构建图像生成模型的品牌感知评估循环,支持跟踪提示词保真度、FID 和品牌合规性。该方法通过集成 Weave 实现无缝评估,适用于需要确保生成内容符合品牌规范的场景。
百度推出 ERNIE-Image-Aes,一个基于 ArtiMuse 初始化并微调的 8B 视觉-语言模型,用于图像美学评分,在 ERIA-1K 基准测试中 SRCC 达 0.7445、PLCC 达 0.7598。该模型通过专业背景标注者参与的瑞士锦标赛式成对标注协议,避免了对特定图像类型的系统性偏见。其训练数据涵盖摄影、动漫、设计、日常快照和电影摄影等多种类别,确保评分结果的平衡性。
fal 发布 PATINA 模型,旨在从最终渲染图像生成高分辨率、细节丰富的 PBR 材质贴图,以弥合 AI 图像与传统 CGI 工作流之间的鸿沟。该模型基于改进的 FLUX.2 [klein] 骨干,并集成了 DINOv2 适配器来增强材质理解。
推荐理由:原文介绍了从渲染图像生成 PBR 材质贴图的新模型及其技术路径,为 CGI 工作流提供了具体工具。
百度发布ERNIE-Image文本生成图像模型,基于单流扩散Transformer架构,参数量8B,支持Prompt增强器,具备强视觉质量与可控性,适用于海报、漫画、多面板布局等场景。
推荐理由:原文提供了模型架构、参数规模、基准表现和部署方式,读者可以据此判断其在开放模型中的竞争力和实际可用性。
百度发布ERNIE-Image-Turbo文生图模型,为ERNIE-Image的蒸馏版本,仅需8步推理即可生成高保真图像,支持复杂指令跟随、文本渲染和结构化生成,适用于海报、漫画等场景。
推荐理由:原文提供了模型架构、推理步数、部署要求和基准数据,读者可据此判断其在效率与质量间的权衡点。
本文是基于独立测试的 Seedream 5.0 Lite 图像生成模型提示词指南。核心发现是该模型在生成前会进行多步推理,并能处理复杂场景、文本渲染、HEX 颜色控制和多语言提示。
推荐理由:文章基于大量测试,将复杂的图像生成技巧提炼为可复用的结构化公式和具体示例。
Ollama 在 macOS 平台新增实验性图像生成功能,支持运行 x/z-image-turbo 和 x/flux2-klein 等模型。