Google Research 发布 Diffusion Controller:统一简化 AI 图像生成控制框架
Google Research 提出 Diffusion Controller 框架,将图像生成过程重构为连续控制问题,通过轻量级附加网络动态调整生成轨迹,实现用户意图与图像质量的平衡。该框架在灰盒和白盒环境下均优于 LoRA 等现有方法,在 HPS-v2 评测中取得 90% 胜率,支持运行时通过单一参数调节控制强度,适用于闭源模型。
Google Research 提出 Diffusion Controller 框架,将图像生成过程重构为连续控制问题,通过轻量级附加网络动态调整生成轨迹,实现用户意图与图像质量的平衡。该框架在灰盒和白盒环境下均优于 LoRA 等现有方法,在 HPS-v2 评测中取得 90% 胜率,支持运行时通过单一参数调节控制强度,适用于闭源模型。
GTR 是一种无需 softmax 的视觉主干模型,结合门控线性注意力、交替空间扫描方向和空间增强的 SwiGLU 模块,用于高效密集预测。GTR-L 在 COCO val2017 上达到 58.9 box AP,使用 RTX 4090 编译后的 FP16 执行时,单批次推理延迟为 1.908 ms。
百度推出 ERNIE-Image-Aes,一个基于 ArtiMuse 初始化并微调的 8B 视觉-语言模型,用于图像美学评分,在 ERIA-1K 基准测试中 SRCC 达 0.7445、PLCC 达 0.7598。该模型通过专业背景标注者参与的瑞士锦标赛式成对标注协议,避免了对特定图像类型的系统性偏见。其训练数据涵盖摄影、动漫、设计、日常快照和电影摄影等多种类别,确保评分结果的平衡性。