跳到正文
  1. The Guardian · AI66

    AI聊天机器人在提示下移除穆斯林女性头巾引发伦理争议

    The Guardian测试了ChatGPT、Grok、Gemini和Claude在被要求移除AI生成图像中穆斯林女性头巾时的反应。ChatGPT和Grok均执行了该操作,Gemini在被要求“更西方化”时也生成了无头巾图像,Claude则拒绝并说明其不支持此类编辑。

    推荐理由:原文通过实测多个主流AI聊天机器人对宗教头饰的编辑反应,揭示了当前AI伦理边界在宗教与身份表达上的模糊地带。

  1. 雷锋网59

    HiDream-O1-Video 与 Seedance 2.5、MiniMax H3 的时序因果与音画同步对比评测

    文章对 HiDream-O1-Video-1.0、Seedance 2.5 和 MiniMax H3 进行了三组原创图生视频任务对比测试,重点关注意图规划、时间因果和音画对应。测试发现,HiDream 在动作、声音、结果的时序关系上表现更优,例如料酒入锅后油爆声和火焰依次出现,而其他模型存在火焰早于声音或对象一致性等问题。评测基于相同参考图和提示词,在端到端产品环境中进行。

    推荐理由:文章通过三组原创对比测试,量化分析了视频模型在时序因果和音画同步上的表现差异,为理解模型能力提供了具体案例。

  1. Google Research56

    Google 发布多代理框架实现连贯长视频生成

    Google 研究团队提出 AI 视频协导演框架,基于 Gemini 和 Veo 构建统一多代理系统,通过全局优化、视觉记忆追踪、自回归生成与闭环质量评估,解决长视频生成中的语义漂移、特征漂移和内容坍缩问题。

    推荐理由:原文系统性地提出了多代理框架解决长视频生成中的连贯性问题,提供了可复现的技术路径和基准测试结果。

  1. 蚂蚁 inclusionAI 新仓库60

    Realtime-Venus:支持全双工交互与异步任务委托的多模态系统

    Realtime-Venus 是由蚂蚁集团 Venus 团队与清华大学联合发布的全双工多模态交互系统,包含 Omni 和 Audio 两个 9B 模型及共享运行时 Harness,支持实时音视频输入、主动响应、异步任务委托与结果回传。

    推荐理由:原文公开了模型架构、异步执行框架和完整代码,读者可直接复用其双通道交互与任务委托机制。

  1. 蚂蚁 inclusionAI 新仓库58

    LLaDA-UI:基于块级扩散的多模态 GUI 智能体

    LLaDA-UI 是一个基于 MoE 的块级扩散视觉-语言 GUI 智能体,结合动态分辨率视觉编码器与 LLaDA2.0-mini-base 扩散语言骨干,通过块级扩散解码器生成推理与 GUI 动作。

    推荐理由:该研究提出基于块级扩散的多模态 GUI 智能体,结合动态分辨率视觉编码器与扩散语言骨干,支持跨平台交互,可复现其推理流程与数据生成管道。

已经到底了