跳到正文

技术方向

AI 视频 最新动态

AI 视频生成与理解:文生视频模型、视频编辑工具与影视创作变革的追踪。

7 条精选近 30 天 4 条共收录 24 条

更新

AI 视频的精选

10月4日周日第 1–7 条
  1. 极客公园62

    Tavus 发布实时交互模型 Griffin,近半数测试者未能分辨其为 AI

    美国 AI 视频公司 Tavus 发布实时交互模型 Griffin,在一项一分钟视频通话测试中,54 名参与者中有 26 人认为自己在和真人聊天。Griffin 采用端到端的全双工视频到视频架构,能实时生成语音、表情和手势,平均反应延迟为 0.43 秒。Tavus 表示该模型目前仅向少数受信任的测试者开放,并正在开发主动披露身份的安全功能。

    推荐理由:原文提供了模型的核心能力、技术架构和测试数据,读者可以据此评估其在实时交互领域的突破性。

9月30日周三
  1. 雷锋网59

    HiDream-O1-Video 与 Seedance 2.5、MiniMax H3 的时序因果与音画同步对比评测

    文章对 HiDream-O1-Video-1.0、Seedance 2.5 和 MiniMax H3 进行了三组原创图生视频任务对比测试,重点关注意图规划、时间因果和音画对应。测试发现,HiDream 在动作、声音、结果的时序关系上表现更优,例如料酒入锅后油爆声和火焰依次出现,而其他模型存在火焰早于声音或对象一致性等问题。评测基于相同参考图和提示词,在端到端产品环境中进行。

    推荐理由:文章通过三组原创对比测试,量化分析了视频模型在时序因果和音画同步上的表现差异,为理解模型能力提供了具体案例。

9月25日周五
  1. Google Research56

    Google 发布多代理框架实现连贯长视频生成

    Google 研究团队提出 AI 视频协导演框架,基于 Gemini 和 Veo 构建统一多代理系统,通过全局优化、视觉记忆追踪、自回归生成与闭环质量评估,解决长视频生成中的语义漂移、特征漂移和内容坍缩问题。

    推荐理由:原文系统性地提出了多代理框架解决长视频生成中的连贯性问题,提供了可复现的技术路径和基准测试结果。

9月18日周五
  1. fal 博客63

    fal 平台详解 H3 Max 视频模型的训练、部署与分发全流程

    fal 平台发布文章,详细介绍了视频生成模型 H3 Max 如何在其平台上完成从训练、部署到分发的全生命周期。H3 Max 在 fal Compute 上进行后训练,以在保持质量的同时最小化推理时间。

    推荐理由:原文详细拆解了从模型训练优化到大规模部署的完整技术栈,展示了如何通过基础设施设计同时降低推理延迟和端到端延迟。

9月2日周三
  1. Google · Gemini 博客62

    Google 为 Gemini Flash 系列模型推出智能体视频理解功能

    Google 为 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 模型推出了智能体视频理解功能。该功能通过动态搜索视频片段,将分析成本降低高达 66%,token 消耗减少高达 88%,同时将准确性提升高达 7%。

    推荐理由:原文给出了新功能在成本、效率和准确性上的具体提升数据,以及支持的模型和开放入口,读者可以据此评估其对视频分析工作流的影响。

8月28日周五
  1. fal 博客59

    fal 发布 H3 Max 视频生成模型

    fal 发布了 H3 Max,这是一个基于 MiniMax H3 进行后训练优化的视频生成模型,在人类偏好评估中,其在整体质量、提示词理解和美学三个维度均排名第一。该模型生成 5 秒视频的时间不到 3 秒,吞吐量约为官方 MiniMax H3 端点的 35 倍。H3 Max 现已上线 fal 平台,可通过 Playground、fal Agent 或 API 使用。

    推荐理由:原文展示了模型在质量和速度上的双重优势,并提供了与原始模型的对比数据,读者可以据此评估其实际应用潜力。

7月13日周一