Yoroll 平台推出《VOW》与《心动相簿》两款 AI 恋爱互动影游,角色可化为长线 AI 伴侣
Yoroll 平台发布《VOW:谁说带妹不能拿世界冠军》和《心动相簿》两款恋爱互动影游,其角色可化身为长线 AI 伴侣,支持文字聊天与实时视频通话。视频通话功能基于 Yoroll 自研的 H3 Superfast 实时视频模型和生数科技的 Vidu S2 数字人模型。游戏画面由 AI 生成,并融合了剧情分支、即时操作与角色数值等游戏系统。
Yoroll 平台发布《VOW:谁说带妹不能拿世界冠军》和《心动相簿》两款恋爱互动影游,其角色可化身为长线 AI 伴侣,支持文字聊天与实时视频通话。视频通话功能基于 Yoroll 自研的 H3 Superfast 实时视频模型和生数科技的 Vidu S2 数字人模型。游戏画面由 AI 生成,并融合了剧情分支、即时操作与角色数值等游戏系统。
Simon Willison 利用 GPT-6 Astra 构建了一个实验性工具 Photo Scrubber,用于在本地自动识别并模糊照片中的人脸。该工具基于 Google 的 MediaPipe C++ 库和 BlazeFace 人脸检测模型,通过 WebAssembly 在浏览器中运行,旨在保护隐私。
Dazzle 是一款由前雅虎 CEO Marissa Mayer 推出的个人 AI 助手,其核心特点是仅通过分析用户手机相册来获取上下文信息。该助手能识别用户的爱好、旅行记录和风格偏好,并提供个性化活动与礼物建议,同时强调优先处理用户隐私。Dazzle 在去年 12 月已完成 800 万美元种子轮融资,用户可通过应用或短信与之交互。
AMD 以 82 亿美元收购了 AI 空间智能公司 World Labs。World Labs 近期发布了首创的通用模型架构 Atlas,它通过结合生成模型与多视图几何,解决了稀疏重建这一计算机视觉长期难题,在从 2D 图像预测新相机视角的任务上超越了当前最先进的专用模型。该技术对机器人、设计、工程和科学等领域具有广泛影响。
GTR 是一种无需 softmax 的视觉主干模型,结合门控线性注意力、交替空间扫描方向和空间增强的 SwiGLU 模块,用于高效密集预测。GTR-L 在 COCO val2017 上达到 58.9 box AP,使用 RTX 4090 编译后的 FP16 执行时,单批次推理延迟为 1.908 ms。
Google DeepMind 与电影制作团队合作,在短片《Love, Rendered》中利用生成式 AI 技术重现了一对夫妇未曾被记录的初遇记忆。团队结合图像修复模型与表演捕捉模型,将老照片复原并映射了当事人当下的细微神态。该项目展示了 AI 作为艺术媒介的潜力,相关照片修复功能已集成至 Gemini 应用中。
Google 推出面向企业客户的 AI 图像生成与编辑工具 Google Pics,基于 Nano Banana 模型。该工具提供精准编辑功能,可生成 2K 和 4K 图像,并直接集成到 Slides、Docs 和 Drive 等 Workspace 应用中。
Google Workspace 推出 AI 图像创作与编辑工具 Google Pics,基于 Nano Banana 模型,提供对象分割、图内文字编辑与翻译、协作和多版本生成等功能。未来几周将向 Google AI Pro 和 Ultra 订阅者以及大多数 Workspace 商业客户开放,并将集成到 Slides、Docs 和 Drive 中,用户可在 pics.new 试用。
推荐理由:原文明确了产品定位、核心功能、集成路径和开放范围,读者可以据此判断它如何融入现有工作流。
FASHN 为时尚品牌提供规模化生成模特图与虚拟试穿的技术方案。其系统支持企业客户并行处理 500 个并发请求,能一次性处理整个产品目录。该方案旨在解决传统摄影的物流限制,并满足品牌对产品纹理、图案和颜色精确呈现的高要求。
fal 团队通过量化感知蒸馏、时间步蒸馏和内核融合等技术,将 Ideogram v4 在 1K 分辨率下的单图生成时间从 2.75 秒降至 0.44 秒,实现 6 倍加速且无可见质量损失。核心方法包括将模型量化至 FP4 并融合 RMSNorm 等后处理算子、将分类器引导蒸馏为单分支前向,以及通过分布匹配蒸馏将去噪步骤大幅减少。
推荐理由:原文详细拆解了从量化、蒸馏到内核融合的完整技术路径,为追求极致推理性能的团队提供了可复现的工程方案。
fal 发布 PATINA 模型,旨在从最终渲染图像生成高分辨率、细节丰富的 PBR 材质贴图,以弥合 AI 图像与传统 CGI 工作流之间的鸿沟。该模型基于改进的 FLUX.2 [klein] 骨干,并集成了 DINOv2 适配器来增强材质理解。
推荐理由:原文介绍了从渲染图像生成 PBR 材质贴图的新模型及其技术路径,为 CGI 工作流提供了具体工具。
本文是基于独立测试的 Seedream 5.0 Lite 图像生成模型提示词指南。核心发现是该模型在生成前会进行多步推理,并能处理复杂场景、文本渲染、HEX 颜色控制和多语言提示。
推荐理由:文章基于大量测试,将复杂的图像生成技巧提炼为可复用的结构化公式和具体示例。
Ollama 在 macOS 平台新增实验性图像生成功能,支持运行 x/z-image-turbo 和 x/flux2-klein 等模型。