斯凯孚用 AI“复活”已故女星葛丽泰·嘉宝拍摄广告
瑞典轴承制造商斯凯孚利用 AI 技术生成已故影星葛丽泰·嘉宝的形象拍摄广告。该虚拟形象未使用历史影像,而是通过文本提示词生成,图像生成使用了字节跳动 Seedream 5 Pro 和谷歌 Gemini Nano Banana Pro,动作生成则使用了 Seedance 2、Seedance 2.5 和快手可灵 AI。广告制作已获得嘉宝遗产管理方及家属的许可,但也引发了关于“合成复活”的伦理争议。
瑞典轴承制造商斯凯孚利用 AI 技术生成已故影星葛丽泰·嘉宝的形象拍摄广告。该虚拟形象未使用历史影像,而是通过文本提示词生成,图像生成使用了字节跳动 Seedream 5 Pro 和谷歌 Gemini Nano Banana Pro,动作生成则使用了 Seedance 2、Seedance 2.5 和快手可灵 AI。广告制作已获得嘉宝遗产管理方及家属的许可,但也引发了关于“合成复活”的伦理争议。
Yoroll 平台发布《VOW:谁说带妹不能拿世界冠军》和《心动相簿》两款恋爱互动影游,其角色可化身为长线 AI 伴侣,支持文字聊天与实时视频通话。视频通话功能基于 Yoroll 自研的 H3 Superfast 实时视频模型和生数科技的 Vidu S2 数字人模型。游戏画面由 AI 生成,并融合了剧情分支、即时操作与角色数值等游戏系统。
华为推出睿影 Z10 模块相机,通过 HyperClick 超级卡口外挂于 Mate 90 Pro Max 典藏版及非凡大师机型。该模块配备 1 英寸 5000 万像素 RYYB 传感器和 24-240mm 10 倍连续光学变焦镜头,将光学与感光部分独立于手机外,并利用手机算力进行深度计算摄影处理。其专利显示图像数据传输速率可达或超过 10.7Gbps,售价接近 6000 元,定位为高端小众配件。
NASA 与 IBM Research 联合发布了开源的 NASA-IBM 月球基础模型,该模型基于 17 年月球勘测轨道飞行器(LRO)等任务提供的近 200 万个图块数据训练而成。在预测月球极地冰沉积物任务中,该模型将预测误差降低了高达 22%;在粗尺度陨石坑检测任务中,性能也提升了近 19%。该模型旨在帮助科学家更便捷地利用海量观测数据,并可通过少量标注样本适应特定任务。
SCM 是一个 macOS 本地优先的 AI 媒体搜索工具,可对照片和视频的每一帧进行语义搜索。它使用本地视觉模型(如 CLIP、SigLIP)和 Whisper 进行推理,支持基于含义、场景、OCR 文本和对话的搜索,所有数据均不离开设备。项目通过 Homebrew 安装,使用 Electron、Bun、ONNX Runtime 等技术栈构建。
推荐理由:原文详细说明了本地化多模态搜索的实现路径和隐私设计,为有类似需求的开发者提供了可参考的技术栈和架构思路。
Aleph Alpha 发布了 Kolibri-1,这是一个采用混合专家架构的开源权重英德双语大语言模型。模型总参数量为 781 亿,但每个 token 仅激活 34.6 亿参数,支持长达 1,048,576 token 的上下文,并附带 Apache 2.0 许可证。
美国 AI 视频公司 Tavus 发布实时交互模型 Griffin,在一项一分钟视频通话测试中,54 名参与者中有 26 人认为自己在和真人聊天。Griffin 采用端到端的全双工视频到视频架构,能实时生成语音、表情和手势,平均反应延迟为 0.43 秒。Tavus 表示该模型目前仅向少数受信任的测试者开放,并正在开发主动披露身份的安全功能。
推荐理由:原文提供了模型的核心能力、技术架构和测试数据,读者可以据此评估其在实时交互领域的突破性。
GPT-6 Astra发布后,其3D建模能力引发讨论,但专业AI 3D生成公司Meshy的ARR在不到两年内从100万美元增长至1亿美元。文章对比了GPT-6 Astra在程序化建模上的优势与Meshy在生成高质量、可直接使用的3D资产(如角色、道具)上的专业壁垒,包括形状、细节和纹理的准确性。
Google 在2026年9月发布了新一代前沿模型 Gemini 4 Argon,其具备高级推理能力,并拥有行业领先的100万token输出上限,专为应对网络安全防御等复杂挑战而设计。
MIT、Google 和东北大学的研究人员开发了名为 InstructMesh 的 AI 驱动设计软件,让用户能轻松修复 AI 生成的 3D 模型缺陷并按需制造。
Cloudflare AI Search 现已正式可用,新增了对多模态格式的原生支持,包括图像嵌入、PDF的OCR以及更大的文件处理能力。计费将于2026年11月1日开始,所有 Workers 计划仍提供免费额度。
推荐理由:原文详细说明了新增的多模态嵌入、文件处理和OCR功能,以及从预览到正式可用的计费模式变化。
Google DeepMind 宣布推出前沿模型 Gemini 4 Argon,旨在处理复杂、长周期的跨领域工作流。该模型在 DeepSWE v1.1 上达到 77.9% 的 SOTA 水平,输出 token 上限提升至 100 万,定价为每百万输入 token 2 美元、输出 token 10 美元。
推荐理由:原文详细列举了模型在软件工程、金融法律和网络安全等领域的性能表现及定价,读者可以据此评估其实际应用潜力。
文章对 HiDream-O1-Video-1.0、Seedance 2.5 和 MiniMax H3 进行了三组原创图生视频任务对比测试,重点关注意图规划、时间因果和音画对应。测试发现,HiDream 在动作、声音、结果的时序关系上表现更优,例如料酒入锅后油爆声和火焰依次出现,而其他模型存在火焰早于声音或对象一致性等问题。评测基于相同参考图和提示词,在端到端产品环境中进行。
推荐理由:文章通过三组原创对比测试,量化分析了视频模型在时序因果和音画同步上的表现差异,为理解模型能力提供了具体案例。
FrameMorrow 提出一种前瞻性帧选择方法,通过预测代表未来信息需求的小型前瞻性 token 集来从历史中选择相关信息。该方法选择显式的历史帧而非模型内部状态,能以即插即用方式集成到包括闭源模型在内的多种生成器中,且额外推理成本很低。在涵盖长视频生成、交互式生成和动作条件世界模型的 5 个基准测试和 11 个生成模型上的广泛实验表明,其在长程一致性、视觉质量和动作对齐方面均有持续提升。
Condé Nast 与 AWS 生成式 AI 创新中心合作,基于 Amazon Bedrock 和 Amazon OpenSearch Service 构建了 AI 驱动的多模态视频发现解决方案。
微软研究院推出名为Quine的生物AI研究系统,该系统包含一个多模态生物世界模型和一个连接模型、科学工具、文献与研究人员的工作平台。在与Broad Institute的合作中,Quine被用于预测和优先排序能驱动肿瘤细胞状态转变的化合物,其排名靠前的候选物在湿实验室实验中得到了验证。
推荐理由:原文展示了该系统在癌症研究中的具体应用案例和效果,为关注AI在生物科学领域落地的读者提供了实践参考。
AMD 以 82 亿美元收购了 AI 空间智能公司 World Labs。World Labs 近期发布了首创的通用模型架构 Atlas,它通过结合生成模型与多视图几何,解决了稀疏重建这一计算机视觉长期难题,在从 2D 图像预测新相机视角的任务上超越了当前最先进的专用模型。该技术对机器人、设计、工程和科学等领域具有广泛影响。
布鲁克林杂货店 Edy's Grocer 使用 Gemini 将家庭食谱按需转换为大型餐饮批量配方,并自动生成按货架分类的购物清单。Gemini 还能快速提供符合饮食限制的创意食材替换方案,帮助店主节省行政任务时间,专注于推广黎巴嫩美食与文化。
视频生成初创公司 Synthesia 为一名记者创建了其专属的可交互数字分身,该分身仅能回答关于其特定报道《为何风投支持的初创公司欺诈更多》的问题。该交互分身结合了语音转文本、视频、语言和文本转语音模型,企业客户还可选择集成 Cartesia、ElevenLabs、Google 或 OpenAI 的模型。
Google 为 Gemini Enterprise 用户推出了 Live Avatar 功能,能将 AI 智能体与可交互的虚拟形象结合,用于视频聊天处理保险理赔等任务。该功能支持唇形同步、实时音频视频处理,并能同时运行工具和 API 调用。目前仅提供预制的虚拟形象供企业选择,所有音视频内容均使用 SynthID 进行水印以验证其 AI 生成属性。
NVIDIA 发布了专为 3D 计算机断层扫描设计的开源视觉语言模型 NV-Reason-CT Open。该模型旨在支持放射科医生的链式推理,以应对前沿通用模型在体成像上表现不佳、现有开源医疗 AI 模型能力不足的现状。
小米的 MiMo V2.6 Pro、MiMo V2.6 Flash 和 MiMo V2.6 Pro UltraSpeed 三款模型现已在 AI Gateway 平台上线。
Google 的 Envisioning Studio 与设计师 Jane Wade 和 Sergio Hudson 合作,利用 Google Flow AI 创意工作室开发了两款定制工具。
MIT团队开发的xvr系统可在约5分钟内完成患者特异性AI模型训练,实现X射线与3D医学扫描的秒级、亚毫米级精准配准。该模型基于物理仿真生成患者专属合成X射线,避免幻觉,性能较现有AI方法提升一个数量级。系统已通过多类患者、身体部位和手术场景验证,有望提升微创手术的安全性与可及性。
Google AI 技术现已支持超过 300 种语言,覆盖全球 86% 的人口。其 AlphaGenome Atlas 公开了人类基因组中所有 90 亿种可能的单字母遗传变化的预测影响,WeatherNext 3 天气模型则将提前一天或更久的降水预报准确率提高了 50%。
Google 宣布其技术与产品已支持超过 300 种语言,覆盖全球 86% 的人口。Gemini 3.5 Live Translate 支持 70 种语言的实时口语翻译,而基于 1200 万小时音频训练的通用语音模型正助力实现“千种语言计划”。
NVIDIA 介绍了使用 Encode-Prefill-Decode (EPD) 解耦技术来优化多模态模型推理。该技术将视觉编码器阶段与预填充和解码阶段分离,尤其适用于图像密集型提示词、中短输出及量化 MoE 模型。结合 NVIDIA Dynamo 使用,可实现高达 5 倍的推理加速。
Google DeepMind 与电影制作团队合作,在短片《Love, Rendered》中利用生成式 AI 技术重现了一对夫妇未曾被记录的初遇记忆。团队结合图像修复模型与表演捕捉模型,将老照片复原并映射了当事人当下的细微神态。该项目展示了 AI 作为艺术媒介的潜力,相关照片修复功能已集成至 Gemini 应用中。
Google 的音乐生成模型 Lyria 3.5 已在 Gemini 应用和 Gemini API 中面向全球用户推出。该模型提供更具表现力的人声和更丰富的编曲,用户可在应用内选择流派、人声/器乐风格,并使用新模板快速创作。Lyria 3.5 也通过 Google Flow Music、Google AI Studio 和 Google Vids 提供给艺术家、开发者和技术人员使用。
一项测试显示,主流 AI 模型在识别蘑菇物种时错误率很高,可能将致命毒蘑菇误判为可食用。表现最佳的 Gemini-3.8-flash 首次猜测正确率仅为 65%,而 Qwen3.8-27b 将毒蘑菇误判为可食用的比例高达 36%。研究者警告,不应依赖 AI 判断蘑菇安全性,因为单张照片不足以准确识别,错误可能带来致命后果。
Google 在 2026 年 8 月发布了多款 AI 产品,包括面向编程和智能体的高效模型 Gemini 3.7 Flash,以及专为实时转录设计的 Gemini 3.5 Transcribe。同期推出的 Pixel 11 系列设备搭载了 Google Tensor G6 芯片和最新的 Gemini Nano 模型。此外,Gemini 应用的月活用户已超过 10 亿。
Microsoft Research 推出高效病理学基础模型 GigaPath-Flash 和 GigaTIME-Flash,显著降低了计算需求。GigaPath-Flash 参数量为 2200 万,在保持性能的同时将推理成本降至原 GigaPath 的约 1/50。这两个基于 Apache 2.0 协议开源的研究模型旨在支持大规模病理数据分析,推动群体规模的疾病生物学研究。
在多模态图像识别测试中,Gemini 的表现优于 ChatGPT,能准确识别潦草手写文字并指出笔迹特征,而 ChatGPT 则出现转录错误。
Microsoft Research 推出 MindTopo 基准,用于评估多模态大语言模型对连通性、包围、顺序、分离和绳结等拓扑关系的理解能力。测试发现,模型在静态图像识别任务上的表现远优于需要规划与交互的任务,表明其难以在动态场景中维持对拓扑结构的一致性理解。这一差距凸显了在机器人学和交互式环境等需要可靠决策的领域,提升 AI 系统拓扑推理能力的重要性。
Meta Superintelligence Labs 发布的首个开源多模态模型 Muse Glimmer 现已可在 Ollama 上运行。这是一个 30B 参数、专为本地智能体工作负载设计的模型,拥有 128K+ 上下文长度,采用 Apache 2.0 许可证。
推荐理由:原文提供了模型参数、许可证、支持的智能体框架和性能优化细节,读者可以据此评估其本地部署的适用性。
Replit 发布新的创意套件 Replit Design,旨在让用户快速将想法转化为设计。它内置 Ambient Intelligence 引导设计流程,支持调用 Claude、GPT-5、Gemini、Kimi 和 GLM 等模型,并集成了 Mobbin UI/UX 参考库和设计系统。该功能现已对所有用户开放。
MIT 与 IBM 等机构的研究人员开发了名为 GIFT 的系统,能指导视觉语言模型自动将 2D 设计图转换为更准确、功能更完善的 CAD 程序。该系统通过让模型从自身错误中学习来生成训练数据,在仅使用约 20% 计算量的情况下,其生成的 CAD 程序准确性超越了其他方法。这一技术有望加速快速原型设计流程并降低成本。
Thinking Machines Lab 发布了多模态专家混合模型 Inkling,支持文本、图像和音频输入,具备可控推理深度和广泛的微调能力。Inkling 采用查询条件相对注意力、短因果卷积和共享专家池 MoE 等架构创新,总参数量 975B,活跃参数量 40B,上下文窗口为 1M token。
推荐理由:原文介绍了新模型的核心架构创新和可控推理特性,读者可以了解其技术路径与现有模型的差异。
fal 团队构建了一个完全可控的AI视频生成管线,从3D分镜设计到最终成片,并开源了核心的3DREAL Strong v2 LoRA适配器。
推荐理由:原文详细拆解了从3D分镜到AI生成视频的完整工作流,包括具体的工具链、验证步骤和迭代经验,可供从业者复现或借鉴其方法。
Vector Institute 与欧洲航天局(ESA)建立合作伙伴关系,共同开发用于地球观测的人工智能新应用。合作初期将重点聚焦于气候科学和北极监测,Vector 学院教员 Evan Shelhamer 已作为访问教授加入 ESA 的 Φ-lab。此次合作旨在利用 AI 处理 ESA Copernicus Sentinel 卫星群产生的大量数据,并将科学开放性和可及性作为核心设计原则。