跳到正文
今天10月5日周一2 条
  1. IT之家45

    斯凯孚用 AI“复活”已故女星葛丽泰·嘉宝拍摄广告

    瑞典轴承制造商斯凯孚利用 AI 技术生成已故影星葛丽泰·嘉宝的形象拍摄广告。该虚拟形象未使用历史影像,而是通过文本提示词生成,图像生成使用了字节跳动 Seedream 5 Pro 和谷歌 Gemini Nano Banana Pro,动作生成则使用了 Seedance 2、Seedance 2.5 和快手可灵 AI。广告制作已获得嘉宝遗产管理方及家属的许可,但也引发了关于“合成复活”的伦理争议。

  2. 钛媒体47

    Yoroll 平台推出《VOW》与《心动相簿》两款 AI 恋爱互动影游,角色可化为长线 AI 伴侣

    Yoroll 平台发布《VOW:谁说带妹不能拿世界冠军》和《心动相簿》两款恋爱互动影游,其角色可化身为长线 AI 伴侣,支持文字聊天与实时视频通话。视频通话功能基于 Yoroll 自研的 H3 Superfast 实时视频模型和生数科技的 Vidu S2 数字人模型。游戏画面由 AI 生成,并融合了剧情分支、即时操作与角色数值等游戏系统。

10月4日周日
  1. 爱范儿44

    华为睿影 Z10 模块相机:如何在 Mate 90 上复活「外挂相机」?|硬哲学

    华为推出睿影 Z10 模块相机,通过 HyperClick 超级卡口外挂于 Mate 90 Pro Max 典藏版及非凡大师机型。该模块配备 1 英寸 5000 万像素 RYYB 传感器和 24-240mm 10 倍连续光学变焦镜头,将光学与感光部分独立于手机外,并利用手机算力进行深度计算摄影处理。其专利显示图像数据传输速率可达或超过 10.7Gbps,售价接近 6000 元,定位为高端小众配件。

  2. The Decoder43

    NASA 与 IBM 开源月球基础模型,将 17 年轨道器数据转化为月球科学基础

    NASA 与 IBM Research 联合发布了开源的 NASA-IBM 月球基础模型,该模型基于 17 年月球勘测轨道飞行器(LRO)等任务提供的近 200 万个图块数据训练而成。在预测月球极地冰沉积物任务中,该模型将预测误差降低了高达 22%;在粗尺度陨石坑检测任务中,性能也提升了近 19%。该模型旨在帮助科学家更便捷地利用海量观测数据,并可通过少量标注样本适应特定任务。

  3. Hacker News · AI 高赞68

    SCM 发布 macOS 本地 AI 媒体搜索工具

    SCM 是一个 macOS 本地优先的 AI 媒体搜索工具,可对照片和视频的每一帧进行语义搜索。它使用本地视觉模型(如 CLIP、SigLIP)和 Whisper 进行推理,支持基于含义、场景、OCR 文本和对话的搜索,所有数据均不离开设备。项目通过 Homebrew 安装,使用 Electron、Bun、ONNX Runtime 等技术栈构建。

    推荐理由:原文详细说明了本地化多模态搜索的实现路径和隐私设计,为有类似需求的开发者提供了可参考的技术栈和架构思路。

  4. 极客公园62

    Tavus 发布实时交互模型 Griffin,近半数测试者未能分辨其为 AI

    美国 AI 视频公司 Tavus 发布实时交互模型 Griffin,在一项一分钟视频通话测试中,54 名参与者中有 26 人认为自己在和真人聊天。Griffin 采用端到端的全双工视频到视频架构,能实时生成语音、表情和手势,平均反应延迟为 0.43 秒。Tavus 表示该模型目前仅向少数受信任的测试者开放,并正在开发主动披露身份的安全功能。

    推荐理由:原文提供了模型的核心能力、技术架构和测试数据,读者可以据此评估其在实时交互领域的突破性。

10月2日周五
10月1日周四
  1. Cloudflare · AI54

    Cloudflare AI Search 正式可用,支持多模态嵌入与更大文件

    Cloudflare AI Search 现已正式可用,新增了对多模态格式的原生支持,包括图像嵌入、PDF的OCR以及更大的文件处理能力。计费将于2026年11月1日开始,所有 Workers 计划仍提供免费额度。

    推荐理由:原文详细说明了新增的多模态嵌入、文件处理和OCR功能,以及从预览到正式可用的计费模式变化。

  2. Google DeepMind76

    Google DeepMind 发布前沿模型 Gemini 4 Argon

    Google DeepMind 宣布推出前沿模型 Gemini 4 Argon,旨在处理复杂、长周期的跨领域工作流。该模型在 DeepSWE v1.1 上达到 77.9% 的 SOTA 水平,输出 token 上限提升至 100 万,定价为每百万输入 token 2 美元、输出 token 10 美元。

    推荐理由:原文详细列举了模型在软件工程、金融法律和网络安全等领域的性能表现及定价,读者可以据此评估其实际应用潜力。

9月30日周三
  1. 雷锋网59

    HiDream-O1-Video 与 Seedance 2.5、MiniMax H3 的时序因果与音画同步对比评测

    文章对 HiDream-O1-Video-1.0、Seedance 2.5 和 MiniMax H3 进行了三组原创图生视频任务对比测试,重点关注意图规划、时间因果和音画对应。测试发现,HiDream 在动作、声音、结果的时序关系上表现更优,例如料酒入锅后油爆声和火焰依次出现,而其他模型存在火焰早于声音或对象一致性等问题。评测基于相同参考图和提示词,在端到端产品环境中进行。

    推荐理由:文章通过三组原创对比测试,量化分析了视频模型在时序因果和音画同步上的表现差异,为理解模型能力提供了具体案例。

  2. Hugging Face · 每日论文43

    FrameMorrow:利用前瞻性 token 进行未来引导的帧选择以实现长时程视频生成

    FrameMorrow 提出一种前瞻性帧选择方法,通过预测代表未来信息需求的小型前瞻性 token 集来从历史中选择相关信息。该方法选择显式的历史帧而非模型内部状态,能以即插即用方式集成到包括闭源模型在内的多种生成器中,且额外推理成本很低。在涵盖长视频生成、交互式生成和动作条件世界模型的 5 个基准测试和 11 个生成模型上的广泛实验表明,其在长程一致性、视觉质量和动作对齐方面均有持续提升。

9月29日周二
  1. Microsoft Research54

    微软研究院推出生物AI研究系统Quine

    微软研究院推出名为Quine的生物AI研究系统,该系统包含一个多模态生物世界模型和一个连接模型、科学工具、文献与研究人员的工作平台。在与Broad Institute的合作中,Quine被用于预测和优先排序能驱动肿瘤细胞状态转变的化合物,其排名靠前的候选物在湿实验室实验中得到了验证。

    推荐理由:原文展示了该系统在癌症研究中的具体应用案例和效果,为关注AI在生物科学领域落地的读者提供了实践参考。

  2. Latent Space46

    AMD 以 82 亿美元收购 World Labs,其 Atlas 模型解决机器人、设计等领域稀疏重建问题

    AMD 以 82 亿美元收购了 AI 空间智能公司 World Labs。World Labs 近期发布了首创的通用模型架构 Atlas,它通过结合生成模型与多视图几何,解决了稀疏重建这一计算机视觉长期难题,在从 2D 图像预测新相机视角的任务上超越了当前最先进的专用模型。该技术对机器人、设计、工程和科学等领域具有广泛影响。

9月28日周一
9月26日周六
  1. TechCrunch · 融资并购34

    Synthesia 为记者创建可交互数字分身

    视频生成初创公司 Synthesia 为一名记者创建了其专属的可交互数字分身,该分身仅能回答关于其特定报道《为何风投支持的初创公司欺诈更多》的问题。该交互分身结合了语音转文本、视频、语言和文本转语音模型,企业客户还可选择集成 Cartesia、ElevenLabs、Google 或 OpenAI 的模型。

  2. CNET · AI49

    Gemini Live Avatar 为 AI 智能体配上虚拟形象,引发用户不适

    Google 为 Gemini Enterprise 用户推出了 Live Avatar 功能,能将 AI 智能体与可交互的虚拟形象结合,用于视频聊天处理保险理赔等任务。该功能支持唇形同步、实时音频视频处理,并能同时运行工具和 API 调用。目前仅提供预制的虚拟形象供企业选择,所有音视频内容均使用 SynthID 进行水印以验证其 AI 生成属性。

9月24日周四
9月21日周一
9月18日周五
9月16日周三
  1. MIT News · 人工智能46

    xvr 通过患者特异性AI实现X射线与3D扫描秒级精准配准

    MIT团队开发的xvr系统可在约5分钟内完成患者特异性AI模型训练,实现X射线与3D医学扫描的秒级、亚毫米级精准配准。该模型基于物理仿真生成患者专属合成X射线,避免幻觉,性能较现有AI方法提升一个数量级。系统已通过多类患者、身体部位和手术场景验证,有望提升微创手术的安全性与可及性。

9月10日周四
  1. Google · AI Blog31

    Google DeepMind 与电影人合作 AI 重现 70 年爱情故事

    Google DeepMind 与电影制作团队合作,在短片《Love, Rendered》中利用生成式 AI 技术重现了一对夫妇未曾被记录的初遇记忆。团队结合图像修复模型与表演捕捉模型,将老照片复原并映射了当事人当下的细微神态。该项目展示了 AI 作为艺术媒介的潜力,相关照片修复功能已集成至 Gemini 应用中。

9月5日周六
  1. Google · Gemini 博客49

    Gemini 中现可创作最佳音轨:Lyria 3.5 可用

    Google 的音乐生成模型 Lyria 3.5 已在 Gemini 应用和 Gemini API 中面向全球用户推出。该模型提供更具表现力的人声和更丰富的编曲,用户可在应用内选择流派、人声/器乐风格,并使用新模板快速创作。Lyria 3.5 也通过 Google Flow Music、Google AI Studio 和 Google Vids 提供给艺术家、开发者和技术人员使用。

9月3日周四
  1. The Register · AI/ML46

    AI 辅助采蘑菇是危险的尝试:主流模型识别毒蘑菇错误率堪忧

    一项测试显示,主流 AI 模型在识别蘑菇物种时错误率很高,可能将致命毒蘑菇误判为可食用。表现最佳的 Gemini-3.8-flash 首次猜测正确率仅为 65%,而 Qwen3.8-27b 将毒蘑菇误判为可食用的比例高达 36%。研究者警告,不应依赖 AI 判断蘑菇安全性,因为单张照片不足以准确识别,错误可能带来致命后果。

9月2日周三
  1. Google · AI Blog34

    Google 2026 年 8 月 AI 新闻汇总:发布 Gemini 3.7 Flash、Gemini 3.5 Transcribe 及 Pixel 11 系列

    Google 在 2026 年 8 月发布了多款 AI 产品,包括面向编程和智能体的高效模型 Gemini 3.7 Flash,以及专为实时转录设计的 Gemini 3.5 Transcribe。同期推出的 Pixel 11 系列设备搭载了 Google Tensor G6 芯片和最新的 Gemini Nano 模型。此外,Gemini 应用的月活用户已超过 10 亿。

9月1日周二
  1. Microsoft Research39

    GigaPath-Flash 与 GigaTIME-Flash:高效病理学基础模型迈向群体规模发现

    Microsoft Research 推出高效病理学基础模型 GigaPath-Flash 和 GigaTIME-Flash,显著降低了计算需求。GigaPath-Flash 参数量为 2200 万,在保持性能的同时将推理成本降至原 GigaPath 的约 1/50。这两个基于 Apache 2.0 协议开源的研究模型旨在支持大规模病理数据分析,推动群体规模的疾病生物学研究。

8月25日周二
8月13日周四
  1. Microsoft Research38

    MindTopo 揭示多模态大语言模型的空间推理能力

    Microsoft Research 推出 MindTopo 基准,用于评估多模态大语言模型对连通性、包围、顺序、分离和绳结等拓扑关系的理解能力。测试发现,模型在静态图像识别任务上的表现远优于需要规划与交互的任务,表明其难以在动态场景中维持对拓扑结构的一致性理解。这一差距凸显了在机器人学和交互式环境等需要可靠决策的领域,提升 AI 系统拓扑推理能力的重要性。

8月10日周一
  1. Ollama 博客57

    Meta Superintelligence Labs 的 Muse Glimmer 模型已在 Ollama 上线

    Meta Superintelligence Labs 发布的首个开源多模态模型 Muse Glimmer 现已可在 Ollama 上运行。这是一个 30B 参数、专为本地智能体工作负载设计的模型,拥有 128K+ 上下文长度,采用 Apache 2.0 许可证。

    推荐理由:原文提供了模型参数、许可证、支持的智能体框架和性能优化细节,读者可以据此评估其本地部署的适用性。

7月30日周四
  1. Replit 博客52

    Replit 推出 Replit Design 设计套件

    Replit 发布新的创意套件 Replit Design,旨在让用户快速将想法转化为设计。它内置 Ambient Intelligence 引导设计流程,支持调用 Claude、GPT-5、Gemini、Kimi 和 GLM 等模型,并集成了 Mobbin UI/UX 参考库和设计系统。该功能现已对所有用户开放。

7月16日周四
  1. MIT News · 人工智能44

    MIT 与 IBM 研究人员开发 GIFT 系统,提升 AI 将 2D 设计转为 3D CAD 模型的性能

    MIT 与 IBM 等机构的研究人员开发了名为 GIFT 的系统,能指导视觉语言模型自动将 2D 设计图转换为更准确、功能更完善的 CAD 程序。该系统通过让模型从自身错误中学习来生成训练数据,在仅使用约 20% 计算量的情况下,其生成的 CAD 程序准确性超越了其他方法。这一技术有望加速快速原型设计流程并降低成本。

7月15日周三
  1. Together AI63

    Thinking Machines Lab 发布多模态 MoE 模型 Inkling

    Thinking Machines Lab 发布了多模态专家混合模型 Inkling,支持文本、图像和音频输入,具备可控推理深度和广泛的微调能力。Inkling 采用查询条件相对注意力、短因果卷积和共享专家池 MoE 等架构创新,总参数量 975B,活跃参数量 40B,上下文窗口为 1M token。

    推荐理由:原文介绍了新模型的核心架构创新和可控推理特性,读者可以了解其技术路径与现有模型的差异。

7月13日周一
7月10日周五
  1. Vector Institute24

    Vector Institute 与欧洲航天局合作推进地球观测 AI

    Vector Institute 与欧洲航天局(ESA)建立合作伙伴关系,共同开发用于地球观测的人工智能新应用。合作初期将重点聚焦于气候科学和北极监测,Vector 学院教员 Evan Shelhamer 已作为访问教授加入 ESA 的 Φ-lab。此次合作旨在利用 AI 处理 ESA Copernicus Sentinel 卫星群产生的大量数据,并将科学开放性和可及性作为核心设计原则。