NVIDIA 发布 PixelUMM:无编码器统一多模态模型
NVIDIA 发布 PixelUMM,一个无编码器的统一多模态模型,支持文本、图像和视频的联合理解与生成,直接在像素空间处理,参数量 151.99 亿,基于 Qwen3-8B 语言骨干,仅限非商业研究或评估使用。
推荐理由:原文给出了模型架构、参数量和开放入口,读者可以据此判断它在像素空间统一理解与生成的实现路径。
NVIDIA 发布 PixelUMM,一个无编码器的统一多模态模型,支持文本、图像和视频的联合理解与生成,直接在像素空间处理,参数量 151.99 亿,基于 Qwen3-8B 语言骨干,仅限非商业研究或评估使用。
推荐理由:原文给出了模型架构、参数量和开放入口,读者可以据此判断它在像素空间统一理解与生成的实现路径。
Cloudflare AI Search 现已正式可用,新增了对多模态格式的原生支持,包括图像嵌入、PDF的OCR以及更大的文件处理能力。计费将于2026年11月1日开始,所有 Workers 计划仍提供免费额度。
推荐理由:原文详细说明了新增的多模态嵌入、文件处理和OCR功能,以及从预览到正式可用的计费模式变化。
Google DeepMind 宣布推出前沿模型 Gemini 4 Argon,旨在处理复杂、长周期的跨领域工作流。该模型在 DeepSWE v1.1 上达到 77.9% 的 SOTA 水平,输出 token 上限提升至 100 万,定价为每百万输入 token 2 美元、输出 token 10 美元。
推荐理由:原文详细列举了模型在软件工程、金融法律和网络安全等领域的性能表现及定价,读者可以据此评估其实际应用潜力。
Google 发布 Gemini 4 Argon 模型,该模型在复杂软件工程、企业知识工作和网络安全防御中实现前沿性能,支持长达 100 万 token 的输出,已通过内部测试并面向受信任的网络安全团队逐步开放,定价为输入 token 每百万 2 美元,输出 token 每百万 10 美元。
推荐理由:原文明确了模型在复杂任务中的性能跃升和安全防护机制,读者可据此评估其在实际工作流中的应用潜力。
微软研究院推出名为Quine的生物AI研究系统,该系统包含一个多模态生物世界模型和一个连接模型、科学工具、文献与研究人员的工作平台。在与Broad Institute的合作中,Quine被用于预测和优先排序能驱动肿瘤细胞状态转变的化合物,其排名靠前的候选物在湿实验室实验中得到了验证。
推荐理由:原文展示了该系统在癌症研究中的具体应用案例和效果,为关注AI在生物科学领域落地的读者提供了实践参考。
Google 研究团队提出 AI 视频协导演框架,基于 Gemini 和 Veo 构建统一多代理系统,通过全局优化、视觉记忆追踪、自回归生成与闭环质量评估,解决长视频生成中的语义漂移、特征漂移和内容坍缩问题。
推荐理由:原文系统性地提出了多代理框架解决长视频生成中的连贯性问题,提供了可复现的技术路径和基准测试结果。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,通过低延迟视频流与语音同步,实现企业级虚拟代理的近实时视觉交互。该功能支持多语言无缝切换、异步工具调用与持续对话,具备精确唇形同步与自然表情,企业可通过参考图像定制专属动画形象,目前仅对 Gemini Enterprise 用户开放。所有生成内容均嵌入 SynthID 水印以确保可追溯性。
推荐理由:原文给出了功能组合和企业可用性,读者可以据此判断其在交互场景中的部署价值。
Google 推出 Gemini 3.8 Live with Live Avatar,支持实时视频生成与语音同步,具备自然唇形同步、表情和多语言切换能力,可在对话中异步调用工具,适用于企业客户服务和交互式场景,当前仅在 Gemini Enterprise 中提供。
推荐理由:原文说明了实时视频生成与语音同步、多语言支持和异步工具调用能力,企业用户可据此评估其在客户服务或交互式场景中的应用潜力。
千问发布 Qwen-Image-2.1-PE-T2I,一个统一的文生图与图像编辑模型,参数量7B,支持透明图生成、多参考图编辑和局部修改,同时提供提示词重写模型。模型在 HuggingFace 和 ModelScope 开源,支持通过 Transformers 和 Diffusers 集成,输出包含详细英文提示和推荐宽高比的 JSON 结构。
推荐理由:原文提供了模型架构、能力改进和开源入口,读者可据此判断其在生成效率与透明图支持上的实际应用价值。
Google DeepMind 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两款新语音模型,支持近实时推理与多语言动态切换。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
DeepSeek发布多模态Mixture-of-Experts模型DeepSeek-V4.1-Flash,拥有552B参数,支持最多100万token上下文。模型采用CED架构,通过SWA Bounded Replay和CSA2技术将全局KV缓存降至890字节/token,约为前代的1/4。
推荐理由:模型在KV缓存压缩和多模态能力上实现突破,支持百万token上下文和可调推理努力,对长上下文智能体应用有直接价值。
Google DeepMind 发布 WeatherNext 3,引入实时卫星数据、每小时更新、5公里分辨率,提升降水预测精度,并集成至 Search、Gemini、Maps 等产品。该模型通过直接学习观测数据,实现更精准的局部天气预测,尤其改善了拉丁美洲、非洲和亚太地区覆盖。
推荐理由:原文给出了实时卫星数据接入、小时级更新和分辨率提升等关键变化,读者可据此评估其对气象服务的影响。
智谱发布 GLM-5.3-Flash,为 GLM-5 系列首个原生多模态模型,拥有 320B 总参数和 18B 活跃参数,支持 300,000 token 上下文,采用混合稀疏与线性注意力架构及 mHC 技术,部署框架包括 SGLang、vLLM、TokenSpeed 等,可通过 reasoning_effort 参数控制推理预算,API 服务可在 Z.ai 平台使用。
推荐理由:原文给出了模型参数、架构创新和部署框架,读者可以据此判断其在多模态和长上下文场景下的实际应用潜力。
千问发布 Qwen3.8-Flash-Next-FP8 模型,为基于 Qwen3.8-Flash-Next 架构的 FP8 量化版本,支持 262,144 令牌上下文,可扩展至 100 万令牌。
推荐理由:原文公开了新架构的量化模型权重、技术细节和基准结果,读者可据此评估其在长上下文和多模态任务中的效率与性能表现。
Meta Superintelligence Labs 发布的首个开源多模态模型 Muse Glimmer 现已可在 Ollama 上运行。这是一个 30B 参数、专为本地智能体工作负载设计的模型,拥有 128K+ 上下文长度,采用 Apache 2.0 许可证。
推荐理由:原文提供了模型参数、许可证、支持的智能体框架和性能优化细节,读者可以据此评估其本地部署的适用性。
MiniMax 发布音乐生成模型 MiniMax Music 3,支持基于歌词和音乐描述生成最长五分钟的完整歌曲,采用 8B 全局 LLM 与 0.6B 局部 LLM 的混合架构,结合 Flow Matching 和 Flow-VAE 进行连续隐状态合成,输出 32 kHz 16-bit 立体声 WAV 音频。
推荐理由:原文详细说明了模型架构、控制方式和部署方法,读者可据此判断其在音乐创作中的实际可用性。
月之暗面发布 Kimi K3,2.8万亿参数开源模型,为首个3万亿参数级开源模型,支持1M上下文、多模态输入和动态工具加载。Together AI 提供 API 接入,支持 OpenAI 兼容调用,推理深度可调,定价按 token 计费,缓存命中输入价为每百万 token 0.30 美元。模型在 DeepSWE、BrowseComp 等基准上表现领先,支持结构化输出、流式响应和保留思考历史。
推荐理由:原文提供了模型参数、架构创新、API 使用方式和定价,读者可据此判断其在长上下文、推理和多模态任务中的实际部署潜力。
MiniMax 发布开源多模态视频生成模型 H3,支持文本、图像、视频、音频的统一理解与生成,可输出最高 2K 分辨率、15 秒时长的视频并带有立体声。模型包含 H3-Context-IR、H3-Base 和 H3-Regenerate-2K 三个模块,支持多种输入模式如文本到视频(T2VA)、首尾帧到视频(FL2VA)和参考多模态到视频(Ref2VA)。
推荐理由:原文提供了模型架构、输入输出规范和部署方式,读者可以据此判断其在多模态视频生成中的实际应用潜力。
Vector Institute 发布关于多模态混合专家(MoE)模型的研究论文,系统分析了从稀疏路由到多模态部署的架构原理与训练挑战,实证揭示了模型在早期层按模态路由、深层按语义路由的结构演化规律,并提出通过QLoRA、Flash Attention 2与lm_head预钩子实现35.26B参数模型在四张A100 GPU上的可训练性,同时指出专家并行是长期可行方向。
推荐理由:原文通过实证分析揭示了多模态MoE模型在路由机制与训练实践中的关键规律,为后续优化提供了可复用的方法论。
Mistral 发布 Shieldstral-1.0-3B,一个 3B 参数的多模态安全分类模型,支持文本、图像及图文混合内容的动态政策审核,基于自然语言政策输入返回连续安全分数,可在单 GPU 上运行,支持 32k 上下文窗口,开源 Apache 2.0 许可。
推荐理由:原文提供了模型架构、能力指标和部署方式,读者可以据此判断其在轻量级安全审核场景中的适用性。