MiniMax-M3-MXFP8 量化版本发布
MiniMax-M3-MXFP8 是 MiniMax-M3 的 MXFP8 量化版本,支持 1M 上下文长度,拥有 ~428B 参数和 ~23B 激活参数,推理速度较前代 M2 提升 9 倍和 15 倍。
MiniMax-M3-MXFP8 是 MiniMax-M3 的 MXFP8 量化版本,支持 1M 上下文长度,拥有 ~428B 参数和 ~23B 激活参数,推理速度较前代 M2 提升 9 倍和 15 倍。
MiniMax 发布多模态大模型 MiniMax-M3,拥有约 4280 亿参数和 100 万 token 上下文窗口,采用 MiniMax 稀疏注意力(MSA)技术,在 1M 上下文下实现 9 倍预填充和 15 倍解码加速,推理成本降至 1/20。
推荐理由:原文给出了模型参数、上下文长度、推理速度提升和部署框架,读者可以据此判断其在长上下文和多模态场景下的实际可用性。
Together AI 作为 MiniMax M3 的优选云合作伙伴,分享了其针对该模型新特性的推理优化方案。M3 具备 100 万 token 上下文、原生多模态和稀疏注意力架构,Together AI 通过 KV 块主序稀疏注意力、与分页注意力的集成、解码索引评分优化以及网关预处理多模态输入等方法,在代理式流量下将推理性能提升了 81% 至 125%。
推荐理由:Together AI 分享了其针对 MiniMax M3 模型稀疏注意力等新特性的推理优化细节,包括 KV 块重排、分页注意力集成和网关预处理。
百度 ERNIE 团队发布 NAVA 模型,一个 6.3B 参数的联合音视频生成模型,支持从单个提示词生成同步视频与音频,包括多说话人音色控制和图像条件续写。模型采用 Align-then-Fuse MMDiT 架构,在 Verse-Bench 上刷新 Sync-C、Sync-D、视频质量与音频 WER 等多项指标,参数量仅为开源基线的 2–5 倍。
推荐理由:NAVA 是首个在 6.3B 参数下实现高同步性音视频生成的模型,其 Align-then-Fuse 架构和参考音色控制能力可直接用于多模态内容创作。
Google 推出 Gemini 3.5 Flash 和 Omni 视频系统,前者定位为兼顾速度与能力的高性能模型。Gemini 3.5 Flash 适用于需要快速响应的场景,而 Omni 视频系统支持多模态视频处理。两项技术均未提及具体参数规模或开源状态。
Together AI 开源了视频翻译工具 Violin,它通过 Whisper V3、DeepSeek V4 Pro 和 Cartesia Sonic 3 等模型实现语音识别、翻译和语音合成。Violin 还包含基于视频内容的多模态聊天助手,并提供了 Web 应用、CLI 工具和 Agent skill 三种使用方式。所有代码已在 MIT 许可下开源。
Weights & Biases 报告介绍了基于 Gemma-3 270M 训练的紧凑型视觉语言动作(VLA)模型。该模型使用 Gemma-3 270M 作为核心,专注于实现高效的多模态交互能力。模型的参数规模和具体性能指标未在文中披露,但其设计目标是为资源受限环境提供轻量级解决方案。
Together AI 平台已上线 NVIDIA Nemotron 3 Nano Omni 模型。该模型是一个 300 亿参数的开源多模态模型,采用混合 Mamba-Transformer MoE 架构,支持视频、图像、音频和语言的统一推理,上下文窗口达 256K token。
Mistral 发布 Mistral-Medium-3.5-128B-EAGLE 模型,为 Mistral Medium 3.5 的推测解码版本,支持 256k 上下文窗口、多模态输入、可配置推理强度和智能体功能,采用 Modified MIT License 开源,推荐使用 vLLM 或 SGLang 部署。
推荐理由:原文提供了模型架构、能力细节和部署方式,读者可据此判断其在多模态推理和智能体场景中的适用性。
月之暗面发布 Kimi-K2.6,一个开源的原生多模态智能体模型,支持长上下文编码、编码驱动设计、智能体集群协作和主动自主执行。模型采用 MoE 架构,总参数 1T,激活参数 32B,上下文长度 256K,支持图像和视频输入。
推荐理由:原文提供了模型架构、评测数据和部署方式,读者可以据此判断其在长上下文编码、智能体协作和多模态能力上的实际表现与适用场景。
百度发布ERNIE-Image文本生成图像模型,基于单流扩散Transformer架构,参数量8B,支持Prompt增强器,具备强视觉质量与可控性,适用于海报、漫画、多面板布局等场景。
推荐理由:原文提供了模型架构、参数规模、基准表现和部署方式,读者可以据此判断其在开放模型中的竞争力和实际可用性。
Mistral 发布新模型 Mistral-Medium-3.5-128B,为首个旗舰合并模型,具备 128B 参数、256k 上下文窗口,支持文本与图像输入、推理、编码及智能体功能。
推荐理由:原文给出了模型架构、能力变化和开源入口,读者可以据此判断它在多模态和智能体任务中的实际应用潜力。
fal 推出 MCP Server,让 Claude、Cursor 等 AI 助手能直接搜索、运行和串联 fal 平台上的 1000 多个生成模型。该服务器提供 9 个工具,涵盖模型发现、执行和文件上传,用户只需配置 API 密钥即可在对话中完成图像生成、视频制作、语音合成等复杂工作流。服务本身免费,按标准 fal 定价支付模型调用费用。
推荐理由:通过 MCP 协议将上千个生成模型直接接入 Claude、Cursor 等 AI 助手,简化了多模态创作的工作流。
Together AI 扩展其微调服务,新增了对工具调用、推理和视觉语言模型的原生支持。服务升级了训练栈,可更高效地处理 100B+ 参数模型,吞吐量提升最高达 6 倍,并支持最大 100GB 的数据集。
推荐理由:Together AI 的微调服务新增了对工具调用、推理和视觉模型的支持,并提升了大规模模型训练的效率。
Replit 推出 Vibe Code 功能,允许用户在代码环境中直接生成动态风格视频,无需依赖外部动画工作室。该功能基于 Gemini 模型构建,支持通过自然语言描述视频内容,生成类似专业工作室制作的动画片段。用户可快速生成初稿并在 Replit 内进行迭代,社区已有超过 1,800 名开发者参与相关项目。
HeyGen 的模型已登陆 fal 平台,提供视频智能体 API、Avatar IV API、视频翻译和 Avatar Video 等核心功能。用户可通过 Video Agent API 输入提示词或 URL,一键生成包含脚本、素材和剪辑的完整视频。Avatar IV API 能将单张照片转换为具备自然表情和手势的说话头像,无需专业工作室。
Vector Institute 2026 海报展示会呈现了 60 个研究项目,涵盖医疗健康、AI 安全与基础模型创新三大主题。其中近 20% 的研究聚焦医疗 AI,包括语音控制手术导航、癌症检测和医学影像技术。加拿大在 AI 领域的领导地位通过政府支持与产业合作得以体现,研究强调负责任的 AI 发展与技术落地。
Vector Institute 的工作坊探讨了科学家如何帮助企业在数据稀缺条件下构建实际可用的 AI,重点介绍了使用 GPT-4o-mini 和对比学习技术构建 AION-1 基础模型,实现图像与文本的语义对齐,从而支持零样本搜索。
Berkeley AI Research 在 NeurIPS 2025 论文中提出一个直接评估和优化成像系统信息内容的新框架。该信息度量统一了分辨率、噪声和光谱灵敏度等传统分离的质量指标,能准确预测彩色摄影、射电天文、无透镜成像和显微镜四个领域的系统性能。优化该指标产生的设计与最先进的端到端方法性能相当,但所需内存和计算量更少,且无需特定任务的解码器设计。
月之暗面发布 Kimi K2.5,一个开源的原生多模态智能体模型,基于 Kimi-K2-Base 连续预训练,支持视觉与语言理解、即时与思考模式、以及智能体群集执行。
推荐理由:原文提供了模型架构、评测基准和部署方式,读者可以据此判断其在多模态智能体方向的技术定位和应用潜力。
Vector 研究人员在 NeurIPS 2025 会议上提交了 80 篇论文,涵盖下一代基础模型、扩散生成系统、强化学习突破和隐私保护联邦方法等多个领域。其中提出 ActiveVOI 框架,用于开放世界智能体的主动知识获取,显著优于现有基于大语言模型和视觉语言模型的规划方法。另一项研究引入连续时间流图蒸馏方法,通过自引导和对抗微调提升性能,适用于不同步数的生成任务。
Qwen3-VL 现已在 Ollama 云端可用,本地版本即将推出。该模型具备视觉智能体、长上下文视频理解、高级空间感知、增强的多模态推理与视觉识别等能力。用户可通过 Ollama 的 CLI、API 及 JavaScript/Python 库免费使用云端模型,并支持 OpenAI 兼容的 API 端点。
推荐理由:Ollama 官方博客列出了 Qwen3-VL 在视觉智能体、长上下文、空间感知等方面的具体能力,并提供了详细的接入方式。