引入 SONIC-O1:用于真实世界音视频理解的开放、人工验证基准
Vector Institute 发布了 SONIC-O1,一个用于评估多模态大语言模型在真实世界音视频理解能力的开放基准。该基准包含约 60 小时的真实音视频内容,涵盖 13 个对话主题和 5 个领域,支持对模型在不同人群中的表现进行分组分析。
Vector Institute 发布了 SONIC-O1,一个用于评估多模态大语言模型在真实世界音视频理解能力的开放基准。该基准包含约 60 小时的真实音视频内容,涵盖 13 个对话主题和 5 个领域,支持对模型在不同人群中的表现进行分组分析。
百度推出 Unlimited-OCR 模型,支持单次长程解析功能。该模型基于 Huggingface transformers 在 NVIDIA GPU 上进行推理,提供 32768 上下文长度和 35 no_repeat_ngram_size 参数。
月之暗面发布 Kimi K3 大模型,参数量 2.8T,支持 100 万 token 上下文窗口,具备原生多模态和智能体能力,采用 KDA 和 AttnRes 架构,开源权重并提供 API 接入。模型在 GPQA Diamond、DeepSWE、FrontierSWE 等多个基准上取得领先成绩,支持 MXFP4 量化,推荐在 vLLM、SGLang 等引擎上部署。
推荐理由:原文提供了模型架构、评测数据和部署方式,读者可据此判断其在长上下文、多模态和智能体任务中的实际能力边界。
本报告介绍了基于 Gemma 3 270M 的紧凑型视觉-语言-动作(VLA)模型的生产级 MLOps 管道构建方法。该模型支持高效的训练与部署流程,适用于需要实时交互的场景。文章提供了可复现的代码结构与部署配置,供开发者参考实现。
Anne Martel 研究开发 AI 系统,从医学影像和临床文本数据中提取可操作信息,以帮助预测癌症患者对不同治疗方案的反应。她的团队近期在 ICCV 展示了如何通过基因组信息微调病理图像大模型,并结合临床记录文本提升预测准确性。该研究推动医疗影像 AI 从单纯应用计算机科学方法转向产生基础性创新,影响更广泛的 AI 社区。
月之暗面发布 Kimi-K2.7-Code,一款基于 Kimi K2.6 的编码专用智能体模型,采用 MoE 架构,参数量 1T,激活参数 32B,上下文长度 256K,支持图像与视频输入。
推荐理由:原文提供了模型架构、评测数据和部署方式,读者可据此判断其在长程编程任务和智能体场景中的实际能力与适用性。
2026 年 1 月至 5 月期间,作者整理了一份精选的 LLM 研究论文列表,涵盖推理模型、强化学习、高效推理、长上下文处理等方向。Nemotron 3 Super 采用混合架构设计,结合常规注意力层与 Mamba-2 状态空间模型层,提升长上下文效率,同时有 4B 参数的 Nemotron 3 Nano 版本。
Google DeepMind 发布了 Gemma 4 12B 模型,该模型移除了音频和视觉编码器但仍保留多模态能力。Gemma 4 12B 采用与 31B 模型相似的解码器结构,通过局部与全局注意力机制的交错实现高效推理。此模型在不依赖编码器的情况下处理多模态输入,降低了推理延迟并简化了微调流程。
MiniMax-M3-MXFP8 是 MiniMax-M3 的 MXFP8 量化版本,支持 1M 上下文长度,拥有 ~428B 参数和 ~23B 激活参数,推理速度较前代 M2 提升 9 倍和 15 倍。
MiniMax 发布多模态大模型 MiniMax-M3,拥有约 4280 亿参数和 100 万 token 上下文窗口,采用 MiniMax 稀疏注意力(MSA)技术,在 1M 上下文下实现 9 倍预填充和 15 倍解码加速,推理成本降至 1/20。
推荐理由:原文给出了模型参数、上下文长度、推理速度提升和部署框架,读者可以据此判断其在长上下文和多模态场景下的实际可用性。
Together AI 作为 MiniMax M3 的优选云合作伙伴,分享了其针对该模型新特性的推理优化方案。M3 具备 100 万 token 上下文、原生多模态和稀疏注意力架构,Together AI 通过 KV 块主序稀疏注意力、与分页注意力的集成、解码索引评分优化以及网关预处理多模态输入等方法,在代理式流量下将推理性能提升了 81% 至 125%。
推荐理由:Together AI 分享了其针对 MiniMax M3 模型稀疏注意力等新特性的推理优化细节,包括 KV 块重排、分页注意力集成和网关预处理。
百度 ERNIE 团队发布 NAVA 模型,一个 6.3B 参数的联合音视频生成模型,支持从单个提示词生成同步视频与音频,包括多说话人音色控制和图像条件续写。模型采用 Align-then-Fuse MMDiT 架构,在 Verse-Bench 上刷新 Sync-C、Sync-D、视频质量与音频 WER 等多项指标,参数量仅为开源基线的 2–5 倍。
推荐理由:NAVA 是首个在 6.3B 参数下实现高同步性音视频生成的模型,其 Align-then-Fuse 架构和参考音色控制能力可直接用于多模态内容创作。
Google 推出 Gemini 3.5 Flash 和 Omni 视频系统,前者定位为兼顾速度与能力的高性能模型。Gemini 3.5 Flash 适用于需要快速响应的场景,而 Omni 视频系统支持多模态视频处理。两项技术均未提及具体参数规模或开源状态。
Google 在 Gemma 4 中引入了跨层 KV 缓存共享机制,通过在不同层之间复用键值投影来减少长上下文推理的内存和计算需求。Gemma 4 E2B 使用 MQA 和滑动窗口注意力,以 4:1 比例优化注意力计算。该架构设计旨在提升推理效率,适用于移动端和嵌入式设备。
Together AI 开源了视频翻译工具 Violin,它通过 Whisper V3、DeepSeek V4 Pro 和 Cartesia Sonic 3 等模型实现语音识别、翻译和语音合成。Violin 还包含基于视频内容的多模态聊天助手,并提供了 Web 应用、CLI 工具和 Agent skill 三种使用方式。所有代码已在 MIT 许可下开源。
Weights & Biases 报告介绍了基于 Gemma-3 270M 训练的紧凑型视觉语言动作(VLA)模型。该模型使用 Gemma-3 270M 作为核心,专注于实现高效的多模态交互能力。模型的参数规模和具体性能指标未在文中披露,但其设计目标是为资源受限环境提供轻量级解决方案。
Together AI 平台已上线 NVIDIA Nemotron 3 Nano Omni 模型。该模型是一个 300 亿参数的开源多模态模型,采用混合 Mamba-Transformer MoE 架构,支持视频、图像、音频和语言的统一推理,上下文窗口达 256K token。
Mistral 发布 Mistral-Medium-3.5-128B-EAGLE 模型,为 Mistral Medium 3.5 的推测解码版本,支持 256k 上下文窗口、多模态输入、可配置推理强度和智能体功能,采用 Modified MIT License 开源,推荐使用 vLLM 或 SGLang 部署。
推荐理由:原文提供了模型架构、能力细节和部署方式,读者可据此判断其在多模态推理和智能体场景中的适用性。
月之暗面发布 Kimi-K2.6,一个开源的原生多模态智能体模型,支持长上下文编码、编码驱动设计、智能体集群协作和主动自主执行。模型采用 MoE 架构,总参数 1T,激活参数 32B,上下文长度 256K,支持图像和视频输入。
推荐理由:原文提供了模型架构、评测数据和部署方式,读者可以据此判断其在长上下文编码、智能体协作和多模态能力上的实际表现与适用场景。
百度发布ERNIE-Image文本生成图像模型,基于单流扩散Transformer架构,参数量8B,支持Prompt增强器,具备强视觉质量与可控性,适用于海报、漫画、多面板布局等场景。
推荐理由:原文提供了模型架构、参数规模、基准表现和部署方式,读者可以据此判断其在开放模型中的竞争力和实际可用性。
Gemma 4 系列包含四款模型:E2B、E4B、31B 和 26B A4B,支持图像与音频输入,采用稠密与 MoE 架构。其核心设计包括交错局部与全局注意力、K=V 优化、p-RoPE 位置编码、Per-Layer Embeddings(PLE)和多模态编码器(ViT 与 Conformer)。
推荐理由:原文通过图文结合方式详细拆解了 Gemma 4 的架构设计,包括多模态处理、MoE 与 PLE 技术,读者可据此理解其效率与能力的平衡机制。
Anthropic 推出 Claude Cowork 与 Dispatch 接口,允许用户通过手机远程控制桌面端 AI 智能体。用户可从手机发送指令,让 Claude 读取日历、邮件和在线频道,生成晨间简报。Dispatch 与 Claude Code 结合,使 AI 能够直接操作本地文件和应用程序,提升非开发人员的使用效率。
Mistral 发布新模型 Mistral-Medium-3.5-128B,为首个旗舰合并模型,具备 128B 参数、256k 上下文窗口,支持文本与图像输入、推理、编码及智能体功能。
推荐理由:原文给出了模型架构、能力变化和开源入口,读者可以据此判断它在多模态和智能体任务中的实际应用潜力。
fal 推出 MCP Server,让 Claude、Cursor 等 AI 助手能直接搜索、运行和串联 fal 平台上的 1000 多个生成模型。该服务器提供 9 个工具,涵盖模型发现、执行和文件上传,用户只需配置 API 密钥即可在对话中完成图像生成、视频制作、语音合成等复杂工作流。服务本身免费,按标准 fal 定价支付模型调用费用。
推荐理由:通过 MCP 协议将上千个生成模型直接接入 Claude、Cursor 等 AI 助手,简化了多模态创作的工作流。
Together AI 扩展其微调服务,新增了对工具调用、推理和视觉语言模型的原生支持。服务升级了训练栈,可更高效地处理 100B+ 参数模型,吞吐量提升最高达 6 倍,并支持最大 100GB 的数据集。
推荐理由:Together AI 的微调服务新增了对工具调用、推理和视觉模型的支持,并提升了大规模模型训练的效率。
Replit 推出 Vibe Code 功能,允许用户在代码环境中直接生成动态风格视频,无需依赖外部动画工作室。该功能基于 Gemini 模型构建,支持通过自然语言描述视频内容,生成类似专业工作室制作的动画片段。用户可快速生成初稿并在 Replit 内进行迭代,社区已有超过 1,800 名开发者参与相关项目。
HeyGen 的模型已登陆 fal 平台,提供视频智能体 API、Avatar IV API、视频翻译和 Avatar Video 等核心功能。用户可通过 Video Agent API 输入提示词或 URL,一键生成包含脚本、素材和剪辑的完整视频。Avatar IV API 能将单张照片转换为具备自然表情和手势的说话头像,无需专业工作室。
Vector Institute 2026 海报展示会呈现了 60 个研究项目,涵盖医疗健康、AI 安全与基础模型创新三大主题。其中近 20% 的研究聚焦医疗 AI,包括语音控制手术导航、癌症检测和医学影像技术。加拿大在 AI 领域的领导地位通过政府支持与产业合作得以体现,研究强调负责任的 AI 发展与技术落地。
2026 年 1-2 月共发布了 10 款开源大语言模型,涵盖 Arcee AI 的 Trinity Large(400B 参数 MoE 架构)、Moonshot AI 的 Kimi K2.5(1T 参数)等。
Vector Institute 的工作坊探讨了科学家如何帮助企业在数据稀缺条件下构建实际可用的 AI,重点介绍了使用 GPT-4o-mini 和对比学习技术构建 AION-1 基础模型,实现图像与文本的语义对齐,从而支持零样本搜索。
Berkeley AI Research 在 NeurIPS 2025 论文中提出一个直接评估和优化成像系统信息内容的新框架。该信息度量统一了分辨率、噪声和光谱灵敏度等传统分离的质量指标,能准确预测彩色摄影、射电天文、无透镜成像和显微镜四个领域的系统性能。优化该指标产生的设计与最先进的端到端方法性能相当,但所需内存和计算量更少,且无需特定任务的解码器设计。
月之暗面发布 Kimi K2.5,一个开源的原生多模态智能体模型,基于 Kimi-K2-Base 连续预训练,支持视觉与语言理解、即时与思考模式、以及智能体群集执行。
推荐理由:原文提供了模型架构、评测基准和部署方式,读者可以据此判断其在多模态智能体方向的技术定位和应用潜力。
AI 能力存在显著的“锯齿前沿”,即在某些任务上表现超人类而在其他任务上却表现不佳。例如,GPT-4.1 能在两天内完成相当于12人年工作量的医学综述,但在记忆和访问补充文件等任务上仍是短板。这种能力的不均衡性造成了自动化瓶颈,使得超级智能的 AI 目前仍难以完全替代人类。
Vector 研究人员在 NeurIPS 2025 会议上提交了 80 篇论文,涵盖下一代基础模型、扩散生成系统、强化学习突破和隐私保护联邦方法等多个领域。其中提出 ActiveVOI 框架,用于开放世界智能体的主动知识获取,显著优于现有基于大语言模型和视觉语言模型的规划方法。另一项研究引入连续时间流图蒸馏方法,通过自引导和对抗微调提升性能,适用于不同步数的生成任务。
Sebastian Raschka 在文章中系统梳理了当前超越标准自回归 Transformer LLM 的多种架构方向,包括线性注意力混合模型(如 Qwen3-Next、Kimi Linear)、文本扩散模型、代码世界模型(CWM)和小递归变压器(如 TRM)。
本文提供了一份关于当前如何正确使用 AI 的指南,建议根据实际需求选择免费或高级模型。Claude、Google 的 Gemini、OpenAI 的 ChatGPT 和 xAI 的 Grok 是目前最先进的四款 AI 系统,其中 Gemini 在免费图像生成方面表现最佳,而 Claude 缺乏图像和视频生成能力。
Qwen3-VL 现已在 Ollama 云端可用,本地版本即将推出。该模型具备视觉智能体、长上下文视频理解、高级空间感知、增强的多模态推理与视觉识别等能力。用户可通过 Ollama 的 CLI、API 及 JavaScript/Python 库免费使用云端模型,并支持 OpenAI 兼容的 API 端点。
推荐理由:Ollama 官方博客列出了 Qwen3-VL 在视觉智能体、长上下文、空间感知等方面的具体能力,并提供了详细的接入方式。