跳到正文
  1. vLLM 官方博客60

    vLLM 新增 NVIDIA 硬件视频解码支持

    vLLM 新增对 NVIDIA 硬件视频解码的支持,通过 PyNvVideoCodec 实现视频解码从 CPU 向 GPU 的迁移,显著提升多 GPU 节点上的视频字幕生成吞吐量。在 8xH100 配置下,GPU 解码性能超过 CPU 解码一倍以上。支持 Qwen/Qwen3-VL-8B-Instruct 等轻量多模态模型,适用于自动驾驶等场景的视频描述任务。

    推荐理由:原文给出了硬件视频解码支持的接入方式和性能提升数据,读者可据此评估其对多GPU视频任务的优化效果。

  1. Together AI72

    月之暗面发布 Kimi K3:2.8万亿参数开源模型,支持1M上下文与多模态

    月之暗面发布 Kimi K3,2.8万亿参数开源模型,为首个3万亿参数级开源模型,支持1M上下文、多模态输入和动态工具加载。Together AI 提供 API 接入,支持 OpenAI 兼容调用,推理深度可调,定价按 token 计费,缓存命中输入价为每百万 token 0.30 美元。模型在 DeepSWE、BrowseComp 等基准上表现领先,支持结构化输出、流式响应和保留思考历史。

    推荐理由:原文提供了模型参数、架构创新、API 使用方式和定价,读者可据此判断其在长上下文、推理和多模态任务中的实际部署潜力。

  1. Vector Institute54

    Vector Institute 发布多模态混合专家模型研究论文

    Vector Institute 发布关于多模态混合专家(MoE)模型的研究论文,系统分析了从稀疏路由到多模态部署的架构原理与训练挑战,实证揭示了模型在早期层按模态路由、深层按语义路由的结构演化规律,并提出通过QLoRA、Flash Attention 2与lm_head预钩子实现35.26B参数模型在四张A100 GPU上的可训练性,同时指出专家并行是长期可行方向。

    推荐理由:原文通过实证分析揭示了多模态MoE模型在路由机制与训练实践中的关键规律,为后续优化提供了可复用的方法论。

  1. fal 博客67

    fal 博客:从粘土3D渲染到动作短片,详解完全可控的3D-AI生成管线

    fal 团队构建了一个完全可控的AI视频生成管线,从3D分镜设计到最终成片,并开源了核心的3DREAL Strong v2 LoRA适配器。

    推荐理由:原文详细拆解了从3D分镜到AI生成视频的完整工作流,包括具体的工具链、验证步骤和迭代经验,可供从业者复现或借鉴其方法。

  1. Exploring Language Models62

    Gemma 4 架构详解:多模态、MoE 与高效推理设计

    Gemma 4 系列包含四款模型:E2B、E4B、31B 和 26B A4B,支持图像与音频输入,采用稠密与 MoE 架构。其核心设计包括交错局部与全局注意力、K=V 优化、p-RoPE 位置编码、Per-Layer Embeddings(PLE)和多模态编码器(ViT 与 Conformer)。

    推荐理由:原文通过图文结合方式详细拆解了 Gemma 4 的架构设计,包括多模态处理、MoE 与 PLE 技术,读者可据此理解其效率与能力的平衡机制。

已经到底了