跳到正文

技术方向

部署工程 最新动态

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

108 条精选近 30 天 57 条共收录 497 条

更新

精选归档 · 第 3 页

9月22日周二第 41–60 条
  1. PyTorch 博客69

    Shopify 如何用 PyTorch 和 vLLM 构建持续学习循环

    Shopify 分享了其构建持续学习循环的完整方法,使专用模型在质量上超越前沿模型,同时将服务成本降低 96%。该方法始于定义质量评估标准并校准离线评估器,然后通过自动化研究优化提示和工具定义,再利用生产中的困难案例通过强化学习更新模型权重。

    推荐理由:Shopify 分享了从评估标准定义到模型压缩的完整工程实践,为构建持续学习系统提供了具体路径。

  2. Vercel 博客56

    Vercel AI Gateway 上线 GPT-6 Sol 和 Luna 模型

    OpenAI 的 GPT-6 Sol 和 GPT-6 Luna 模型现已在 Vercel AI Gateway 上线。GPT-6 Sol 适用于需要持续调查的复杂编码和智能体工作流,GPT-6 Luna 则是高吞吐量、重复性任务的高性价比选择。相比 GPT-5.6,两者在事实可靠性、沟通直接性和避免误导性代码完成声明方面有所改进。

    推荐理由:Vercel AI Gateway 新增了 OpenAI 的两个 GPT-6 变体,并说明了各自在价格、适用场景和可靠性上的定位差异。

  3. PyTorch 博客55

    TinyTorch:一个纯 Python 教学框架,让你从零构建 PyTorch

    TinyTorch 是一个免费开源的纯 Python 教学框架,旨在让学生从零开始构建一个可工作的 ML 框架,涵盖从张量到 Transformer 的 20 个模块。它完全复刻 PyTorch API,无需 GPU,在仅 4 GB 内存的笔记本电脑上即可运行。该项目源于哈佛大学的课程,现已发展为包含自动评分、里程碑验证和社区地图的完整教学体系,并被全球多所大学采用。

    推荐理由:文章详细拆解了 TinyTorch 作为教学框架的设计哲学和模块结构,为教育者和自学者提供了清晰的实施蓝图。

9月21日周一
9月18日周五
  1. Vercel 博客54

    Jev 成为 Vercel AI Gateway 历史上采用最快的模型

    Jev 在 Vercel AI Gateway 上线 24 小时内,付费团队使用率达到了 13%,是 GPT-5.6 家族的两倍多,Fable 5.1 的六倍多,成为该平台历史上采用最快的模型。Jev 是一款由 TypeSafe AI 推出的概率决策模型,专为软件内的结构化决策设计,可并行评估问题并返回带概率的答案,据称在自身工作流评估中比大语言模型快 194 倍、便宜 445 倍。

    推荐理由:原文提供了 Jev 在 Vercel AI Gateway 上的具体采用数据和性能对比,读者可以据此评估其市场接受度和技术定位。

  2. vLLM 官方博客60

    vLLM 新增 NVIDIA 硬件视频解码支持

    vLLM 新增对 NVIDIA 硬件视频解码的支持,通过 PyNvVideoCodec 实现视频解码从 CPU 向 GPU 的迁移,显著提升多 GPU 节点上的视频字幕生成吞吐量。在 8xH100 配置下,GPU 解码性能超过 CPU 解码一倍以上。支持 Qwen/Qwen3-VL-8B-Instruct 等轻量多模态模型,适用于自动驾驶等场景的视频描述任务。

    推荐理由:原文给出了硬件视频解码支持的接入方式和性能提升数据,读者可据此评估其对多GPU视频任务的优化效果。

  3. Vercel 博客56

    Vercel 与 Hacktron 合作披露并修复 libheif 远程代码执行漏洞

    Vercel 披露了与安全研究团队 Hacktron 合作处理 libheif 远程代码执行漏洞的完整过程。该漏洞影响 Next.js 图像优化链,Vercel 在平台层面禁用了 AVIF 优化,并协调 sharp、libvips 和 libheif 的维护者发布了上游修复。libheif 于 8 月 25 日发布了修复版本 v1.23.2,Next.js 也同步发布了安全更新。

    推荐理由:原文完整记录了从漏洞发现、协调上游修复到平台级缓解的全过程,为处理开源供应链安全问题提供了具体案例。

  4. fal 博客63

    fal 平台详解 H3 Max 视频模型的训练、部署与分发全流程

    fal 平台发布文章,详细介绍了视频生成模型 H3 Max 如何在其平台上完成从训练、部署到分发的全生命周期。H3 Max 在 fal Compute 上进行后训练,以在保持质量的同时最小化推理时间。

    推荐理由:原文详细拆解了从模型训练优化到大规模部署的完整技术栈,展示了如何通过基础设施设计同时降低推理延迟和端到端延迟。

  5. Vercel 博客61

    Vercel Sandbox 支持运行 Harbor 评测

    Vercel Sandbox 现已支持运行 Harbor 评测,用户可通过 harbor run 命令在隔离的 Firecracker microVM 中并行执行 Terminal-Bench 等基准测试。

    推荐理由:原文提供了在 Vercel Sandbox 上运行 Harbor 评测的具体命令和配置方式,读者可直接复用以并行化多模型基准测试。

9月17日周四
  1. GitHub Blog · AI & ML70

    GitHub Copilot 运行时使用 Copilot 自身重写为 Rust

    GitHub Copilot 团队使用 GitHub Copilot 应用和 CLI,将 Copilot 智能体运行时从 TypeScript 完全重写为超过 80 万行生产级 Rust 代码。该项目主要由一名开发者在几个月内完成,性能提升了数个数量级,并支持通过 C ABI 进行进程内嵌入,为所有六种 SDK 语言版本提供了更优的性能和资源使用方案。

    推荐理由:原文详细记录了用 AI 辅助将核心运行时从 TypeScript 重写为 Rust 的完整过程、技术决策和量化结果,为大规模工程迁移提供了具体参考。

9月16日周三
  1. Neo4j 博客58

    Neo4j 博客:用富图结构提升AI金融风控效率

    Neo4j 博客通过实验对比原始图数据与预计算图指标(如社区检测、中心性)对AI检测金融欺诈的效果,发现富图结构能显著提升模型识别合成身份、可疑桥接账户和洗钱环路的精度与效率,避免模型在大量上下文token中无效消耗。实验使用3万账户、500万交易的合成数据集,验证了预计算拓扑指标对AI代理的增强作用。

    推荐理由:通过对比原始图数据与预计算图指标对AI检测金融欺诈的效果,展示了结构化语义层如何提升模型效率与精度。

9月15日周二
  1. The Pragmatic Engineer73

    OpenAI 内部智能体驱动的软件工厂:Codex 如何重塑工程实践

    Gergely Orosz 访谈 OpenAI 七位工程负责人,揭示 Codex 已成为公司核心工具,非工程团队使用率从 0% 升至 90%,并构建了包含自动代码生成、智能体代码审查、部署与监控的‘智能体软件工厂’。

    推荐理由:原文通过实地访谈和流程图展示了 OpenAI 如何用 Codex 构建智能体驱动的软件工厂,读者可借此理解 AI 工具如何重塑工程实践。

  2. LangChain 博客55

    LangChain 发布付费媒体智能体并开源

    LangChain 发布用于管理付费广告的智能体,支持跨平台数据整合、自动分析与提案,已开源并可通过 Managed Deep Agents 部署至 Slack。该智能体在六个月内使付费媒体贡献营销管道比例从 0 提升至 20%,成本下降 30%,并实现了 40 倍的报告生成效率提升。

    推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。

9月14日周一
  1. IEEE Spectrum · AI59

    OpenAI 使用自有 LLM 设计 Jalapeño 芯片

    OpenAI 于 2026 年 8 月 25 日正式发布其首款 AI 加速芯片 Jalapeño,该芯片可提供最高 13.4 petaflops 的 4-bit 计算能力,配备 232 GB 高级内存,带宽达 15.4 TB/s。

    推荐理由:原文揭示了 OpenAI 如何用自家 LLM 加速 Jalapeño 芯片设计流程,读者可了解 AI 在硬件设计中的实际应用路径和效率提升。

  2. LangChain 博客61

    LangChain 发布 GTM 智能体功能

    LangChain 发布 GTM 智能体,可自动处理新线索的调研与邮件草稿生成,并聚合账户级信号以支持销售与工程团队。该功能基于 Deep Agents 构建,支持多工具协同、人类审核、学习反馈循环,并已集成至 Slack 与 LangSmith。

    推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。

9月7日周一
  1. Neo4j 博客64

    Neo4j 发布 Neocarta 语义层,降低 Text2SQL token 消耗最高达 81%

    Neo4j 发布 Neocarta 语义层,通过在 Neo4j 中构建跨 BigQuery 和 Databricks 的元数据图,使 Text2SQL 代理在 278 张 Census 表和 264 张 Databricks 表的复杂环境中。

    推荐理由:原文展示了在大规模、复杂数据环境中,通过图结构语义层显著提升Text2SQL的准确性和成本效益,可直接复用于企业级数据接入场景。

9月3日周四
  1. Google DeepMind66

    Google DeepMind 发布 WeatherNext 3 全球气象AI模型

    Google DeepMind 发布 WeatherNext 3,引入实时卫星数据、每小时更新、5公里分辨率,提升降水预测精度,并集成至 Search、Gemini、Maps 等产品。该模型通过直接学习观测数据,实现更精准的局部天气预测,尤其改善了拉丁美洲、非洲和亚太地区覆盖。

    推荐理由:原文给出了实时卫星数据接入、小时级更新和分辨率提升等关键变化,读者可据此评估其对气象服务的影响。

8月27日周四
  1. LangChain 博客56

    LangSmith LLM Gateway 公开测试版发布

    LangSmith LLM Gateway 公开测试版上线,提供针对生产环境 Agent 的模型调用治理能力,支持成本控制、速率限制、模型降级和敏感数据保护,可统一管理多模型、多提供商的调用策略,适用于组织、工作区、用户及 API key 级别的控制,并与 OpenAI、Anthropic、Fireworks 等主流模型提供商兼容。

    推荐理由:原文给出了成本控制、速率限制和数据保护等核心功能,读者可据此评估其对生产环境治理的实际影响。

  2. LangChain 博客60

    LangChain 发布 LangGraph v0.1 与 LangGraph Cloud

    LangChain 发布 LangGraph v0.1,提供对智能体工作流的细粒度控制能力,支持条件分支、循环、人类协作与时间旅行式调试;同时推出 LangGraph Cloud,提供可扩展、容错的部署基础设施,支持一键部署、流式输出、异步任务与定时任务,并集成 LangGraph Studio 用于可视化调试与协作。

    推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。