AI Evals:一切你需要知道的
AI Evals 是用于测试 AI 系统是否符合预期目标的评估方法,能帮助团队发现产品偏离用户需求或业务目标的问题,并提供改进数据。常见评估基准包括 GPQA Diamond、Terminal-Bench 和 MMLU,用于衡量模型在科学推理、命令行任务和多领域知识上的表现。评估设计建议使用二元(通过/失败)评分而非 1-5 分评分,并需注意评估工具的选择与标注流程的优化。
AI Evals 是用于测试 AI 系统是否符合预期目标的评估方法,能帮助团队发现产品偏离用户需求或业务目标的问题,并提供改进数据。常见评估基准包括 GPQA Diamond、Terminal-Bench 和 MMLU,用于衡量模型在科学推理、命令行任务和多领域知识上的表现。评估设计建议使用二元(通过/失败)评分而非 1-5 分评分,并需注意评估工具的选择与标注流程的优化。
Claude Projects v2 支持通过对话管理云端项目,利用线程实现并行操作并提升任务执行效率,目前处于 Beta 阶段,面向部分订阅者开放。Google 家庭智能体基于云计算机和账户运行,可处理家庭共享的邮件、文件和日历,协调最多六人活动,美国实验项目需排队等候。
vLLM 新增对 NVIDIA 硬件视频解码的支持,通过 PyNvVideoCodec 实现视频解码从 CPU 向 GPU 的迁移,显著提升多 GPU 节点上的视频字幕生成吞吐量。在 8xH100 配置下,GPU 解码性能超过 CPU 解码一倍以上。支持 Qwen/Qwen3-VL-8B-Instruct 等轻量多模态模型,适用于自动驾驶等场景的视频描述任务。
推荐理由:原文给出了硬件视频解码支持的接入方式和性能提升数据,读者可据此评估其对多GPU视频任务的优化效果。
Together AI 为一家全球金融科技公司部署 Dedicated Model Inference,支持 GLM-5.2 在 256K 上下文窗口下实现高并发编码代理负载,峰值并发达 178K tokens。该方案提供自服务端点控制、可编程指标 API 与模型灵活切换能力,实现零停机配置更新与团队级可观测性。
fal 平台发布文章,详细介绍了视频生成模型 H3 Max 如何在其平台上完成从训练、部署到分发的全生命周期。H3 Max 在 fal Compute 上进行后训练,以在保持质量的同时最小化推理时间。
推荐理由:原文详细拆解了从模型训练优化到大规模部署的完整技术栈,展示了如何通过基础设施设计同时降低推理延迟和端到端延迟。
Included Health 通过 LangGraph 和 Deep Agents 构建了一个联邦医疗智能体架构,用于其 AI 驱动的医疗导航平台 Dot。该架构允许智能体在不同子流程间保持语气和行为一致性,并通过共享文件系统传递上下文信息,避免用户重复说明。Deep Agents 还支持将临床能力封装为技能,供各智能体按需调用,提升对话的自然度和导航效率。
Matt Pocock 讨论了他开发的“grill-me”技能,该技能通过持续提问用户来帮助 AI 智能体深入理解任务。他提到该技能灵感来自 Anthropic 的 Thariq Shihipar,并强调使用“tracer bullets”等引导性术语可提升智能体编码效果。摘要还提到他将编码流程转向云智能体以实现协作,并探讨了代码库需为“无记忆同事”优化的开发理念。
GitHub Copilot 团队使用 GitHub Copilot 应用和 CLI,将 Copilot 智能体运行时从 TypeScript 完全重写为超过 80 万行生产级 Rust 代码。该项目主要由一名开发者在几个月内完成,性能提升了数个数量级,并支持通过 C ABI 进行进程内嵌入,为所有六种 SDK 语言版本提供了更优的性能和资源使用方案。
推荐理由:原文详细记录了用 AI 辅助将核心运行时从 TypeScript 重写为 Rust 的完整过程、技术决策和量化结果,为大规模工程迁移提供了具体参考。
AI 智能体工作流可用于为物理 AI 系统准备和验证数字孪生。智能体能检查 3D 场景、在 OpenUSD 中编写仿真相关数据、添加物理属性、渲染预检视图,并根据仿真就绪(SimReady)要求验证结果。该流程可将 Blender 中的场景转化为仿真就绪的 OpenUSD 文件。
NVIDIA 的 cuTile Rust 库借助智能体 AI 工具,可将基于 CUDA Tile 的 GPU 内核操作从 Python 自动翻译为 Rust 代码。该库将 Rust 的所有权模型扩展至基于 tile 的 GPU 内核,将可变输出拆分为互不相交的部分,并在内核启动间保持主机端的所有权契约。程序员在需要底层控制时,也可选择局部退出此安全模型。
图可视化工具通过将连接的数据转化为直观的交互式图表,帮助用户理解数据点之间的关系和影响。节点代表实体,关系以线条连接,属性控制颜色、大小等视觉元素。图可视化在欺诈检测、供应链映射和 AI 智能体记忆分析等场景中尤为关键,能揭示传统图表难以发现的多跳路径关联。Neo4j 提供了 Bloom、Dashboards 和 Visualization Library 等工具支持图可视化。
Together AI 发布从闭源模型向开源模型(OSM)迁移的完整策略,支持通过托管服务实现数周至数月的快速迁移,显著降低技术复杂度。该策略强调基于真实业务负载的评估,推荐使用 FrontierCode、LMArena、τ-bench 等基准,并结合实际流量回放进行性能与成本验证。最终目标是实现与闭源模型相当或更优的准确率与延迟表现,支持企业平稳过渡至开源生态。
图用于展示数据中实体之间的关系,知识图谱在此基础上添加业务定义和组织原则以解释关系含义,上下文图谱则在特定任务或决策时提供相关背景信息。知识图谱可帮助统一企业数据视角并支持 AI 响应与业务逻辑对齐,而上下文图谱能提升 AI 智能体的决策准确性并减少幻觉。GraphRAG 则利用图技术从知识图谱或上下文图谱中检索关联信息,增强 AI 生成内容的相关性。
Neo4j 博客通过实验对比原始图数据与预计算图指标(如社区检测、中心性)对AI检测金融欺诈的效果,发现富图结构能显著提升模型识别合成身份、可疑桥接账户和洗钱环路的精度与效率,避免模型在大量上下文token中无效消耗。实验使用3万账户、500万交易的合成数据集,验证了预计算拓扑指标对AI代理的增强作用。
推荐理由:通过对比原始图数据与预计算图指标对AI检测金融欺诈的效果,展示了结构化语义层如何提升模型效率与精度。
NVIDIA 博客对比了稠密模型与混合专家(MoE)模型架构的核心差异。以 Nemotron 3.5 Lightning 为例,其总参数量为 300 亿,但每个 token 仅激活约 30 亿参数,这得益于 MoE 架构仅选择部分专家网络处理输入。文章分析了两种架构在激活参数量、推理吞吐量以及适用场景上的权衡。
NVIDIA Groq 3 LPX 确定性执行技术提升了 NVIDIA Vera Rubin AI 平台的能效与交互性。该技术旨在最大化有限功耗预算下的输出,将性能功耗比作为衡量 AI 平台价值的最终标准。
Gemini 可通过 4 种方式帮助用户处理家务,如家电维修指导、定制化饮食计划、家庭支出跟踪和大型购物比较。用户可通过上传收据、使用 Gemini Live 拍摄冰箱内容或询问汽车对比信息,获得即时分析与建议。该功能基于 Google AI & Economy ATLAS v1.0 研究,显示超过 86% 的对话式 AI 交互发生在非工作场景。
NVIDIA FLARE 提供了跨 Docker、Kubernetes 和 Slurm 等异构基础设施扩展联邦学习工作流的能力。该框架使多个研究项目能在共享的 GPU 资源上保持隔离运行,同时确保每个参与组织对其数据和计算资源保持控制权。
LangChain 博客分享了施耐德电气、沃达丰和monday.com在欧洲与中东地区规模化智能体的实践经验。
LangChain 发布用于管理付费广告的智能体,支持跨平台数据整合、自动分析与提案,已开源并可通过 Managed Deep Agents 部署至 Slack。该智能体在六个月内使付费媒体贡献营销管道比例从 0 提升至 20%,成本下降 30%,并实现了 40 倍的报告生成效率提升。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
NVIDIA Transformer Engine 通过优化 JAX 中的专家路由,实现了无丢弃的 MoE 训练加速。该技术消除了传统 MoE 训练中因容量因子限制而丢弃 token 的现象,提升了训练效率。
IBM 将举办一场关于“负责任 AI 高等教育”的免费互动网络研讨会。会议将介绍 AI 类型、探讨相关担忧、分享 IBM 的负责任 AI 方法,并以 AI 智能体 IBM Bob 为例进行案例应用。参与者还可通过问答环节进行互动。
本教程演示如何使用 LangChain 构建基于文档的问答管道,涵盖分块、嵌入向量、检索、引用和 Weave 评估等步骤,并修复常见陷阱。教程包含具体实现流程和工具使用方法,适合希望优化 RAG 系统的开发者参考。内容基于开源框架,未提及具体模型版本或参数规模。
LangChain 发布 GTM 智能体,可自动处理新线索的调研与邮件草稿生成,并聚合账户级信号以支持销售与工程团队。该功能基于 Deep Agents 构建,支持多工具协同、人类审核、学习反馈循环,并已集成至 Slack 与 LangSmith。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
Credit Genie 采用 LangChain 的 OpenWiki 工具,自动化生成和维护代码库文档,解决了文档过时和部落知识问题。该系统每日通过 GitHub Pages 提供统一的可搜索界面,并在代码库中 openwiki/ 文件夹自动生成文档更新。团队通过此工具提升了跨系统协作效率,减少了手动维护需求,目前正计划整合内部跨仓库知识图谱以增强其智能性。
GitHub 日本与韩国营销负责人利用 GitHub Copilot 和 GitHub Actions,将营销活动从策划到跟进的全流程自动化。该系统以 GitHub Issue 为起点,通过 Issue 表单、标签和 Actions 工作流,自动处理活动落地页创建、链接生成、邮件发送、CRM 数据同步等重复任务。
一份涵盖近年关于开源模型的精选阅读清单,包含对开源模型定义、商业策略、安全风险及未来经济影响的分析。清单涉及 Meta 发布 Llama 3 的动机、中美开源模型竞争现状、中国开源历史及结构优势等内容,引用了 Bill Gurley、Mark Zuckerberg、Nathan Lambert 等人的文章。
NVIDIA NIM 通过全栈优化,使 Nemotron 3 Ultra 模型在保持交互性的前提下,支持的并发用户数提升了 2.5 倍。该优化对于提示词较长、需跨步骤复用上下文的智能体 AI 工作负载尤为重要。
Google Search 的 AI 功能可帮助跑者制定个性化训练计划、创建定制播放列表和选购合适装备。用户可通过 AI Mode 中的 Canvas 工具生成包含交叉训练和力量训练的详细日程,并连接 YouTube Music 账户获取跑步歌单。此外,借助涵盖超 600 亿产品列表的 Shopping Graph,Search 能提供符合预算等限制条件的装备推荐与比价。
Together AI 在 NVIDIA Vera Rubin NVL72 平台上部署了 ThunderKittens 2.0 GEMM 内核,实现 NVFP4 和 FP8 矩阵乘法运算,但性能仅达到理论峰值的 42.1% 和 44.4%。
NVIDIA 介绍了使用 Encode-Prefill-Decode (EPD) 解耦技术来优化多模态模型推理。该技术将视觉编码器阶段与预填充和解码阶段分离,尤其适用于图像密集型提示词、中短输出及量化 MoE 模型。结合 NVIDIA Dynamo 使用,可实现高达 5 倍的推理加速。
Gemini 提供四种方式帮助用户快速处理行政事务,包括填写表格、参与公民生活、查找政府机构和获取社会服务信息。用户可通过提示词获取具体步骤和所需文件清单,如“注册纽约市购买的二手车需要哪些文件和费用”。超过 40% 的用户在处理政府事务时会咨询 Gemini,以理解复杂流程和术语。
Mistral AI 帮助一家欧洲能源运营商将 40,000 行 Fortran 77 代码迁移至 C++,并重构了物理密集型的油藏模拟器架构。项目首先构建了数值对等性验证框架,确保新旧代码输出一致,并利用上百个 AI 智能体自动解析代码调用树、整合分散文档。通过采用“规划-编码-测试-评审”的多智能体工作流与人机协同检查点,最终在保障代码质量的同时完成了现代化重构。
Together AI 发布了一篇关于开源AI栈的深度指南,将栈分解为模型、推理、网关、工具等独立层,并解释了如何组合这些组件来构建自定义的AI开发工作流。
决策轨迹记录了AI智能体在做出决策时的推理步骤、工具调用和上下文信息,使决策过程可追溯和可查询。这些信息存储在上下文图中,与对话、事实和其他相关数据保持连接,便于后续审查和分析。决策轨迹支持可解释性、调试、合规审查、一致性提升和跨智能体的知识共享。
LangChain 在 deepagents 框架中引入了 subagent 的两种上下文模式:isolated(隔离)和 fork(分叉)。isolated 模式下子智能体从零开始,仅接收任务描述;fork 模式下子智能体继承监督智能体的完整对话历史,避免重复上下文获取。
Building Foundry 第三部分介绍了如何将现有档案库转化为可搜索的创意资源库,通过只读扫描、准备元数据并同步至 Weaviate 实现。该流程生成包含文件名、路径、类型、标签、描述和源 URI 的记录,无需移动或重命名文件。用户可通过关键词、语义或混合搜索模式查找内容,并通过项目、文件类型等过滤器缩小范围。
Neo4j 发布 Aura Agent 功能,实现 Salesforce Agentforce 与 Neo4j 知识图谱的无代码多智能体集成。该功能通过 MCP 协议连接,将图谱计算与工作流分离,使 Agentforce 仅需发送自然语言问题,Aura Agent 负责解析、执行 Cypher 查询并返回带证据的推荐结果,无需自定义代码。
本文展示了如何编写不会丢失数据的 Cypher 查询,通过构建三个测试用户(Beyoncé、Kelly 和 Michelle)来演示查询逻辑对数据可见性的影响。Michelle 的账户未被首次查询返回,因其没有完成课程的关联,而查询条件要求用户必须有指向课程的注册记录。修正后,查询直接锚定用户自身,通过允许空值的表达式返回所有用户信息,包括课程列表和完成数量。
NVIDIA 团队利用 NemoClaw 构建了一个记忆驱动的“参谋长”智能体。该智能体通过维护一个名为“自我模型”的人类可读知识层来存储相关记忆,使 AI 能够理解并处理随时间变化的企业消息、决策、项目和职责等上下文信息。