Your LLM Is Only as Good as What It Retrieves
检索质量是影响大语言模型输出可靠性的关键因素,当检索失败时,模型会生成看似合理但缺乏事实依据的内容。研究发现,在 HaluEval、TruthfulQA 和 FaithDial 等基准测试中,检索层问题始终是幻觉产生的主要来源。五种常见的检索失败模式包括检索漂移、上下文截断、过时索引污染、低相关性 top-k 检索和智能体间误通信,这些问题在多智能体系统中尤为隐蔽且难以检测。
检索质量是影响大语言模型输出可靠性的关键因素,当检索失败时,模型会生成看似合理但缺乏事实依据的内容。研究发现,在 HaluEval、TruthfulQA 和 FaithDial 等基准测试中,检索层问题始终是幻觉产生的主要来源。五种常见的检索失败模式包括检索漂移、上下文截断、过时索引污染、低相关性 top-k 检索和智能体间误通信,这些问题在多智能体系统中尤为隐蔽且难以检测。
Astera Labs 发布了代号为 Scorpio X 的 AI 交换芯片,可作为 Nvidia NVSwitch 的替代方案,用于构建机架级 AI 系统。该芯片集成了 320 条 PCIe 6.0 通道,提供 5.12 TB/s 的双向带宽,并具备 Hypercast 等网络内计算功能以优化 MoE 模型推理。Scorpio 系列芯片目前正在采样,预计 2026 年下半年投入量产。
IBM 更新了其 Db2 Genius Hub,新增对 Google Vertex AI 和 Intel Gaudi 的支持,旨在构建一个能在预设护栏内代表数据库管理员(DBA)行动的自动化数据库管理系统。
ServiceNow 宣布扩展其 AI Control Tower,从一个治理仪表板升级为覆盖企业全部 AI 资产(包括外部平台)的管理指挥中心。新功能包括通过 Veza 集成实现自动检测和禁用受攻击智能体的安全开关、通过 Traceloop 集成提供深度 AI 可观测性,以及成本追踪与 ROI 仪表板。
AI 智能体正对云数据基础设施构成前所未有的压力,其推理行为类似 OLTP++,具有超高并发性和不可预测的访问模式。向量数据库与 RAG 应用的瓶颈常在于底层存储和数据访问层,而非 Python 或大语言模型本身。企业必须为极端的 I/O 需求尖峰设计数据路径,并关注 p99/p999 尾部延迟,而非平均延迟。
Together AI 在 NVIDIA GTC 2026 上深入探讨了生产环境中 AI 推理的挑战与优化策略,指出推理成本占生产系统全生命周期成本的 80-90%,是决定 AI 原生公司单位经济效益的关键。
本文探讨了如何通过结构化方式与 AI 协作并实现复利效应,提出将上下文作为基础设施、将偏好编码为配置等方法。作者建议为每个项目维护 CLAUDE.md 文件,包含术语解释、阅读顺序和行为规范,以帮助模型更高效地理解任务和减少错误。此外,作者提到将每周执行一次以上的行为封装为技能(skill),如 /polish、/write、/daily,以提升 AI 协作的可重复性和效率。
Together AI 在发现 Copy Fail 漏洞后,立即在其 AI 基础设施中禁用了易受攻击的 algif_aead 内核模块以缓解风险。该漏洞允许本地无权限用户篡改系统文件,在共享内核的多租户 AI 环境中构成跨租户风险。公司采取了无需重启的快速缓解措施,并计划在稳定后逐步部署内核补丁,同时默认关闭非必需的内核接口以增强平台安全。
Replit 推出 App Monitoring 功能,可第一时间通过邮件通知用户应用宕机情况。Replit Agent 现在能读取应用日志和只读访问生产数据库,用于诊断故障原因。用户还可通过 Analytics 查看历史运行状态并关联请求量、流量峰值等信号。
Together AI 宣布其 AI Native Cloud 平台上线 DeepSeek-V4 Pro 模型,提供 Serverless Inference 和 Dedicated Endpoints 两种部署方式。
推荐理由:原文给出了模型在平台上的部署细节、定价模式和推理模式选择,读者可以据此判断它如何适配不同复杂度的长上下文任务。
Together AI 平台已上线 NVIDIA Nemotron 3 Nano Omni 模型。该模型是一个 300 亿参数的开源多模态模型,采用混合 Mamba-Transformer MoE 架构,支持视频、图像、音频和语言的统一推理,上下文窗口达 256K token。
Together AI 推出的 distribution-aware speculative decoding (DAS) 框架将 RL 后训练中的 rollout 阶段速度提升了最高 50%,且不影响模型输出质量。该框架包含自适应后缀树草稿器和长度感知调度策略,在 DeepSeek-R1-Distill-Qwen-7B 的数学推理任务中实现了超过 50% 的 rollout 时间缩减。
Weaviate v1.37 发布,新增内置 MCP Server、可扩展分词器、基于 MMR 的多样性搜索(Diversity Search)和查询分析(Query Profiling)等预览功能。
Replit 推出 Auto-Protect 功能,自动检测项目依赖中的关键 CVE 漏洞并准备补丁。用户通过邮件链接可一键审查并应用补丁,随后重新发布应用即可完成修复。该功能需管理员在账户设置中手动启用,并可自定义触发修复和邮件通知的漏洞最低严重级别。
Replit 推出 Security Agent,可在一小时内完成应用的全面安全审查。该工具采用可定制的威胁建模计划,并结合 Semgrep 和 HoundDog.ai 提高检测准确性。用户可在项目 Security 面板选择“Run Scan with Agent”启动扫描,生成的风险报告支持并行修复和主分支回补。
Replit 通过纵深防御策略保障其平台各层安全,从开发沙箱到生产部署均采用隔离与验证机制。平台默认限制应用间的数据访问,仅允许通过 Connectors 明确授权;使用 Determinate Nix 管理依赖,确保软件供应链无已知漏洞版本。开发与生产环境数据完全分离,支持每日备份与只读 Git 历史记录,防止意外修改生产数据。
Together AI 提出了面向 AI 原生团队的多租户 GPU 集群设计模式,旨在实现资源池化的经济效益,同时避免团队间的干扰。该架构在共享基础设施层之上,为每个租户提供完全隔离的虚拟环境,包括专用 GPU 节点、存储和自选的编排层。系统通过配额分配、冲突预防的提前预订以及容量感知调度来管理资源,并支持按需自动溢出,确保生产速度不受基础设施流程阻碍。
Replit Agent 4 可直接从现有项目生成利益相关者演示文稿、实时仪表盘和动画,无需切换工具。所有输出共享相同的设计系统,确保字体、颜色和内容一致。实时数据应用替代静态导出,消除分析师请求队列的延迟,使产品发布资产能与产品同步生成。
AI Native Cloud 是为 AI 原生公司构建的专用云平台,旨在解决从预训练、微调、评估到大规模推理的完整 AI 生命周期挑战。它通过垂直整合的 AI 全栈、将前沿研究成果快速产品化的能力,以及支持指数级增长的生态系统,帮助企业在模型质量、延迟、成本和可靠性方面保持竞争优势。
Replit Agent 4 通过将原型作为工作流的核心,实现需求文档、领导汇报和工程交接的自动同步。产品负责人在迭代原型时,相关材料会实时更新,无需手动协调。集成 Glean 和 Atlassian 的 MCP 接口可自动引入用户研究并生成 Jira 任务,减少人工操作。
编码智能体(Coding Agent)是在大语言模型(LLM)之上增加应用层(即智能体框架)的系统,旨在更高效地处理编码任务。其核心由模型、智能体循环和运行时支持三层构成,其中智能体框架负责管理上下文、工具使用、状态和控制流。Claude Code 和 Codex CLI 等工具就是典型的编码框架,它们通过优化上下文管理和迭代反馈,显著提升了模型在软件工程任务中的实际表现。
Together AI 的研究论文展示了如何利用 LLM 优化数据库查询执行计划。其 DBPlanBench 框架将 Apache DataFusion 的物理执行计划序列化后交由 LLM 分析,通过生成 JSON Patch 进行局部调整,而非重写整个计划。
项目经理通过 vibe coding 在 90 分钟内生成、比较并确定产品方向,减少与设计团队的交接时间。Replit 的 Infinite Canvas 支持在应用内直接对比多个设计,修改后一键进入生产环境,缩小设计与代码间的差距。设计团队仍需参与可访问性审查、品牌对齐和生产质量优化,但重点转向精修阶段。
Together AI 的 kernels 团队通过开发 FlashAttention 和 ThunderKittens 等核心软件,将 Transformer 注意力计算速度提升了 2-3 倍。
产品经理可通过 Replit Agent 4 在同一 Workspace 中直接生成可交互原型,无需设计与工程阶段的重复实现。该工具通过清晰的提示词描述行为,使工程师能从生产环境接收已测试的原型作为可构建起点。AI 集成工作流减少了传统流程中多个翻译环节,缩短了原型开发周期并提升反馈效率。
Together AI 开源了 Aurora,这是一个基于强化学习的开源框架,能够从实时推理轨迹中学习并异步更新推测解码器中的草稿模型。该框架将推测解码从静态的一次性设置转变为动态、自我改进的飞轮,在实验中,相比训练良好但静态的草稿模型,Aurora 在 Qwen3 和 Llama3 等模型上实现了额外 1.25 倍的加速。
Ollama 发布 0.19 预览版,在 Apple Silicon 设备上集成 Apple 的 MLX 机器学习框架,以利用其统一内存架构提升性能。新版本支持 NVIDIA 的 NVFP4 量化格式以保持模型精度,并改进了缓存机制,使 Claude Code 等智能体任务响应更快。预览版已针对 Qwen3.5-35B-A3B 模型进行加速,并提供了启动命令。
推荐理由:预览版基于 MLX 框架,并支持 NVFP4 量化格式,为在 Apple Silicon 上运行大模型提供了新的性能基准和部署选项。
一项研究发现,采用精心设计的“分而治之”框架,Llama-3-70B 或 Qwen-72B 等较弱模型在长上下文任务上的表现可以匹配甚至超越 GPT-4o 的单次处理模式。该框架通过规划器、并行工作器和聚合管理器分解任务,有效降低了因上下文过长导致的模型混淆、任务依赖和聚合噪声。这种方法在问答、检索和摘要等任务中更具成本效益和速度优势,但高度依赖跨块上下文的任务仍适合使用单次处理的强大模型。
Replit 发布 Agent 4,新增并行任务系统可自动解决 90% 的合并冲突,通过微虚拟机实现即时分支,引入 Infinite Canvas 实现设计与工程同环境协作,并提供实时协作可见性,支持团队成员查看彼此任务进度。CEO Amjad Masad 表示 Agent 4 实现从想法到产品的一站式开发,FireCrown Media 使用该工具年节省超 100 万美元。
本文提供了现代大语言模型中注意力机制变体的视觉指南,包含 45 个模型架构的图示卡片。作者基于过往内容整理并补充了多个重要架构,同时推出了可通过 Redbubble 获取的海报版本。文中还回顾了近期在主流开源模型中使用的注意力变体,如 grouped-query attention、sliding window attention 等。
Replit 团队通过直播展示了 Agent 4 的开发过程和实际应用,包括 Manny Bernabe 演示的 Taste 应用和 Raymmar Tirado 展示的 Replitopolis 3D 城市项目。
fal 推出 MCP Server,让 Claude、Cursor 等 AI 助手能直接搜索、运行和串联 fal 平台上的 1000 多个生成模型。该服务器提供 9 个工具,涵盖模型发现、执行和文件上传,用户只需配置 API 密钥即可在对话中完成图像生成、视频制作、语音合成等复杂工作流。服务本身免费,按标准 fal 定价支付模型调用费用。
推荐理由:通过 MCP 协议将上千个生成模型直接接入 Claude、Cursor 等 AI 助手,简化了多模态创作的工作流。
Replit Agent 4 对设计、协作、构建和规划四大核心模块进行升级,推出无限设计画布支持所有 artifact 类型,改用共享项目协作模式并由 Agent 协助合并,实现规划与构建并行。旧项目仍可使用,新功能如多应用构建和并行任务执行在新项目中可用。
推荐理由:原文详细对比了 Agent 3 与 Agent 4 的核心功能变化,包括设计画布、协作模式和构建流程,读者可据此判断新版本对开发效率的实际提升。
Together AI 联合多所大学的研究人员发布了 Mamba-3,这是一个以推理效率为主要目标的新状态空间模型。Mamba-3 通过更复杂的循环公式、复数值状态跟踪和 MIMO 变体提升了性能,其 SISO 版本在 1.5B 规模上,所有序列长度的预填充+解码延迟均优于 Mamba-2、Gated DeltaNet 和 Llama-3.2-1B。
推荐理由:Mamba-3 将设计目标从训练效率转向推理效率,并开源了内核,为关注部署性能的开发者提供了新的架构选择。
Together AI 在 NVIDIA GTC 2026 上宣布多项合作与产品更新,旨在支持更开放、智能体化和生产就绪的 AI 系统。其模型库现已集成 NVIDIA Nemotron 3 Super 和 NVIDIA Parakeet TDT 0.6B V3 等模型,并通过 NVIDIA Dynamo 1.0 和 NemoClaw 优化推理性能。
Replit 推出与 Databricks 的新连接器,允许用户在 Replit 中直接访问 Databricks 的治理数据、模型和仓库,无需复制敏感数据。通过 Replit Agent,用户可快速构建如3D天气地球仪等数据应用,Databricks Genie 提供自然语言问答与数据溯源能力。该集成使产品经理、分析师等非工程角色能直接构建受控的企业级数据应用,缩短开发周期。
推荐理由:原文展示了Replit与Databricks的集成方式和实际应用案例,读者可以据此判断该连接器如何支持企业级数据应用的快速构建。
Berkeley AI Research 提出了 SPEX 和 ProxySPEX 算法,用于大规模识别驱动大语言模型决策的关键交互作用。SPEX 利用稀疏性和低阶性将搜索问题转化为可解的稀疏恢复问题,而 ProxySPEX 则利用层次结构特性,能以约 10 倍更少的消融操作达到与 SPEX 相当的性能。这些框架能高效应用于特征归因、数据归因和模型组件归因,提升模型的可解释性。
Together AI 推出了一个统一的解决方案,用于在共置的 STT、LLM 和 TTS 基础设施上构建实时语音智能体。该架构将整个语音技术栈保留在同一云上,旨在将端到端延迟降至 500 毫秒以下,并简化部署。平台原生集成了 Cartesia 和 Deepgram 的领先语音模型,为开发者提供了模型选择和配置的灵活性。
推荐理由:Together AI 将语音识别、大模型和语音合成整合在同一集群,为构建实时语音智能体提供了一个低延迟、可灵活选模的解决方案。
Replit 推出 Agent 4,强调在单一环境中实现设计、开发与协作的无缝整合。其四大支柱包括:自由设计(无限画布与UI变体)、快速推进(并行任务与自动拆分)、协同构建(任务流与智能排序)和统一交付(支持Web、移动、幻灯片、动画等多类型产出)。
推荐理由:原文详细说明了 Agent 4 的四大核心能力与协作模式,读者可据此判断其对开发流程的重构潜力。
Replit 推出 Vibe Code 功能,允许用户在代码环境中直接生成动态风格视频,无需依赖外部动画工作室。该功能基于 Gemini 模型构建,支持通过自然语言描述视频内容,生成类似专业工作室制作的动画片段。用户可快速生成初稿并在 Replit 内进行迭代,社区已有超过 1,800 名开发者参与相关项目。