跳到正文
5月6日周三
  1. Weaviate 博客40

    Your LLM Is Only as Good as What It Retrieves

    检索质量是影响大语言模型输出可靠性的关键因素,当检索失败时,模型会生成看似合理但缺乏事实依据的内容。研究发现,在 HaluEval、TruthfulQA 和 FaithDial 等基准测试中,检索层问题始终是幻觉产生的主要来源。五种常见的检索失败模式包括检索漂移、上下文截断、过时索引污染、低相关性 top-k 检索和智能体间误通信,这些问题在多智能体系统中尤为隐蔽且难以检测。

  2. The Register · AI/ML44

    Astera Labs 推出 Scorpio X AI 交换芯片,提供 Nvidia NVSwitch 替代方案

    Astera Labs 发布了代号为 Scorpio X 的 AI 交换芯片,可作为 Nvidia NVSwitch 的替代方案,用于构建机架级 AI 系统。该芯片集成了 320 条 PCIe 6.0 通道,提供 5.12 TB/s 的双向带宽,并具备 Hypercast 等网络内计算功能以优化 MoE 模型推理。Scorpio 系列芯片目前正在采样,预计 2026 年下半年投入量产。

  3. The Register · AI/ML54

    ServiceNow 扩展 AI Control Tower,新增智能体安全开关并集成 MCP 服务器

    ServiceNow 宣布扩展其 AI Control Tower,从一个治理仪表板升级为覆盖企业全部 AI 资产(包括外部平台)的管理指挥中心。新功能包括通过 Veza 集成实现自动检测和禁用受攻击智能体的安全开关、通过 Traceloop 集成提供深度 AI 可观测性,以及成本追踪与 ROI 仪表板。

5月4日周一
  1. The Register · AI/ML26

    AI 推理正在颠覆数据基础设施规则

    AI 智能体正对云数据基础设施构成前所未有的压力,其推理行为类似 OLTP++,具有超高并发性和不可预测的访问模式。向量数据库与 RAG 应用的瓶颈常在于底层存储和数据访问层,而非 Python 或大语言模型本身。企业必须为极端的 I/O 需求尖峰设计数据路径,并关注 p99/p999 尾部延迟,而非平均延迟。

5月3日周日
  1. Eugene Yan48

    How to Work and Compound with AI 如何与 AI 协作并实现复利效应

    本文探讨了如何通过结构化方式与 AI 协作并实现复利效应,提出将上下文作为基础设施、将偏好编码为配置等方法。作者建议为每个项目维护 CLAUDE.md 文件,包含术语解释、阅读顺序和行为规范,以帮助模型更高效地理解任务和减少错误。此外,作者提到将每周执行一次以上的行为封装为技能(skill),如 /polish、/write、/daily,以提升 AI 协作的可重复性和效率。

4月30日周四
  1. Together AI41

    Together AI 应对 Copy Fail 漏洞的生产环境处置与安全加固

    Together AI 在发现 Copy Fail 漏洞后,立即在其 AI 基础设施中禁用了易受攻击的 algif_aead 内核模块以缓解风险。该漏洞允许本地无权限用户篡改系统文件,在共享内核的多租户 AI 环境中构成跨租户风险。公司采取了无需重启的快速缓解措施,并计划在稳定后逐步部署内核补丁,同时默认关闭非必需的内核接口以增强平台安全。

4月29日周三
4月28日周二
4月24日周五
  1. Together AI44

    Together AI 发布 distribution-aware speculative decoding 框架,将 RL 训练 rollout 速度提升最高 50%

    Together AI 推出的 distribution-aware speculative decoding (DAS) 框架将 RL 后训练中的 rollout 阶段速度提升了最高 50%,且不影响模型输出质量。该框架包含自适应后缀树草稿器和长度感知调度策略,在 DeepSeek-R1-Distill-Qwen-7B 的数学推理任务中实现了超过 50% 的 rollout 时间缩减。

4月23日周四
  1. Replit 博客38

    Replit Auto-Protect 功能介绍

    Replit 推出 Auto-Protect 功能,自动检测项目依赖中的关键 CVE 漏洞并准备补丁。用户通过邮件链接可一键审查并应用补丁,随后重新发布应用即可完成修复。该功能需管理员在账户设置中手动启用,并可自定义触发修复和邮件通知的漏洞最低严重级别。

4月22日周三
4月21日周二
  1. Replit 博客30

    Replit 如何通过纵深防御保障 Vibe 编程栈的安全

    Replit 通过纵深防御策略保障其平台各层安全,从开发沙箱到生产部署均采用隔离与验证机制。平台默认限制应用间的数据访问,仅允许通过 Connectors 明确授权;使用 Determinate Nix 管理依赖,确保软件供应链无已知漏洞版本。开发与生产环境数据完全分离,支持每日备份与只读 Git 历史记录,防止意外修改生产数据。

  2. Together AI26

    Together AI 多租户 GPU 集群设计指南:AI 原生团队的容量无冲突架构

    Together AI 提出了面向 AI 原生团队的多租户 GPU 集群设计模式,旨在实现资源池化的经济效益,同时避免团队间的干扰。该架构在共享基础设施层之上,为每个租户提供完全隔离的虚拟环境,包括专用 GPU 节点、存储和自选的编排层。系统通过配额分配、冲突预防的提前预订以及容量感知调度来管理资源,并支持按需自动溢出,确保生产速度不受基础设施流程阻碍。

4月9日周四
4月7日周二
  1. Together AI29

    AI Native Cloud 是什么?

    AI Native Cloud 是为 AI 原生公司构建的专用云平台,旨在解决从预训练、微调、评估到大规模推理的完整 AI 生命周期挑战。它通过垂直整合的 AI 全栈、将前沿研究成果快速产品化的能力,以及支持指数级增长的生态系统,帮助企业在模型质量、延迟、成本和可靠性方面保持竞争优势。

4月6日周一
4月4日周六
  1. Ahead of AI42

    编码智能体(Coding Agent)的核心组件解析

    编码智能体(Coding Agent)是在大语言模型(LLM)之上增加应用层(即智能体框架)的系统,旨在更高效地处理编码任务。其核心由模型、智能体循环和运行时支持三层构成,其中智能体框架负责管理上下文、工具使用、状态和控制流。Claude Code 和 Codex CLI 等工具就是典型的编码框架,它们通过优化上下文管理和迭代反馈,显著提升了模型在软件工程任务中的实际表现。

4月3日周五
  1. Replit 博客27

    为什么优秀的项目经理正在使用 vibe coding 来减少设计延迟

    项目经理通过 vibe coding 在 90 分钟内生成、比较并确定产品方向,减少与设计团队的交接时间。Replit 的 Infinite Canvas 支持在应用内直接对比多个设计,修改后一键进入生产环境,缩小设计与代码间的差距。设计团队仍需参与可访问性审查、品牌对齐和生产质量优化,但重点转向精修阶段。

4月1日周三
  1. Replit 博客37

    产品经理如何用 AI 构建可运行的原型

    产品经理可通过 Replit Agent 4 在同一 Workspace 中直接生成可交互原型,无需设计与工程阶段的重复实现。该工具通过清晰的提示词描述行为,使工程师能从生产环境接收已测试的原型作为可构建起点。AI 集成工作流减少了传统流程中多个翻译环节,缩短了原型开发周期并提升反馈效率。

3月31日周二
  1. Together AI65

    Together AI 开源 Aurora:基于 RL 的在线自适应推测解码框架

    Together AI 开源了 Aurora,这是一个基于强化学习的开源框架,能够从实时推理轨迹中学习并异步更新推测解码器中的草稿模型。该框架将推测解码从静态的一次性设置转变为动态、自我改进的飞轮,在实验中,相比训练良好但静态的草稿模型,Aurora 在 Qwen3 和 Llama3 等模型上实现了额外 1.25 倍的加速。

3月30日周一
  1. Ollama 博客67

    Ollama 0.19 预览版发布,在 Apple Silicon 上集成 MLX 框架

    Ollama 发布 0.19 预览版,在 Apple Silicon 设备上集成 Apple 的 MLX 机器学习框架,以利用其统一内存架构提升性能。新版本支持 NVIDIA 的 NVFP4 量化格式以保持模型精度,并改进了缓存机制,使 Claude Code 等智能体任务响应更快。预览版已针对 Qwen3.5-35B-A3B 模型进行加速,并提供了启动命令。

    推荐理由:预览版基于 MLX 框架,并支持 NVFP4 量化格式,为在 Apple Silicon 上运行大模型提供了新的性能基准和部署选项。

3月26日周四
  1. Together AI49

    Together AI 研究:弱模型如何通过“分而治之”框架在长上下文任务中超越 GPT-4o

    一项研究发现,采用精心设计的“分而治之”框架,Llama-3-70B 或 Qwen-72B 等较弱模型在长上下文任务上的表现可以匹配甚至超越 GPT-4o 的单次处理模式。该框架通过规划器、并行工作器和聚合管理器分解任务,有效降低了因上下文过长导致的模型混淆、任务依赖和聚合噪声。这种方法在问答、检索和摘要等任务中更具成本效益和速度优势,但高度依赖跨块上下文的任务仍适合使用单次处理的强大模型。

3月23日周一
  1. Replit 博客51

    Replit 发布 Agent 4,支持并行任务、协作可见性与即时分支

    Replit 发布 Agent 4,新增并行任务系统可自动解决 90% 的合并冲突,通过微虚拟机实现即时分支,引入 Infinite Canvas 实现设计与工程同环境协作,并提供实时协作可见性,支持团队成员查看彼此任务进度。CEO Amjad Masad 表示 Agent 4 实现从想法到产品的一站式开发,FireCrown Media 使用该工具年节省超 100 万美元。

3月22日周日
  1. Ahead of AI48

    现代大语言模型中注意力机制变体的视觉指南

    本文提供了现代大语言模型中注意力机制变体的视觉指南,包含 45 个模型架构的图示卡片。作者基于过往内容整理并补充了多个重要架构,同时推出了可通过 Redbubble 获取的海报版本。文中还回顾了近期在主流开源模型中使用的注意力变体,如 grouped-query attention、sliding window attention 等。

3月21日周六
3月20日周五
  1. fal 博客55

    fal 发布 MCP Server,可连接 1000+ 模型

    fal 推出 MCP Server,让 Claude、Cursor 等 AI 助手能直接搜索、运行和串联 fal 平台上的 1000 多个生成模型。该服务器提供 9 个工具,涵盖模型发现、执行和文件上传,用户只需配置 API 密钥即可在对话中完成图像生成、视频制作、语音合成等复杂工作流。服务本身免费,按标准 fal 定价支付模型调用费用。

    推荐理由:通过 MCP 协议将上千个生成模型直接接入 Claude、Cursor 等 AI 助手,简化了多模态创作的工作流。

  2. Replit 博客61

    Replit Agent 4 发布:设计画布、协作模式与构建流程全面升级

    Replit Agent 4 对设计、协作、构建和规划四大核心模块进行升级,推出无限设计画布支持所有 artifact 类型,改用共享项目协作模式并由 Agent 协助合并,实现规划与构建并行。旧项目仍可使用,新功能如多应用构建和并行任务执行在新项目中可用。

    推荐理由:原文详细对比了 Agent 3 与 Agent 4 的核心功能变化,包括设计画布、协作模式和构建流程,读者可据此判断新版本对开发效率的实际提升。

3月17日周二
  1. Together AI61

    Together AI 发布 Mamba-3 状态空间模型

    Together AI 联合多所大学的研究人员发布了 Mamba-3,这是一个以推理效率为主要目标的新状态空间模型。Mamba-3 通过更复杂的循环公式、复数值状态跟踪和 MIMO 变体提升了性能,其 SISO 版本在 1.5B 规模上,所有序列长度的预填充+解码延迟均优于 Mamba-2、Gated DeltaNet 和 Llama-3.2-1B。

    推荐理由:Mamba-3 将设计目标从训练效率转向推理效率,并开源了内核,为关注部署性能的开发者提供了新的架构选择。

3月16日周一
3月13日周五
  1. Replit 博客54

    Replit 推出与 Databricks 的集成连接器,支持企业级数据应用的快速构建

    Replit 推出与 Databricks 的新连接器,允许用户在 Replit 中直接访问 Databricks 的治理数据、模型和仓库,无需复制敏感数据。通过 Replit Agent,用户可快速构建如3D天气地球仪等数据应用,Databricks Genie 提供自然语言问答与数据溯源能力。该集成使产品经理、分析师等非工程角色能直接构建受控的企业级数据应用,缩短开发周期。

    推荐理由:原文展示了Replit与Databricks的集成方式和实际应用案例,读者可以据此判断该连接器如何支持企业级数据应用的快速构建。

  2. Berkeley AI Research32

    Berkeley AI Research 提出 SPEX 与 ProxySPEX:大规模识别 LLM 中的交互作用

    Berkeley AI Research 提出了 SPEX 和 ProxySPEX 算法,用于大规模识别驱动大语言模型决策的关键交互作用。SPEX 利用稀疏性和低阶性将搜索问题转化为可解的稀疏恢复问题,而 ProxySPEX 则利用层次结构特性,能以约 10 倍更少的消融操作达到与 SPEX 相当的性能。这些框架能高效应用于特征归因、数据归因和模型组件归因,提升模型的可解释性。

3月12日周四
  1. Together AI55

    Together AI 推出构建实时语音智能体的统一解决方案

    Together AI 推出了一个统一的解决方案,用于在共置的 STT、LLM 和 TTS 基础设施上构建实时语音智能体。该架构将整个语音技术栈保留在同一云上,旨在将端到端延迟降至 500 毫秒以下,并简化部署。平台原生集成了 Cartesia 和 Deepgram 的领先语音模型,为开发者提供了模型选择和配置的灵活性。

    推荐理由:Together AI 将语音识别、大模型和语音合成整合在同一集群,为构建实时语音智能体提供了一个低延迟、可灵活选模的解决方案。

3月11日周三
  1. Replit 博客64

    Replit 推出 Agent 4:专为创意构建的智能体

    Replit 推出 Agent 4,强调在单一环境中实现设计、开发与协作的无缝整合。其四大支柱包括:自由设计(无限画布与UI变体)、快速推进(并行任务与自动拆分)、协同构建(任务流与智能排序)和统一交付(支持Web、移动、幻灯片、动画等多类型产出)。

    推荐理由:原文详细说明了 Agent 4 的四大核心能力与协作模式,读者可据此判断其对开发流程的重构潜力。

3月7日周六
  1. Replit 博客45

    Replit 推出 Vibe Code 功能:在代码环境中生成动态风格视频

    Replit 推出 Vibe Code 功能,允许用户在代码环境中直接生成动态风格视频,无需依赖外部动画工作室。该功能基于 Gemini 模型构建,支持通过自然语言描述视频内容,生成类似专业工作室制作的动画片段。用户可快速生成初稿并在 Replit 内进行迭代,社区已有超过 1,800 名开发者参与相关项目。