跳到正文
5月29日周五
5月28日周四
  1. Weights & Biases29

    使用 Google 的 Gemini Managed Agents API 运行智能体的实践

    本文演示如何通过 Google 的 Gemini Managed Agents API 构建一个小型的 bug-finder 智能体。Gemini Managed Agents 是 Google 推出的用于生产环境的智能体管理服务,支持开发者快速部署和运行基于 Gemini 模型的智能体。该 API 提供了对智能体的托管能力,简化了在实际应用中集成和维护 AI 智能体的流程。

  2. Ollama 博客64

    OpenJarvis v1.0 发布,原生支持 Ollama 运行本地 AI 智能体

    OpenJarvis v1.0 发布,这是一个用于在自有硬件上运行个人 AI 智能体的开源框架,现已原生支持 Ollama。该框架由斯坦福大学的 Hazy Research 和 Scaling Intelligence 实验室开发,默认采用本地优先模式,模型在本地运行,云端为可选。安装脚本可自动检测现有 Ollama 安装,并预设了多个开箱即用的智能体预设,如晨间简报、跨文件研究和本地代码助手。

    推荐理由:OpenJarvis 作为本地优先的 AI 智能体框架,其 v1.0 版本原生支持 Ollama,为希望将 AI 工作流本地化的开发者提供了开箱即用的选项。

  3. Weaviate 博客16

    Weaviate Cloud 扩展基于角色的访问控制:新增 Editor 和 Viewer 角色

    Weaviate Cloud 现在支持为用户分配更细粒度的角色,新增 Editor 和 Viewer 角色,与原有的 Owner 和 Admin 角色共同构成四类权限体系。用户可通过控制台的 Organization 设置页面直接管理角色分配,权限变更立即生效。该功能适用于需要精细化控制资源访问权限的团队或企业用户。

5月27日周三
  1. Weights & Biases25

    构建一个文本到 SQL 的智能体

    Weights & Biases 的 AI Builders 系列第二版介绍了如何构建一个文本到 SQL 的智能体。该教程聚焦于使用现有工具和框架实现从自然语言到数据库查询语句的转换功能。内容涵盖模型训练、提示词设计及实际部署流程,适合开发者和数据工程师参考。

5月26日周二
5月25日周一
  1. Vector Institute21

    Mohamad Moosavi:用 AI 加速气候解决方案的探索

    Mohamad Moosavi 通过深度学习使分子可微分,从而将材料科学中的离散变量转化为连续变量,大幅提升了材料发现和设计的效率。他目前使用拓扑深度学习方法,研究材料三维结构与性能之间的关系,无需逐一合成和测试大量候选材料。这种突破性方法为应对气候变化的可持续技术开发提供了更快的路径,加拿大凭借顶尖科研人才和对可持续发展的重视,正成为该领域创新的重要推动者。

5月23日周六
  1. Weights & Biases46

    如何构建一个自动化的软件测试智能体

    本文介绍了如何构建一个基于 Python 的自动化软件测试智能体,该智能体能够规划、生成并运行 pytest 测试,并将结果记录到 W&B Weave。该方法利用了 Agent 框架实现测试流程自动化,适用于需要持续集成和测试日志追踪的开发场景。文中未提及具体模型参数或性能指标,但提供了可复现的代码实现路径。

5月22日周五
5月21日周四
  1. Replit 博客37

    Replit Enterprise 现支持自助购买

    Replit Enterprise 现在支持组织直接通过官网自助购买并立即配置 SSO 和 SCIM。用户可选择年度信用额度,获得默认不限量席位,支付后即刻进入新工作区。此流程简化了企业采购流程,同时提供 SOC 2 合规和企业专属连接器等安全功能。

  2. Weaviate 博客54

    使用 Weaviate MCP 构建代码助手:RAG over Code & Docs

    Weaviate 博客发布教程,介绍如何利用内置 MCP 服务器构建代码助手,通过 RAG 技术检索代码和文档,支持 Claude Code、Cursor 和 VS Code 连接,提供从部署、数据分块、索引到客户端配置的完整步骤。

    推荐理由:原文提供了从部署到连接多个客户端的完整步骤,读者可直接复用以构建基于 Weaviate 的代码助手。

  3. Weights & Biases36

    Qwen3.7-Max 基准测试成绩发布

    阿里巴巴 Qwen 团队推出了 Qwen3.7-Max,该模型专注于代码智能体、自主执行和长时程推理。模型在多个基准测试中取得优异成绩,包括在 HumanEval 和 SWE-bench 上的高分表现。Qwen3.7-Max 支持 8k 上下文长度,可通过 API 调用,适用于需要复杂推理和代码生成的场景。

5月20日周三
5月19日周二
  1. Vector Institute29

    健康AI实施工具包 2.0:面向2026年的安全战略蓝图

    健康AI实施工具包 2.0 是 Vector Institute 发布的全面指南,用于指导医疗系统在实际部署中负责任地管理整个AI生命周期。该工具包包含三个核心支柱:战略AI治理、偏见缓解与公平性、以及安大略省医院的现实验证案例。工具包新增了持续监控、模型漂移检测和部署后验证等策略,以应对医疗AI在实际应用中可能带来的风险。

5月18日周一
  1. 百度文心 新模型32

    百度 ERNIE-Image-Aes:平衡类别泛化的图像美学评分模型

    百度推出 ERNIE-Image-Aes,一个基于 ArtiMuse 初始化并微调的 8B 视觉-语言模型,用于图像美学评分,在 ERIA-1K 基准测试中 SRCC 达 0.7445、PLCC 达 0.7598。该模型通过专业背景标注者参与的瑞士锦标赛式成对标注协议,避免了对特定图像类型的系统性偏见。其训练数据涵盖摄影、动漫、设计、日常快照和电影摄影等多种类别,确保评分结果的平衡性。

5月16日周六
  1. Weights & Biases36

    人类参与评估:AI 未来仍需人类

    Weights & Biases 提出人类参与评估是衡量大语言模型效果的关键,强调需理解人类对 AI 的实际体验。该方法主张结合自动化指标与人工反馈,以更全面地评估模型表现。文章指出,当前仅依赖自动化评估可能忽略模型在真实场景中的交互质量与用户感受。

5月15日周五
5月14日周四
  1. Weaviate 博客38

    Weaviate v1.37 如何让 BM25 分词器成为可观察的多语言搜索组件

    Weaviate v1.37 将分词器作为可观察的多语言搜索组件,提升混合搜索质量。BM25 的搜索效果高度依赖分词器的准确性,错误分词会导致关键词匹配失效。该版本支持多种分词方法(如 WORD、LOWERCASE、WHITESPACE、FIELD)和语言特定分词器(如 kagome_ja、gse_ch),并提供字符折叠功能以解决多语言搜索中的重音不匹配问题。

  2. Together AI52

    Together AI 开源视频翻译工具 Violin

    Together AI 开源了视频翻译工具 Violin,它通过 Whisper V3、DeepSeek V4 Pro 和 Cartesia Sonic 3 等模型实现语音识别、翻译和语音合成。Violin 还包含基于视频内容的多模态聊天助手,并提供了 Web 应用、CLI 工具和 Agent skill 三种使用方式。所有代码已在 MIT 许可下开源。

5月12日周二
5月11日周一
  1. Together AI73

    Together AI 解析服务 DeepSeek-V4:为何百万 token 上下文是推理系统问题

    DeepSeek-V4 通过压缩 KV 缓存的 token 维度来支持百万 token 上下文,但这将压力转移到了推理系统。模型采用混合注意力设计,包括压缩稀疏注意力、重度压缩注意力和滑动窗口注意力,这要求推理引擎同时管理三种具有不同大小和生命周期的缓存对象。文章基于在 NVIDIA HGX B200 上的早期部署经验,分析了缓存策略、前缀复用和不同工作负载下的性能权衡。

    推荐理由:文章从推理系统角度剖析了 DeepSeek-V4 百万 token 上下文窗口的实现挑战,为开发者评估其实际部署成本提供了具体的技术视角。

  2. Replit 博客21

    Mothers who build

    作者 Haya Odeh 在 Replit 博客中分享了作为母亲与职业女性的双重身份如何影响她的领导方式和工作动力。她指出,母亲身份并未削弱她的能力,反而加深了她对团队和环境的判断力。她强调,全职母亲的工作同样是真实且重要的劳动,不应被低估。

5月9日周六
5月8日周五
  1. Berkeley AI Research35

    自适应并行推理:高效推理扩展的下一个范式

    自适应并行推理让推理模型能自行决定何时分解并并行化独立子任务、生成多少并发线程以及如何协调它们。这种方法旨在解决顺序推理因探索路径线性增长而导致的延迟增加、计算密集和上下文窗口受限问题。研究分析了从固定并行到自适应控制的各种方法,指出让模型根据问题自适应决策是提升并行化效果的关键。

  2. Replit 博客25

    Security Center 2.0:批量处理所有应用中的安全漏洞

    Replit 推出 Security Center 2.0,支持批量识别和处理所有项目中的关键和高严重性漏洞,优先查看已发布且公开的项目数量。用户可从首页或设置进入,通过依赖项扫描生成软件物料清单(SBOM)。企业用户可通过“Run Scan”获取 SBOM,用于安全与合规团队评估新披露的 CVE 影响。

5月7日周四
  1. OpenAI Alignment48

    OpenAI 探究在 RL 训练中意外对 CoT 进行评分的后果

    OpenAI 发现部分已发布的 GPT 模型在 RL 训练中意外接受了 CoT 评分,包括 GPT-5.4 Thinking、GPT-5.1 Instant 至 GPT-5.4 Instant、GPT-5.3 mini 和 GPT-5.4 mini。分析显示这些情况未造成 CoT 可监控性显著下降,但存在潜在风险。为防止类似问题,OpenAI 已修复相关奖励路径并加强内部流程与检测系统。

5月6日周三
  1. Weaviate 博客40

    Your LLM Is Only as Good as What It Retrieves

    检索质量是影响大语言模型输出可靠性的关键因素,当检索失败时,模型会生成看似合理但缺乏事实依据的内容。研究发现,在 HaluEval、TruthfulQA 和 FaithDial 等基准测试中,检索层问题始终是幻觉产生的主要来源。五种常见的检索失败模式包括检索漂移、上下文截断、过时索引污染、低相关性 top-k 检索和智能体间误通信,这些问题在多智能体系统中尤为隐蔽且难以检测。

5月5日周二
5月4日周一
5月1日周五
  1. ARC Prize59

    ARC-AGI-3 分析 GPT-5.5 与 Opus 4.7 的推理失败模式

    ARC-AGI-3 通过 135 个新颖环境测试模型的抽象推理能力,分析了 GPT-5.5 和 Opus 4.7 的 160 个推理回放,发现三种主要失败模式:局部效应无法转化为全局世界模型、错误抽象映射至训练数据中的游戏、解决单关但未学习游戏机制。

    推荐理由:原文通过分析 GPT-5.5 和 Opus 4.7 在 ARC-AGI-3 上的推理轨迹,揭示了模型在抽象推理和世界模型构建中的具体失败模式,可为模型设计提供可迁移的诊断思路。