跳到正文
8月27日周四
  1. LangChain 博客29

    LangSmith 和 LangChain OSS 如何帮助你满足欧盟 AI 法规要求

    LangSmith 和 LangChain OSS 提供工具帮助满足欧盟 AI 法规对高风险 AI 系统的要求,包括完整执行追踪、自动事件日志、透明决策和人类监督机制。其支持端到端追踪、自定义评估器和人类干预路径,适用于金融、医疗等关键领域。产品提供自托管、BYOC 和云端部署选项,确保数据合规存储与访问。

  2. LangChain 博客48

    LangSmith 推出自我优化的 LLM-as-a-Judge 评估系统

    LangSmith 推出自我优化的 LLM-as-a-Judge 评估系统,通过存储人类对评估结果的修正作为少样本示例,使评估器在后续迭代中自动适应。该系统减少对提示工程的依赖,适用于检测 RAG 幻觉、答案正确性及毒性内容等场景。用户可免费注册 LangSmith 尝试该功能,评估器支持在线和离线模式,配置简便且能随时间改进。

  3. LangChain 博客52

    LangChain 重构聊天机器人并上线新功能

    LangChain 重构了 chat.langchain.com 聊天机器人,采用 createAgent 和 Deep Agent 两种架构,分别用于快速文档问答和深度代码分析。新系统通过直接调用文档、知识库和代码库的 API,实现精准引用和上下文优化,支持多模型切换与实时流式响应,已在生产环境上线。

  4. Neo4j 博客21

    Neo4j Aura 初创公司开发指南

    Neo4j Aura 提供了初创公司构建图应用的完整指南,包括安装工具、实例配置和常见错误避免。使用 neo4j-cli 安装所有技能并开启自动刷新,确保技能与 Neo4j 功能同步更新。通过 GraphRAG、MCP 服务器、GDS 和 Agent Memory 等工具,可逐步构建图应用并优化性能。

8月26日周三
  1. LangChain 博客61

    Candidly 在 LangSmith 中构建状态感知智能体的实践

    Candidly 基于 LangSmith 构建了状态感知智能体,通过分析对话轨迹中的用户行为与代理响应特征,训练出一个输入-输出隐马尔可夫模型,实现对对话状态的实时推断,并据此动态调整响应策略,提升任务完成率。该方法将评估信号转化为控制信号,适用于多轮交互场景中的实时干预。

    推荐理由:原文详细展示了如何将对话分析转化为可实时干预的策略,为构建状态感知型智能体提供了可复用的方法论。

  2. LangChain 博客63

    LangChain 与 You.com 联合发布金融研究智能体框架

    LangChain 与 You.com 联合发布基于 Deep Agents 和 Finance Research API 的金融研究智能体框架,支持对欧盟27国2025年GDP数据进行自动化分析,实现异常检测、行业归因与可审计报告生成,完整执行过程通过 LangSmith 可视化追踪,提供可复现、可验证的AI研究工作流。

    推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。

  3. LangChain 博客36

    LangChain 展示如何通过智能体 AI 实现金融服务的 ROI

    LangChain 与 Pay-i 联合展示如何通过智能体 AI 在金融服务中证明投资回报,重点分析 RFP 处理和 AML 合规监控两个用例。LangSmith 提供智能体执行的全链路追踪,包括模型调用、工具调用和成本计算,而 Pay-i 将智能体成本与可衡量的业务成果关联,定义并跟踪如需求提取准确率(目标 95%)和响应草案无需重大修改率(目标 65%)等关键 KPI。

  4. LangChain 博客56

    Harmonic 用 Deep Agents 重构 Scout 实现 4 倍留存

    Harmonic 用 Deep Agents 重构其 AI 产品 Scout,将产品迭代周期从月级缩短至天级,通过单个前沿模型与工具集成实现开放任务处理,支持跨数据层与企业上下文的多步推理。

    推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。

  5. LangChain 博客60

    LangSmith Engine 发布用于改进智能体的自动化工具

    LangSmith Engine 发布,是一个运行在代理追踪数据之上的智能体,可识别重复失败模式、生成可操作问题、提出评估器和数据集示例,并支持与代码库连接以推动修复。该工具通过轨迹压缩、分阶段筛查和专用子代理架构,实现对大规模追踪数据的高效分析,已在 LangChain 内部投入使用。

    推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。

  6. Neo4j 博客17

    Understanding GraphSAGE

    GraphSAGE 是一种归纳式嵌入模型,通过采样节点邻居、聚合邻居特征并结合自身特征生成嵌入向量。其核心公式为 embedding = activation(W * AVG[own_feature, neighbor_summary] + b),其中 W 和 b 是模型在训练过程中学习的参数。该方法支持监督和非监督学习模式,可用于预测节点属性或仅基于图结构进行训练。

  7. Google · AI Blog19

    Google Search 升级家居装饰的 5 种方法

    Google Search 通过 AI Mode、Lens、Circle to Search、Search Live 及比价工具帮助用户实现家居装饰灵感。用户可上传房间照片让 AI 推荐并可视化沙发等家具,使用 Lens 识别复古物品并找到类似商品,或通过 Circle to Search 从视频和社交内容中追踪心仪装饰。这些工具旨在辅助从灵感获取到 DIY 安装及比价的全过程。

8月25日周二
  1. The Pragmatic Engineer65

    Ramp 构建内部智能体 Inspect 的实践与架构

    Ramp 开发了名为 Inspect 的内部智能体,用于在远程沙箱环境中执行编码、调试、代码审查等任务。该系统基于 Cloudflare Durable Objects 和 Modal 沙箱,支持快速启动(<5秒)和跨功能协作,已覆盖75%的合并PR。Inspect 通过集成内部数据源与工具链,实现对前后端变更的自动验证,并作为平台支撑超过200个上层智能体,如自动修复、监控告警和数据分析代理。

    推荐理由:原文详细展示了内部智能体 Inspect 的构建逻辑与实际应用场景,读者可借鉴其架构设计与落地路径。

8月22日周六
8月21日周五
8月17日周一
8月15日周六
  1. Ahead of AI33

    Building an AI Text Detector From Scratch(从零构建 AI 文本检测器)

    本文展示如何从零构建一个 AI 文本检测器,该检测器可返回 0-100 的文本生成概率评分,并能高亮文本片段的检测结果。项目基于类似 Pangram 模型的方法,使用 DistilBERT 进行微调,旨在说明检测器的工作原理并作为 LLM 评分模型的案例研究。检测器可用于过滤垃圾内容,但也可能误判人类写作,需持续更新以应对 AI 生成文本的演变。

8月14日周五
8月13日周四
  1. Weaviate 博客28

    Building Foundry 第二部分:创意工作流为何失效

    创意团队在项目扩展过程中常因命名不一致、标签质量参差和关键词搜索不匹配导致检索失效。文件夹结构难以适应多团队协作,标签依赖流程纪律而受截止日期影响,关键词搜索常因描述与存储内容用词不一致而无法命中。现代系统需结合语义相似性、关键词匹配和元数据过滤,以应对不完美命名和不完整标签,Weaviate 可作为实现这一目标的示例。

8月12日周三
  1. Hamel Husain7

    AI Product Engineering Notes

    Hamel Husain 分享了构建 AI 产品的工程实践笔记,涵盖模型评估、推理优化、工具使用等主题。文章列举了他近期发布的多篇长文,包括关于 Claude 自动评估工具、LLM 评估方法、vLLM 与大模型结合等内容。部分文章提供开源工具如 inspect AI 和 nbsanity,可用于 AI 产品开发与调试。

8月11日周二
  1. Neo4j 博客29

    Aura Graph Analytics 如何从首个图算法实验到生产环境

    Aura Graph Analytics 提供了一种无需深入算法知识即可快速验证图分析价值的方法,通过直观界面和代码方式运行算法。用户可使用内置 AI 助手或 Claude、Gemini 等 LLM 描述数据结构,获取适合的图算法建议。数据可通过 pandas 或 Apache Spark 导入 AGA,支持生成可运行代码并直接在图中可视化结果。

8月10日周一
  1. Weights & Biases42

    当轴对齐框失效:CVPR 发表的交通 AI 教训

    CVPR 发表的交通 AI 案例研究展示了将表示作为设计决策而非既定条件的处理方式,并提供了代码和日志作为证明。该研究指出轴对齐框在复杂场景中可能失效,提出改进方法以提升目标检测准确性。模型代码已开源,适用于计算机视觉研究与实际交通监控系统优化。

8月6日周四
8月5日周三
  1. Neo4j 博客40

    什么是上下文图(Context Graph)?

    上下文图是一种持久化记忆系统,用于帮助 AI 智能体在长期企业知识、短期对话历史和推理记忆之间建立连接。它通过存储组织知识、交互过程、工具返回的证据及决策依据,使智能体能基于完整上下文进行推理、生成准确答案并解释决策。上下文图包含长期记忆、短期记忆和推理记忆三层,支持多智能体系统共享对话状态,降低 token 成本,提升可解释性和治理能力。

8月4日周二
  1. Neo4j 博客57

    Neo4j 发布支持多智能体系统的常量成本语义记忆工具

    Neo4j 发布 Semvec 及 Semvec Cortex 工具,通过在 Neo4j 图数据库中持久化语义记忆,实现单智能体与多智能体系统的常量 token 成本记忆机制。该工具支持跨会话、跨团队、跨班次的共享记忆、漂移检测、共识投票与行为一致性验证,所有功能通过 Python API 在本地运行,无需外部服务或网络调用。

    推荐理由:原文提供了可直接复用的代码实现和架构设计,读者可据此构建具有持久语义记忆的多智能体系统。

8月1日周六
  1. Together AI72

    月之暗面发布 Kimi K3:2.8万亿参数开源模型,支持1M上下文与多模态

    月之暗面发布 Kimi K3,2.8万亿参数开源模型,为首个3万亿参数级开源模型,支持1M上下文、多模态输入和动态工具加载。Together AI 提供 API 接入,支持 OpenAI 兼容调用,推理深度可调,定价按 token 计费,缓存命中输入价为每百万 token 0.30 美元。模型在 DeepSWE、BrowseComp 等基准上表现领先,支持结构化输出、流式响应和保留思考历史。

    推荐理由:原文提供了模型参数、架构创新、API 使用方式和定价,读者可据此判断其在长上下文、推理和多模态任务中的实际部署潜力。

7月30日周四
  1. Weaviate 博客26

    Weaviate 如何通过语义搜索减少创意工作中的摩擦

    Weaviate 通过语义搜索技术帮助创意团队更高效地检索已有作品,解决文件命名混乱和组织低效的问题。该技术利用机器学习将媒体内容转化为向量嵌入,使相似含义的文件在高维空间中更易被找到。语义搜索可与传统元数据结合,提升创意资产的可检索性与组织效率。

7月29日周三
  1. Weights & Biases41

    Weave 在本地运行仅需三条命令

    Weave 可在本地通过三条命令运行,无需依赖云端服务。该工具支持在本地环境中进行模型训练和实验追踪,适用于需要隐私或低延迟的场景。Weights & Biases 提供了完整的本地部署方案,用户可直接使用其 API 和 CLI 进行操作。

  2. Weights & Biases48

    教程:用 W&B Weave 评估 GPT-5.6、GPT-5.5 和 GLM-5.2 在仓库级编码任务中的表现

    本教程使用 W&B Weave 测量了 GPT-5.6、GPT-5.5 和 GLM-5.2 在仓库级编码任务中的隐藏测试通过率、可靠性、延迟和预估成本。测试结果显示 GPT-5.6 在隐藏测试通过率上优于 GPT-5.5 和 GLM-5.2,且推理延迟降低了 25%。模型的性能差异对开发者选择适合的编码辅助工具具有参考价值。

7月24日周五
7月23日周四
  1. Vector Institute54

    Vector Institute 发布多模态混合专家模型研究论文

    Vector Institute 发布关于多模态混合专家(MoE)模型的研究论文,系统分析了从稀疏路由到多模态部署的架构原理与训练挑战,实证揭示了模型在早期层按模态路由、深层按语义路由的结构演化规律,并提出通过QLoRA、Flash Attention 2与lm_head预钩子实现35.26B参数模型在四张A100 GPU上的可训练性,同时指出专家并行是长期可行方向。

    推荐理由:原文通过实证分析揭示了多模态MoE模型在路由机制与训练实践中的关键规律,为后续优化提供了可复用的方法论。

7月21日周二
  1. Weaviate 博客34

    Query Profiling: See Where a Slow Query Spends Its Time

    Weaviate 推出查询分析功能,允许用户通过启用 per-query 标志直接获取单个查询在集群中各节点的耗时分布。该功能在 v1.36.9 引入,v1.38 正式可用,通过 response.query_profile 返回结果,覆盖向量搜索、关键词评分和过滤评估。启用时仅增加微秒级计时开销,适用于调试和优化,而非生产高并发路径。

  2. Neo4j 博客30

    AI 智能体如何做决策及如何改进

    AI 智能体通过理解目标、收集上下文、决定下一步、执行和学习的循环流程进行决策,但若上下文不完整或断裂,可能导致错误操作。构建上下文图谱可为智能体提供连贯的记忆,使其决策更可靠、可解释并可改进。上下文图谱能记录决策过程和结果,帮助智能体从历史经验中学习,避免重复错误。