跳到正文
10月1日周四
  1. InfoQ · AI/ML20

    InfoQ 在线认证课程聚焦 AI 安全与编码智能体验证

    InfoQ 将于 2026 年 10 月开设两个为期五周的在线认证课程。AI 安全与隐私工程课程从 10 月 26 日开始,探讨如何保护 AI 产品中的敏感数据并测试安全控制措施;AI 辅助工程课程从 10 月 19 日开始,重点关注围绕编码智能体修改现有代码库的检查机制。参与者将在导师和跨组织同行的支持下,应用威胁建模、红队测试以及构建上下文与权限限制等方法解决实际工作问题。

9月30日周三
  1. AWS · AI 博客27

    Amazon Bedrock Knowledge Bases 如何用自然语言查询理赔信息

    Amazon Bedrock Knowledge Bases 提供了一种通过自然语言查询理赔文档并返回带引用答案的解决方案。该方案使用 AgenticRetrieveStream API 从 PDF、Word 和文本笔记中检索信息,并通过上下文对齐检查确保答案基于最新记录。应用可实时显示答案和引用来源,适用于处理理赔状态查询、多轮对话和元数据过滤等场景。

  2. PyTorch 博客41

    Torch Spyre 如何通过 PyTorch CRCR 实现上游变更与下游信心的集成

    Torch Spyre 基于 PyTorch 跨仓库 CI 中继(CRCR)实现了 L2 级集成,通过智能体流程从代码和执行证据中筛选并重组测试,并使用声明式 YAML 框架在不修改上游测试的情况下适配它们。这套方法旨在为任何通用的 privateuse1 设备提供可扩展的测试解决方案,并计划与 PyTorch 社区合作,将可复用部分上游化。

  3. KDnuggets30

    Ollama 用于管理本地语言模型:KDnuggets 快速参考指南

    Ollama 提供了一条命令即可运行本地语言模型,并通过 HTTP 服务器提供 OpenAI 风格的端点。摘要显示,模型是否适合当前硬件内存是关键问题,且上下文长度可能与预期不符。此外,Ollama 支持通过 JSON schema 约束结构化输出,并兼容 OpenAI 的 /v1 接口,方便客户端切换至本地运行。

  4. O'Reilly Radar38

    评估 AI 生成的前端代码:我们实际上应该测试什么?

    评估 AI 生成的前端代码时,应优先检查其结构是否合理,例如是否使用了原生 HTML 元素而非通用容器,并确保 ARIA 属性正确应用。还需验证键盘导航路径是否顺畅,包括能否通过键盘操作控件、对话框的焦点是否正确转移。测试错误、加载和空状态的处理也是关键,以确保用户在非理想情况下仍能理解界面行为。

  5. Hamel Husain37

    Claude 的新自动评估工具发布

    Anthropic 为 Claude Code 推出新的自动评估工具,包含 build_eval 和 hill-climb 命令,用于构建评估、检查评分器并优化应用。该工具在未充分分析数据的情况下直接建议创建评估,且评估范围过于宽泛,同时缺乏清晰的判断依据。尽管其能发现其他方法难以识别的问题,但作者认为应优先通过数据探索理解问题,并希望未来工具能更注重数据理解与判断的可审查性。

  6. KDnuggets40

    如何用 AI 将 Excel 数据转化为 PowerPoint 演示文稿

    Julius 的 AI 演示文稿生成工具可将 Excel 或 CSV 数据转换为可编辑的 PowerPoint。先明确演示需回答的问题,检查数据并确认关键指标,再生成包含图表和核心结论的幻灯片。示例中展示了如何通过对比两个季度的收入和广告支出,计算出各渠道变化及广告投入产出比,确保内容基于验证后的数据,不添加未提及的假设或成本。

  7. AWS · AI 博客28

    Amazon Quick 提示工程基础:提升 AI 功能响应准确性的关键原则

    Amazon Quick 的提示工程决定了其 AI 功能对自然语言请求的响应准确性和可靠性。本文介绍了适用于所有 Quick 功能的核心原则和结构化框架,包括通过具体性提升清晰度、利用上下文增强相关性、用示例替代抽象描述等方法。CRISPE 框架提供了一种通用的复杂请求结构,涵盖上下文约束、角色责任、意图输入和步骤范围等要素。

  8. Replit 博客77

    Replit Agent 发布支持模型自主决策的新功能

    Replit Agent 发布新功能,允许 GPT-6 Astra 等模型在任务执行中自主决定子代理层级、努力程度和复用策略,实现动态 delegation。在 DeepSWE 和 Terminal-Bench 基准上,该架构在成本与性能上均优于 Astra 单独运行及侧边工架构,且无需修改提示或框架。

    推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。

9月29日周二
  1. Cloudflare · AI31

    Cloudflare 如何利用 AI 规划后量子迁移路线

    Cloudflare 正在开发名为 CryptoLabe 的内部 AI 工具,以推动其平台在 2029 年前实现全面的后量子就绪。该工具通过两阶段扫描,在代码库中发现并理解加密技术的使用情况,并生成迁移进度指标。CryptoLabe 高度定制于 Cloudflare 的内部系统,公司分享了相关经验以帮助其他组织进行后量子迁移。

  2. Machine Learning Mastery62

    使用 Llama 3.2 和 Ollama 自动化构建知识图谱

    本文介绍如何使用本地运行的 Llama 3.2 模型通过 Ollama 从维基百科文本中提取实体和三元组,并生成包含上下文的 SPOC 四元组,最终将结果加载至 QuadStore 知识图数据库。文中提供了完整代码实现,涵盖环境配置、文本获取、LLM 提取和图谱存储全流程,适用于 Graph-RAG 系统的知识注入。

    推荐理由:原文提供了从文本提取结构化知识到构建知识图谱的完整流程,读者可直接复用代码实现自动化知识图谱构建。

9月28日周一
  1. Import AI46

    Import AI 474:柏拉图式心智空间;太空中的 TPU;智谱启动外部 RSI 循环

    科学家 Michael Levin 提出,心智可能是来自柏拉图式空间的模式,通过生物体或机器等物理接口在现实世界具现。他认为,无论是生物化学生命还是算法机器,都是指向这些非物理模式的接口,能够展现出超越其物理或算法实现本身的特性。这项研究为理解 AI 系统与人类心智的哲学关系及对齐问题提供了新的视角。

  2. LangChain 博客62

    LangChain发布Jev与LangGraph协同构建生产级智能体

    LangChain联合TypeSafe AI发布Jev决策模型,与LangGraph协同构建生产级智能体。Jev在结构化决策任务上比主流LLM快200倍、便宜400倍,支持并行、可预测、自一致的判断输出。

    推荐理由:原文给出了Jev与LangGraph结合使用的方法和性能对比,读者可据此评估其在生产系统中的部署价值。

  3. InfoQ · AI/ML39

    Forter 演讲:如何在两周内将 200 名团队成员转变为 AI 智能体构建者

    Forter 的 AI 工程团队通过为期两周的冲刺黑客松,成功让约 200 名研发人员(包括非技术背景的分析师)亲手构建了自己的 AI 智能体。团队为此创建了一个内部 MCP 服务器作为工具平台,并提供了多种框架选择,以降低构建门槛并帮助参与者建立对 AI 能力的直觉。

9月26日周六
  1. TechCrunch · 融资并购34

    Synthesia 为记者创建可交互数字分身

    视频生成初创公司 Synthesia 为一名记者创建了其专属的可交互数字分身,该分身仅能回答关于其特定报道《为何风投支持的初创公司欺诈更多》的问题。该交互分身结合了语音转文本、视频、语言和文本转语音模型,企业客户还可选择集成 Cartesia、ElevenLabs、Google 或 OpenAI 的模型。

  2. GitHub Blog · AI & ML46

    GitHub Copilot app 新手教程:如何用 canvases 构建自定义工作流

    GitHub Copilot app 的 canvas 功能允许用户通过自然语言描述创建可自定义的共享界面,如看板或仪表盘。用户只需在会话中输入 `/create-canvas` 技能并描述所需工作流,智能体便会自动生成并打开界面。该界面支持双向实时协作,用户和智能体均可直接操作控件更新内容,且创建好的 canvas 可保存为扩展供重复使用。

9月25日周五
  1. Amazon Science36

    Reactor 与 Amazon Neuron Science 团队合作实现 Trainium 上实时视频生成的内核优化路径

    Reactor 与 Amazon Neuron Science 团队合作,通过内核优化策略在 Trainium 上实现世界模型的实时视频生成。他们采用 Rolling Forcing 技术,该技术能以 16 帧每秒的速率生成高质量视频,满足实时播放需求。此次优化结合了世界模型的长序列生成能力与 Trainium 的高性能计算和内存支持,为未来实时视频生成模型提供了基础。

9月24日周四
  1. Machine Learning Mastery48

    AI 智能体与工作流:判断何时需要智能体的实用测试

    文章提出了一个核心测试来区分 AI 工作流与智能体:能否在模型运行前绘制出完整的任务流程图。若能,则构建工作流;若后续步骤取决于执行中的发现,则可能需要智能体。文章还提供了一个包含五个要点的检查清单,用于在构建前根据输入可变性、成本延迟、审计合规等需求做出决策。

  2. NVIDIA · 开发者博客35

    NVIDIA 指南:在 AI 工作负载部署前验证 GPU 集群就绪状态

    NVIDIA 发布指南,强调在 AI 工作负载实际部署前验证 GPU 集群就绪状态的重要性。即使所有 GPU、网络链路和容器都报告健康,一个 512-GPU 的训练任务仍可能因单个慢速 GPU 或链路在负载下性能下降而失败。该指南旨在帮助运维人员提前发现潜在问题,避免任务在运行数小时后才遭遇性能不佳或失败。

9月23日周三
  1. Neo4j 博客29

    审计 AWS 基础设施时,资源清单无法回答的问题

    本文探讨了使用 Neo4j 建立图模型以回答 AWS 基础设施审计中资源清单无法处理的问题,如账户间可达性与隔离性。AWS Config 提供了配置数据和关系块,可用于构建包含 12 种节点类型和特定关系类型的图。该图模型通过区分节点类型和关系标签,帮助智能体每日重新推导合规性结论。

  2. Together AI57

    如何用 17 美元训练自己的 Jev 分类模型

    Together AI 发布教程,指导用户用 Qwen3.5 4B 作为基础模型,通过 38,000 个示例数据集微调出类似 Jev 的分类模型,成本仅 17 美元。教程包含数据集选择、数据标准化、模型训练和部署到 API 端点的完整流程,最终模型可处理客户支持意图识别等分类任务。

    推荐理由:详细展示了如何用 17 美元和 25 分钟训练一个分类模型,包含数据集选择和部署步骤。

  3. LangChain 博客30

    The Reliability Layer for Healthcare AI: Common LangSmith Use Cases

    两家医疗AI组织使用 LangSmith 将临床专家判断转化为可复用的评估资产,以提升系统准确性并减少人工审核负担。他们通过构建标注数据集、校准评估器和自动化发布门禁,使专家意见在多个测试和迭代中持续生效。Abridge 采用参考无关和参考相关的评估方法,分别直接评分和对比特定医学场景的示例,兼顾广泛性和精确性。

9月22日周二
  1. PyTorch 博客69

    Shopify 如何用 PyTorch 和 vLLM 构建持续学习循环

    Shopify 分享了其构建持续学习循环的完整方法,使专用模型在质量上超越前沿模型,同时将服务成本降低 96%。该方法始于定义质量评估标准并校准离线评估器,然后通过自动化研究优化提示和工具定义,再利用生产中的困难案例通过强化学习更新模型权重。

    推荐理由:Shopify 分享了从评估标准定义到模型压缩的完整工程实践,为构建持续学习系统提供了具体路径。