跳到正文
9月30日周三
  1. KDnuggets30

    Ollama 用于管理本地语言模型:KDnuggets 快速参考指南

    Ollama 提供了一条命令即可运行本地语言模型,并通过 HTTP 服务器提供 OpenAI 风格的端点。摘要显示,模型是否适合当前硬件内存是关键问题,且上下文长度可能与预期不符。此外,Ollama 支持通过 JSON schema 约束结构化输出,并兼容 OpenAI 的 /v1 接口,方便客户端切换至本地运行。

  2. O'Reilly Radar38

    评估 AI 生成的前端代码:我们实际上应该测试什么?

    评估 AI 生成的前端代码时,应优先检查其结构是否合理,例如是否使用了原生 HTML 元素而非通用容器,并确保 ARIA 属性正确应用。还需验证键盘导航路径是否顺畅,包括能否通过键盘操作控件、对话框的焦点是否正确转移。测试错误、加载和空状态的处理也是关键,以确保用户在非理想情况下仍能理解界面行为。

  3. KDnuggets40

    如何用 AI 将 Excel 数据转化为 PowerPoint 演示文稿

    Julius 的 AI 演示文稿生成工具可将 Excel 或 CSV 数据转换为可编辑的 PowerPoint。先明确演示需回答的问题,检查数据并确认关键指标,再生成包含图表和核心结论的幻灯片。示例中展示了如何通过对比两个季度的收入和广告支出,计算出各渠道变化及广告投入产出比,确保内容基于验证后的数据,不添加未提及的假设或成本。

  4. AWS · AI 博客28

    Amazon Quick 提示工程基础:提升 AI 功能响应准确性的关键原则

    Amazon Quick 的提示工程决定了其 AI 功能对自然语言请求的响应准确性和可靠性。本文介绍了适用于所有 Quick 功能的核心原则和结构化框架,包括通过具体性提升清晰度、利用上下文增强相关性、用示例替代抽象描述等方法。CRISPE 框架提供了一种通用的复杂请求结构,涵盖上下文约束、角色责任、意图输入和步骤范围等要素。

  5. Replit 博客77

    Replit Agent 发布支持模型自主决策的新功能

    Replit Agent 发布新功能,允许 GPT-6 Astra 等模型在任务执行中自主决定子代理层级、努力程度和复用策略,实现动态 delegation。在 DeepSWE 和 Terminal-Bench 基准上,该架构在成本与性能上均优于 Astra 单独运行及侧边工架构,且无需修改提示或框架。

    推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。

9月29日周二
  1. Cloudflare · AI31

    Cloudflare 如何利用 AI 规划后量子迁移路线

    Cloudflare 正在开发名为 CryptoLabe 的内部 AI 工具,以推动其平台在 2029 年前实现全面的后量子就绪。该工具通过两阶段扫描,在代码库中发现并理解加密技术的使用情况,并生成迁移进度指标。CryptoLabe 高度定制于 Cloudflare 的内部系统,公司分享了相关经验以帮助其他组织进行后量子迁移。

9月28日周一
  1. LangChain 博客62

    LangChain发布Jev与LangGraph协同构建生产级智能体

    LangChain联合TypeSafe AI发布Jev决策模型,与LangGraph协同构建生产级智能体。Jev在结构化决策任务上比主流LLM快200倍、便宜400倍,支持并行、可预测、自一致的判断输出。

    推荐理由:原文给出了Jev与LangGraph结合使用的方法和性能对比,读者可据此评估其在生产系统中的部署价值。

  2. InfoQ · AI/ML39

    Forter 演讲:如何在两周内将 200 名团队成员转变为 AI 智能体构建者

    Forter 的 AI 工程团队通过为期两周的冲刺黑客松,成功让约 200 名研发人员(包括非技术背景的分析师)亲手构建了自己的 AI 智能体。团队为此创建了一个内部 MCP 服务器作为工具平台,并提供了多种框架选择,以降低构建门槛并帮助参与者建立对 AI 能力的直觉。

9月26日周六
  1. TechCrunch · 融资并购34

    Synthesia 为记者创建可交互数字分身

    视频生成初创公司 Synthesia 为一名记者创建了其专属的可交互数字分身,该分身仅能回答关于其特定报道《为何风投支持的初创公司欺诈更多》的问题。该交互分身结合了语音转文本、视频、语言和文本转语音模型,企业客户还可选择集成 Cartesia、ElevenLabs、Google 或 OpenAI 的模型。

  2. GitHub Blog · AI & ML46

    GitHub Copilot app 新手教程:如何用 canvases 构建自定义工作流

    GitHub Copilot app 的 canvas 功能允许用户通过自然语言描述创建可自定义的共享界面,如看板或仪表盘。用户只需在会话中输入 `/create-canvas` 技能并描述所需工作流,智能体便会自动生成并打开界面。该界面支持双向实时协作,用户和智能体均可直接操作控件更新内容,且创建好的 canvas 可保存为扩展供重复使用。

9月25日周五
  1. Amazon Science36

    Reactor 与 Amazon Neuron Science 团队合作实现 Trainium 上实时视频生成的内核优化路径

    Reactor 与 Amazon Neuron Science 团队合作,通过内核优化策略在 Trainium 上实现世界模型的实时视频生成。他们采用 Rolling Forcing 技术,该技术能以 16 帧每秒的速率生成高质量视频,满足实时播放需求。此次优化结合了世界模型的长序列生成能力与 Trainium 的高性能计算和内存支持,为未来实时视频生成模型提供了基础。

9月24日周四
  1. Machine Learning Mastery48

    AI 智能体与工作流:判断何时需要智能体的实用测试

    文章提出了一个核心测试来区分 AI 工作流与智能体:能否在模型运行前绘制出完整的任务流程图。若能,则构建工作流;若后续步骤取决于执行中的发现,则可能需要智能体。文章还提供了一个包含五个要点的检查清单,用于在构建前根据输入可变性、成本延迟、审计合规等需求做出决策。

  2. NVIDIA · 开发者博客35

    NVIDIA 指南:在 AI 工作负载部署前验证 GPU 集群就绪状态

    NVIDIA 发布指南,强调在 AI 工作负载实际部署前验证 GPU 集群就绪状态的重要性。即使所有 GPU、网络链路和容器都报告健康,一个 512-GPU 的训练任务仍可能因单个慢速 GPU 或链路在负载下性能下降而失败。该指南旨在帮助运维人员提前发现潜在问题,避免任务在运行数小时后才遭遇性能不佳或失败。

9月23日周三
  1. Together AI57

    如何用 17 美元训练自己的 Jev 分类模型

    Together AI 发布教程,指导用户用 Qwen3.5 4B 作为基础模型,通过 38,000 个示例数据集微调出类似 Jev 的分类模型,成本仅 17 美元。教程包含数据集选择、数据标准化、模型训练和部署到 API 端点的完整流程,最终模型可处理客户支持意图识别等分类任务。

    推荐理由:详细展示了如何用 17 美元和 25 分钟训练一个分类模型,包含数据集选择和部署步骤。

  2. LangChain 博客30

    The Reliability Layer for Healthcare AI: Common LangSmith Use Cases

    两家医疗AI组织使用 LangSmith 将临床专家判断转化为可复用的评估资产,以提升系统准确性并减少人工审核负担。他们通过构建标注数据集、校准评估器和自动化发布门禁,使专家意见在多个测试和迭代中持续生效。Abridge 采用参考无关和参考相关的评估方法,分别直接评分和对比特定医学场景的示例,兼顾广泛性和精确性。

9月22日周二
  1. PyTorch 博客69

    Shopify 如何用 PyTorch 和 vLLM 构建持续学习循环

    Shopify 分享了其构建持续学习循环的完整方法,使专用模型在质量上超越前沿模型,同时将服务成本降低 96%。该方法始于定义质量评估标准并校准离线评估器,然后通过自动化研究优化提示和工具定义,再利用生产中的困难案例通过强化学习更新模型权重。

    推荐理由:Shopify 分享了从评估标准定义到模型压缩的完整工程实践,为构建持续学习系统提供了具体路径。

  2. Together AI51

    Together AI 推出生产环境模型滚动升级方案

    Together AI 发布 Canary rollouts 功能,支持在生产环境中无停机升级模型。该功能提供三种升级策略(Canary、Blue-green、Rolling),包含详细的健康检查机制和回滚方案。用户可通过 CLI、REST API 或 Python SDK 控制升级流程,系统会确保容量充足且流量只导向已就绪的副本。

  3. PyTorch 博客55

    TinyTorch:一个纯 Python 教学框架,让你从零构建 PyTorch

    TinyTorch 是一个免费开源的纯 Python 教学框架,旨在让学生从零开始构建一个可工作的 ML 框架,涵盖从张量到 Transformer 的 20 个模块。它完全复刻 PyTorch API,无需 GPU,在仅 4 GB 内存的笔记本电脑上即可运行。该项目源于哈佛大学的课程,现已发展为包含自动评分、里程碑验证和社区地图的完整教学体系,并被全球多所大学采用。

    推荐理由:文章详细拆解了 TinyTorch 作为教学框架的设计哲学和模块结构,为教育者和自学者提供了清晰的实施蓝图。

9月19日周六
9月18日周五
  1. Hamel Husain27

    AI Evals:一切你需要知道的

    AI Evals 是用于测试 AI 系统是否符合预期目标的评估方法,能帮助团队发现产品偏离用户需求或业务目标的问题,并提供改进数据。常见评估基准包括 GPQA Diamond、Terminal-Bench 和 MMLU,用于衡量模型在科学推理、命令行任务和多领域知识上的表现。评估设计建议使用二元(通过/失败)评分而非 1-5 分评分,并需注意评估工具的选择与标注流程的优化。

  2. fal 博客63

    fal 平台详解 H3 Max 视频模型的训练、部署与分发全流程

    fal 平台发布文章,详细介绍了视频生成模型 H3 Max 如何在其平台上完成从训练、部署到分发的全生命周期。H3 Max 在 fal Compute 上进行后训练,以在保持质量的同时最小化推理时间。

    推荐理由:原文详细拆解了从模型训练优化到大规模部署的完整技术栈,展示了如何通过基础设施设计同时降低推理延迟和端到端延迟。

  3. LangChain 博客42

    Included Health 如何用 LangGraph 和 Deep Agents 构建联邦医疗智能体

    Included Health 通过 LangGraph 和 Deep Agents 构建了一个联邦医疗智能体架构,用于其 AI 驱动的医疗导航平台 Dot。该架构允许智能体在不同子流程间保持语气和行为一致性,并通过共享文件系统传递上下文信息,避免用户重复说明。Deep Agents 还支持将临床能力封装为技能,供各智能体按需调用,提升对话的自然度和导航效率。

9月17日周四
  1. GitHub Blog · AI & ML70

    GitHub Copilot 运行时使用 Copilot 自身重写为 Rust

    GitHub Copilot 团队使用 GitHub Copilot 应用和 CLI,将 Copilot 智能体运行时从 TypeScript 完全重写为超过 80 万行生产级 Rust 代码。该项目主要由一名开发者在几个月内完成,性能提升了数个数量级,并支持通过 C ABI 进行进程内嵌入,为所有六种 SDK 语言版本提供了更优的性能和资源使用方案。

    推荐理由:原文详细记录了用 AI 辅助将核心运行时从 TypeScript 重写为 Rust 的完整过程、技术决策和量化结果,为大规模工程迁移提供了具体参考。

  2. NVIDIA · 开发者博客38

    NVIDIA cuTile Rust 如何利用智能体 AI 将 CUDA Tile 操作从 Python 翻译到 Rust

    NVIDIA 的 cuTile Rust 库借助智能体 AI 工具,可将基于 CUDA Tile 的 GPU 内核操作从 Python 自动翻译为 Rust 代码。该库将 Rust 的所有权模型扩展至基于 tile 的 GPU 内核,将可变输出拆分为互不相交的部分,并在内核启动间保持主机端的所有权契约。程序员在需要底层控制时,也可选择局部退出此安全模型。