跳到正文
9月22日周二
9月21日周一
9月18日周五
  1. GitHub Blog · AI & ML26

    GitHub Podcast 探讨 AI 开发中的热门观点:代码审查、RAG、Skills 与 MCP

    GitHub Podcast 最新一期探讨了关于 AI 辅助开发的几个常见热门观点。节目指出,开发者仍需审查 AI 生成的代码,但应根据风险调整审查深度;RAG 并未过时,它通过提供模型训练数据外的相关信息来提升回答质量;Skills 和 MCP 解决不同问题,前者是打包的专业知识,后者是连接工具与数据的标准协议,可在同一工作流中共存。

  2. Vercel 博客28

    GLM 5.3 FlashX 现已上线 AI Gateway

    GLM 5.3 FlashX 现已通过 AI Gateway 提供服务,支持以约 200 tokens 每秒的速度进行推理,适用于代码智能体、工具循环和交互式应用。该模型可通过 API 格式调用,并支持自定义报告、API 密钥预算、路由规则等功能。AI Gateway 不加价反映模型提供方定价,且不收取平台费用,包括 Bring Your Own Key 请求。

9月9日周三
  1. Mistral AI48

    Mistral AI 如何用智能体现代化复杂遗留代码

    Mistral AI 帮助一家欧洲能源运营商将 40,000 行 Fortran 77 代码迁移至 C++,并重构了物理密集型的油藏模拟器架构。项目首先构建了数值对等性验证框架,确保新旧代码输出一致,并利用上百个 AI 智能体自动解析代码调用树、整合分散文档。通过采用“规划-编码-测试-评审”的多智能体工作流与人机协同检查点,最终在保障代码质量的同时完成了现代化重构。

  2. IEEE Spectrum · AI61

    AI生成代码激增推动代码审查模式变革

    AI编码工具使代码生成速度大幅提升,但随之而来的是审查负担加重。调查显示,42%的代码由AI生成,96%开发者不完全信任其输出。企业正通过前置规划、AI代理初审、人类最终把关及要求开发者解释设计逻辑等方式重构审查流程。

    推荐理由:原文揭示了AI生成代码带来的审查压力变化,以及企业如何通过流程重构应对可靠性挑战。

9月3日周四
9月2日周三
  1. Google · Gemini 博客73

    Google 发布 Gemini 3.8 Flash 和 3.8 Flash Cyber

    Google 发布 Gemini 3.8 Flash 和 3.8 Flash Cyber 两款新模型,前者在编码与智能体任务中性能显著提升,后者在漏洞检测与自动修复方面达到前沿水平,均以 Flash 级别的速度和成本提供,其中 3.8 Flash Cyber 通过 Fairwind 程序向受信任的防御方开放。

    推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。

8月26日周三
8月25日周二
  1. The Pragmatic Engineer65

    Ramp 构建内部智能体 Inspect 的实践与架构

    Ramp 开发了名为 Inspect 的内部智能体,用于在远程沙箱环境中执行编码、调试、代码审查等任务。该系统基于 Cloudflare Durable Objects 和 Modal 沙箱,支持快速启动(<5秒)和跨功能协作,已覆盖75%的合并PR。Inspect 通过集成内部数据源与工具链,实现对前后端变更的自动验证,并作为平台支撑超过200个上层智能体,如自动修复、监控告警和数据分析代理。

    推荐理由:原文详细展示了内部智能体 Inspect 的构建逻辑与实际应用场景,读者可借鉴其架构设计与落地路径。

8月24日周一
  1. IEEE Spectrum · AI26

    What It Takes to Be an Adaptable Engineer 的中文标题

    工程师需要具备适应能力以应对 AI 带来的技术变革,但教育和职场培训往往未明确解释其含义。亚利桑那州立大学教授 Samantha Brunhaver 指出,适应性意味着识别变化并有效应对,且在不同行业中表现形式各异。微软研究员 Jenna Butler 表示,软件工程师正面临代码审查增加等挑战,需学习新工具和智能体管理以保持竞争力。

8月21日周五
  1. Together AI65

    GLM-5.3 与 GPT-5.6 Sol 在 DeepSWE 上的成本、编码与路由策略对比

    Together AI 在 113 项 DeepSWE 任务上对比了 GLM-5.3 (max) 与 GPT-5.6 Sol (max)。GPT-5.6 Sol 在单次尝试准确率(pass@1 72.7% vs 69.0%)、可靠性和速度上保持领先,但每次尝试成本($8.37)是 GLM-5.3($3.99)的两倍多。

    推荐理由:原文通过详尽的基准测试和成本分析,为开发者提供了在不同编程语言和任务类型下选择或组合使用这两个模型的决策依据。

  2. The Pragmatic Engineer30

    The Pulse:我们需要讨论用 AI 进行框架迁移

    The Pulse 报道了 Asana 使用 AI 在两周内完成从 Enzyme 测试框架迁移的案例,AI 显著加速了大规模测试用例重写工作。Airbnb 和 Uber 也有类似经历,表明 AI 在框架迁移中具有显著优势。文章还提到 GitHub 近期宕机事件、Slack 推出 Slack Code、Claude 生成文本将添加水印以及 Uber 开源 SubmitQueue。

8月20日周四
  1. The Register · AI/ML62

    Slack 推出 Slack Code 功能,将 AI 编码智能体引入群聊

    Slack 推出 Slack Code 功能,允许 AI 编码智能体在群聊环境中工作。智能体可以创建专用代码频道,团队成员可实时查看其工作、审查代码变更并指导调整。该功能支持 Anthropic 的 Claude、GitHub Copilot 和 OpenAI 的 ChatGPT 等智能体集成,未来将开放 API 支持更多应用场景。

    推荐理由:Slack 将 AI 编码智能体引入群聊环境,展示了协作开发的新工作流可能性。

  2. The Pragmatic Engineer30

    Addy Osmani 从 Chrome 开发工具到 AI 工程的历程

    Addy Osmani 谈及从 16 岁开发浏览器到成为 Google 工程总监的经历,并分享了他对 AI 工具在软件工程中应用的看法。他指出 AI 协助开发存在“认知放弃”风险,建议工程师理解 LLM 的关键决策以避免问题。他还提到 Google 工程文化近年变化,如高管在周末进行编码,并认为软件工程师的角色将持续重要,因其在代码责任方面不可替代。

8月17日周一
  1. Together AI72

    Together AI 评测:DeepSeek V4 Pro 0813 与 Claude Fable 5 在 DeepSWE 上的成本与性能对比

    Together AI 在软件工程基准 DeepSWE 上对比了 DeepSeek V4 Pro 0813 与 Claude Fable 5。Claude Fable 5 单次尝试准确率更高(69.7% vs 62.8%),但成本是前者的 90 倍(每次尝试 $21.63 vs $0.24)。

    推荐理由:原文通过详细的成本、准确率和任务类型对比,为开发者选择模型提供了具体的决策依据。

8月7日周五
  1. The Register · AI/ML50

    人类在 AI 编程智能体审批环节漏过三分之一危险请求

    一项基于浏览器的游戏测试显示,作为“人在回路”的审批者平均会漏过约三分之一的恶意 AI 编程智能体命令请求。在超过 4 万次游戏运行中,最常见的漏网之鱼是 `npm run analyze` 等看似无害但可能执行任意负载的命令。Anthropic 的数据也表明,用户对 Claude Code 约 93% 的权限提示都予以批准,审批疲劳导致监督松懈。

7月8日周三
  1. The Register · AI/ML41

    Atrophy CLI 工具:对抗 AI 编程技能衰退

    开发者 Ashutosh Rath 推出命令行工具 Atrophy,旨在帮助程序员对抗因过度依赖 AI 编程助手而导致的技能衰退。该工具通过五个技能领域(语法回忆、调试、代码阅读、API 记忆和分解)的定期练习,采用类似国际象棋 Elo 的评分系统来追踪用户独立编程能力。用户可通过基线测试和每周数次 5-10 分钟的练习来监测并维持技能水平,工具还设有 AI 辅助练习模式以量化技能差距。

6月29日周一
6月24日周三
6月23日周二
  1. Together AI62

    Together AI 发布多 GPU 内核生成基准 ParallelKernelBench,前沿模型表现不佳

    Together AI 发布多 GPU 内核生成基准 ParallelKernelBench,用于评估大模型编写跨 GPU 通信 CUDA 内核的能力。在 87 个真实代码问题中,表现最佳的 GPT-5.5 在单次尝试下仅正确解决 28 个问题,其中仅 22 个快于 PyTorch + NCCL 基线。研究揭示了模型在协调 GPU 间通信、数据分区和选择最优传输机制方面存在根本性困难。

6月18日周四
  1. Replit 博客50

    Claude 现支持直接使用 Replit 进行开发

    Claude 现在可以直接集成 Replit,用户可通过自然语言设计应用并直接发送至 Replit 继续开发,实现无缝工作流。该功能通过官方 Replit Connector 实现,支持将任何通用开发任务委托给 Replit 完成。无需复制粘贴或切换上下文,Claude 与 Replit 协同工作,缩短创意与实现之间的差距。

6月17日周三
  1. Together AI57

    Together AI 评测:Kimi K2.7 Code 与 Claude Fable 5 生成落地页的成本与质量对比

    Together AI 对比了 Kimi K2.7 Code 与 Claude Fable 5 生成 12 个落地页的成本和质量。实验显示,Kimi K2.7 Code 的平均成本比 Fable 5 低约 94%,在结合定制设计灵感 MCP 服务器后,其输出质量与 Fable 5 相近。所有生成的页面、成本细目和 GPT-5.5 的评分结果都发布在 OVSC 网站上。

    推荐理由:原文通过具体实验和成本对比,展示了开源模型在特定工作流中结合定制化工具的实际效益。

6月5日周五
  1. One Useful Thing38

    Co-Existence 和 Co-Intelligence 的终结

    作者宣布新书《Co-Existence》即将发布,探讨如何与有时优于人类的 AI 协同工作。书中提到 AI 已经能够完成大量编码任务,Anthropic 报告称其 AI 现在编写了 80% 的代码,每位开发者产出提高 8 倍。作者在写作过程中使用了 Claude Code 和 Opus 4.8 等模型辅助生成网站内容,但对 AI 的依赖程度与上一本书不同。

5月29日周五
5月23日周六
  1. Weights & Biases46

    如何构建一个自动化的软件测试智能体

    本文介绍了如何构建一个基于 Python 的自动化软件测试智能体,该智能体能够规划、生成并运行 pytest 测试,并将结果记录到 W&B Weave。该方法利用了 Agent 框架实现测试流程自动化,适用于需要持续集成和测试日志追踪的开发场景。文中未提及具体模型参数或性能指标,但提供了可复现的代码实现路径。

5月19日周二
5月15日周五
4月21日周二
  1. Replit 博客30

    Replit 如何通过纵深防御保障 Vibe 编程栈的安全

    Replit 通过纵深防御策略保障其平台各层安全,从开发沙箱到生产部署均采用隔离与验证机制。平台默认限制应用间的数据访问,仅允许通过 Connectors 明确授权;使用 Determinate Nix 管理依赖,确保软件供应链无已知漏洞版本。开发与生产环境数据完全分离,支持每日备份与只读 Git 历史记录,防止意外修改生产数据。

4月4日周六
  1. Ahead of AI42

    编码智能体(Coding Agent)的核心组件解析

    编码智能体(Coding Agent)是在大语言模型(LLM)之上增加应用层(即智能体框架)的系统,旨在更高效地处理编码任务。其核心由模型、智能体循环和运行时支持三层构成,其中智能体框架负责管理上下文、工具使用、状态和控制流。Claude Code 和 Codex CLI 等工具就是典型的编码框架,它们通过优化上下文管理和迭代反馈,显著提升了模型在软件工程任务中的实际表现。

2月12日周四
  1. Andrej Karpathy71

    Andrej Karpathy发布200行Python实现的microGPT教程

    Andrej Karpathy发布名为microGPT的教学项目,仅用200行无依赖Python代码实现了完整的GPT训练和推理流程。该项目包含数据集处理、Tokenizer、自动微分引擎、GPT-2类似架构、Adam优化器等核心组件,并附有逐步构建指南。代码已在GitHub Gist和Colab笔记本开源,训练后能生成类似训练数据的虚构人名。

    推荐理由:作者用200行Python代码完整实现了GPT训练和推理流程,适合希望理解Transformer底层原理的开发者。

1月23日周五
1月16日周五
  1. Ollama 博客64

    Ollama v0.14.0 兼容 Anthropic API,支持 Claude Code 使用开源模型

    Ollama v0.14.0 及更高版本现已兼容 Anthropic Messages API,使得 Claude Code 等工具能够使用开源模型。用户可以在本地机器上运行 Claude Code 并连接本地模型,或通过 ollama.com 连接云端模型。官方提供了环境变量配置、安装命令和代码示例,并推荐了适用于编码场景的本地和云端模型。

    推荐理由:Ollama 通过兼容 Anthropic API 将 Claude Code 的智能体能力扩展到开源模型,为本地和云端开发提供了新的工具调用选项。

10月28日周二
  1. Ollama 博客52

    MiniMax M2 模型在 Ollama 云平台上线

    MiniMax M2 模型已在 Ollama 云平台上线,该模型专为编码和智能体工作流设计。根据 Artificial Analysis 的基准测试,其综合得分在全球开源模型中排名第一,在数学、科学、指令遵循、编码和智能体工具使用方面表现出高度竞争力。

10月16日周四