跳到正文
10月2日周五
  1. GitHub Blog · AI & ML31

    AI 如何改变开发者工作:三项需强化的技能

    AI 正在改变开发者的工作方式,要求其掌握引导 AI 智能体而非仅使用工具、不盲信 AI 的首个答案并进行交叉审查,以及利用 AI 节省的时间去解决更宏观问题等三项关键技能。GitHub Copilot 内置的 Rubber Duck 智能体已采用第二模型来审查计划、代码和测试。开发者应将时间更多用于理解客户需求、评估权衡和做出 AI 无法替代的技术决策。

  2. Vercel 博客41

    Vercel AI SDK for Python 新增 Jev 实验性 API

    Vercel 为 Python 开发者发布了 AI SDK 的最新版本,新增了实验性的 `evaluate()` API 以直接调用 Jev 模型。Jev 是一种基于大语言模型构建的通用分类器,旨在快速、低成本地处理结构化分类任务,并返回 JSON 格式的答案和置信度。开发者可通过 `uv add ai` 安装 SDK,并设置 AI Gateway 密钥来使用该功能。

10月1日周四
  1. Apple · 机器学习研究45

    强智能体在自主机器学习工程中需要多少“缰绳”?

    研究发现,在同等时间预算和前沿大语言模型骨干下,复杂的多智能体编排系统相比一个具备读写和bash原语的最小化编码智能体基线,在公开排行榜上并未展现出优势。大规模系统消融实验表明,在编码智能体场景中,复杂的“缰绳”层变得冗余。这表明,围绕强大模型精心设计手工“缰绳”的努力,在当前机器学习工程基准测试中回报甚微。

  2. Google DeepMind76

    Google DeepMind 发布前沿模型 Gemini 4 Argon

    Google DeepMind 宣布推出前沿模型 Gemini 4 Argon,旨在处理复杂、长周期的跨领域工作流。该模型在 DeepSWE v1.1 上达到 77.9% 的 SOTA 水平,输出 token 上限提升至 100 万,定价为每百万输入 token 2 美元、输出 token 10 美元。

    推荐理由:原文详细列举了模型在软件工程、金融法律和网络安全等领域的性能表现及定价,读者可以据此评估其实际应用潜力。

  3. Google · Gemini 博客86

    Google 发布 Gemini 4 Argon 模型

    Google 发布 Gemini 4 Argon 模型,该模型在复杂软件工程、企业知识工作和网络安全防御中实现前沿性能,支持长达 100 万 token 的输出,已通过内部测试并面向受信任的网络安全团队逐步开放,定价为输入 token 每百万 2 美元,输出 token 每百万 10 美元。

    推荐理由:原文明确了模型在复杂任务中的性能跃升和安全防护机制,读者可据此评估其在实际工作流中的应用潜力。

9月30日周三
  1. AWS · AI 博客69

    GPT-6.1 Sol 在 Amazon Bedrock 上正式可用

    GPT-6.1 Sol 已在 Amazon Bedrock 上正式可用,为编码、计算机使用和专业工作负载带来更强的推理能力。根据 OpenAI 数据,它在 DeepSWE v1.1 上达到 GPT-6 Astra 的水平,而每个任务的成本约为后者的五分之一。用户可以通过 Amazon Bedrock 控制台或 API 开始使用,并利用其基础设施和访问控制功能。

    推荐理由:原文给出了模型在 Agent 任务上的性能提升和成本对比,读者可以据此判断它是否适合集成到现有工作流中。

9月29日周二
  1. Hugging Face · 每日论文43

    RLE-Bench:评估编码智能体作为机器人学习工程师的综合性基准

    RLE-Bench 发布,用于评估编码智能体在机器人学习工程中的综合能力,涵盖交互控制、策略学习、感知估计和机械设计四类工作流。该基准采用任务特定指标评估智能体生成的策略成功率、构建的工具链和设计的机械结构,整合为 RLE 指数与工作流能力画像。该评测为未来智能体在物理世界中的工程化能力训练提供系统性评估框架。

9月28日周一
9月27日周日
9月25日周五
9月24日周四
9月22日周二
  1. Vercel 博客56

    Vercel AI Gateway 上线 GPT-6 Sol 和 Luna 模型

    OpenAI 的 GPT-6 Sol 和 GPT-6 Luna 模型现已在 Vercel AI Gateway 上线。GPT-6 Sol 适用于需要持续调查的复杂编码和智能体工作流,GPT-6 Luna 则是高吞吐量、重复性任务的高性价比选择。相比 GPT-5.6,两者在事实可靠性、沟通直接性和避免误导性代码完成声明方面有所改进。

    推荐理由:Vercel AI Gateway 新增了 OpenAI 的两个 GPT-6 变体,并说明了各自在价格、适用场景和可靠性上的定位差异。

9月21日周一
9月18日周五
  1. GitHub Blog · AI & ML26

    GitHub Podcast 探讨 AI 开发中的热门观点:代码审查、RAG、Skills 与 MCP

    GitHub Podcast 最新一期探讨了关于 AI 辅助开发的几个常见热门观点。节目指出,开发者仍需审查 AI 生成的代码,但应根据风险调整审查深度;RAG 并未过时,它通过提供模型训练数据外的相关信息来提升回答质量;Skills 和 MCP 解决不同问题,前者是打包的专业知识,后者是连接工具与数据的标准协议,可在同一工作流中共存。

  2. Vercel 博客28

    GLM 5.3 FlashX 现已上线 AI Gateway

    GLM 5.3 FlashX 现已通过 AI Gateway 提供服务,支持以约 200 tokens 每秒的速度进行推理,适用于代码智能体、工具循环和交互式应用。该模型可通过 API 格式调用,并支持自定义报告、API 密钥预算、路由规则等功能。AI Gateway 不加价反映模型提供方定价,且不收取平台费用,包括 Bring Your Own Key 请求。

9月9日周三
  1. Mistral AI48

    Mistral AI 如何用智能体现代化复杂遗留代码

    Mistral AI 帮助一家欧洲能源运营商将 40,000 行 Fortran 77 代码迁移至 C++,并重构了物理密集型的油藏模拟器架构。项目首先构建了数值对等性验证框架,确保新旧代码输出一致,并利用上百个 AI 智能体自动解析代码调用树、整合分散文档。通过采用“规划-编码-测试-评审”的多智能体工作流与人机协同检查点,最终在保障代码质量的同时完成了现代化重构。

9月2日周三
  1. Google · Gemini 博客73

    Google 发布 Gemini 3.8 Flash 和 3.8 Flash Cyber

    Google 发布 Gemini 3.8 Flash 和 3.8 Flash Cyber 两款新模型,前者在编码与智能体任务中性能显著提升,后者在漏洞检测与自动修复方面达到前沿水平,均以 Flash 级别的速度和成本提供,其中 3.8 Flash Cyber 通过 Fairwind 程序向受信任的防御方开放。

    推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。

8月21日周五
  1. Together AI65

    GLM-5.3 与 GPT-5.6 Sol 在 DeepSWE 上的成本、编码与路由策略对比

    Together AI 在 113 项 DeepSWE 任务上对比了 GLM-5.3 (max) 与 GPT-5.6 Sol (max)。GPT-5.6 Sol 在单次尝试准确率(pass@1 72.7% vs 69.0%)、可靠性和速度上保持领先,但每次尝试成本($8.37)是 GLM-5.3($3.99)的两倍多。

    推荐理由:原文通过详尽的基准测试和成本分析,为开发者提供了在不同编程语言和任务类型下选择或组合使用这两个模型的决策依据。

8月17日周一
  1. Together AI72

    Together AI 评测:DeepSeek V4 Pro 0813 与 Claude Fable 5 在 DeepSWE 上的成本与性能对比

    Together AI 在软件工程基准 DeepSWE 上对比了 DeepSeek V4 Pro 0813 与 Claude Fable 5。Claude Fable 5 单次尝试准确率更高(69.7% vs 62.8%),但成本是前者的 90 倍(每次尝试 $21.63 vs $0.24)。

    推荐理由:原文通过详细的成本、准确率和任务类型对比,为开发者选择模型提供了具体的决策依据。

6月29日周一
6月24日周三
6月23日周二
  1. Together AI62

    Together AI 发布多 GPU 内核生成基准 ParallelKernelBench,前沿模型表现不佳

    Together AI 发布多 GPU 内核生成基准 ParallelKernelBench,用于评估大模型编写跨 GPU 通信 CUDA 内核的能力。在 87 个真实代码问题中,表现最佳的 GPT-5.5 在单次尝试下仅正确解决 28 个问题,其中仅 22 个快于 PyTorch + NCCL 基线。研究揭示了模型在协调 GPU 间通信、数据分区和选择最优传输机制方面存在根本性困难。

6月18日周四
  1. Replit 博客50

    Claude 现支持直接使用 Replit 进行开发

    Claude 现在可以直接集成 Replit,用户可通过自然语言设计应用并直接发送至 Replit 继续开发,实现无缝工作流。该功能通过官方 Replit Connector 实现,支持将任何通用开发任务委托给 Replit 完成。无需复制粘贴或切换上下文,Claude 与 Replit 协同工作,缩短创意与实现之间的差距。

6月17日周三
  1. Together AI57

    Together AI 评测:Kimi K2.7 Code 与 Claude Fable 5 生成落地页的成本与质量对比

    Together AI 对比了 Kimi K2.7 Code 与 Claude Fable 5 生成 12 个落地页的成本和质量。实验显示,Kimi K2.7 Code 的平均成本比 Fable 5 低约 94%,在结合定制设计灵感 MCP 服务器后,其输出质量与 Fable 5 相近。所有生成的页面、成本细目和 GPT-5.5 的评分结果都发布在 OVSC 网站上。

    推荐理由:原文通过具体实验和成本对比,展示了开源模型在特定工作流中结合定制化工具的实际效益。

5月29日周五
5月23日周六
  1. Weights & Biases46

    如何构建一个自动化的软件测试智能体

    本文介绍了如何构建一个基于 Python 的自动化软件测试智能体,该智能体能够规划、生成并运行 pytest 测试,并将结果记录到 W&B Weave。该方法利用了 Agent 框架实现测试流程自动化,适用于需要持续集成和测试日志追踪的开发场景。文中未提及具体模型参数或性能指标,但提供了可复现的代码实现路径。

5月19日周二
5月15日周五
4月21日周二
  1. Replit 博客30

    Replit 如何通过纵深防御保障 Vibe 编程栈的安全

    Replit 通过纵深防御策略保障其平台各层安全,从开发沙箱到生产部署均采用隔离与验证机制。平台默认限制应用间的数据访问,仅允许通过 Connectors 明确授权;使用 Determinate Nix 管理依赖,确保软件供应链无已知漏洞版本。开发与生产环境数据完全分离,支持每日备份与只读 Git 历史记录,防止意外修改生产数据。

1月23日周五
1月16日周五
  1. Ollama 博客64

    Ollama v0.14.0 兼容 Anthropic API,支持 Claude Code 使用开源模型

    Ollama v0.14.0 及更高版本现已兼容 Anthropic Messages API,使得 Claude Code 等工具能够使用开源模型。用户可以在本地机器上运行 Claude Code 并连接本地模型,或通过 ollama.com 连接云端模型。官方提供了环境变量配置、安装命令和代码示例,并推荐了适用于编码场景的本地和云端模型。

    推荐理由:Ollama 通过兼容 Anthropic API 将 Claude Code 的智能体能力扩展到开源模型,为本地和云端开发提供了新的工具调用选项。

10月28日周二
  1. Ollama 博客52

    MiniMax M2 模型在 Ollama 云平台上线

    MiniMax M2 模型已在 Ollama 云平台上线,该模型专为编码和智能体工作流设计。根据 Artificial Analysis 的基准测试,其综合得分在全球开源模型中排名第一,在数学、科学、指令遵循、编码和智能体工具使用方面表现出高度竞争力。

10月16日周四