Claude Opus 5.5 现已在 Vercel AI Gateway 上线
Anthropic 的 Claude Opus 5.5 模型现已在 Vercel AI Gateway 上线,可通过 anthropic/claude-opus-5.5 调用。
推荐理由:原文给出了新模型在 Vercel AI Gateway 上的可用性、核心能力变化和关键 API 变更,读者可以据此判断如何接入和使用。
Anthropic 的 Claude Opus 5.5 模型现已在 Vercel AI Gateway 上线,可通过 anthropic/claude-opus-5.5 调用。
推荐理由:原文给出了新模型在 Vercel AI Gateway 上的可用性、核心能力变化和关键 API 变更,读者可以据此判断如何接入和使用。
小米的 MiMo V2.6 Pro、MiMo V2.6 Flash 和 MiMo V2.6 Pro UltraSpeed 三款模型现已在 AI Gateway 平台上线。
SpaceXAI 的 Grok 4.7 现已在 Vercel AI Gateway 上提供,模型 ID 为 spacexai/grok-4.7。在 9 月 27 日前使用该模型的请求自动享受 40% 折扣。
推荐理由:原文提供了 Grok 4.7 在 Vercel 平台的具体接入方式和限时折扣,读者可以据此评估其部署成本和使用门槛。
GitHub Podcast 最新一期探讨了关于 AI 辅助开发的几个常见热门观点。节目指出,开发者仍需审查 AI 生成的代码,但应根据风险调整审查深度;RAG 并未过时,它通过提供模型训练数据外的相关信息来提升回答质量;Skills 和 MCP 解决不同问题,前者是打包的专业知识,后者是连接工具与数据的标准协议,可在同一工作流中共存。
Together AI 为一家全球金融科技公司部署 Dedicated Model Inference,支持 GLM-5.2 在 256K 上下文窗口下实现高并发编码代理负载,峰值并发达 178K tokens。该方案提供自服务端点控制、可编程指标 API 与模型灵活切换能力,实现零停机配置更新与团队级可观测性。
GLM 5.3 FlashX 现已通过 AI Gateway 提供服务,支持以约 200 tokens 每秒的速度进行推理,适用于代码智能体、工具循环和交互式应用。该模型可通过 API 格式调用,并支持自定义报告、API 密钥预算、路由规则等功能。AI Gateway 不加价反映模型提供方定价,且不收取平台费用,包括 Bring Your Own Key 请求。
Mistral AI 帮助一家欧洲能源运营商将 40,000 行 Fortran 77 代码迁移至 C++,并重构了物理密集型的油藏模拟器架构。项目首先构建了数值对等性验证框架,确保新旧代码输出一致,并利用上百个 AI 智能体自动解析代码调用树、整合分散文档。通过采用“规划-编码-测试-评审”的多智能体工作流与人机协同检查点,最终在保障代码质量的同时完成了现代化重构。
AI编码工具使代码生成速度大幅提升,但随之而来的是审查负担加重。调查显示,42%的代码由AI生成,96%开发者不完全信任其输出。企业正通过前置规划、AI代理初审、人类最终把关及要求开发者解释设计逻辑等方式重构审查流程。
推荐理由:原文揭示了AI生成代码带来的审查压力变化,以及企业如何通过流程重构应对可靠性挑战。
Google 发布了 Gemini 3.8,包含面向软件工程和智能体的 Flash 版本,以及专用于网络安全漏洞发现和代码修补的 Flash Cyber 版本。
Google 发布 Gemini 3.8 Flash 和 3.8 Flash Cyber 两款新模型,前者在编码与智能体任务中性能显著提升,后者在漏洞检测与自动修复方面达到前沿水平,均以 Flash 级别的速度和成本提供,其中 3.8 Flash Cyber 通过 Fairwind 程序向受信任的防御方开放。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
Casey Muratori 强调高性能代码对软件行业的重要性,但指出其常被忽视。他批评仅依赖性能分析工具优化代码的做法,认为应从架构层面设计性能。他还提到理解 CPU 运作只需掌握数据流动、指令流程和执行单元调度三个核心要点。
Ramp 开发了名为 Inspect 的内部智能体,用于在远程沙箱环境中执行编码、调试、代码审查等任务。该系统基于 Cloudflare Durable Objects 和 Modal 沙箱,支持快速启动(<5秒)和跨功能协作,已覆盖75%的合并PR。Inspect 通过集成内部数据源与工具链,实现对前后端变更的自动验证,并作为平台支撑超过200个上层智能体,如自动修复、监控告警和数据分析代理。
推荐理由:原文详细展示了内部智能体 Inspect 的构建逻辑与实际应用场景,读者可借鉴其架构设计与落地路径。
工程师需要具备适应能力以应对 AI 带来的技术变革,但教育和职场培训往往未明确解释其含义。亚利桑那州立大学教授 Samantha Brunhaver 指出,适应性意味着识别变化并有效应对,且在不同行业中表现形式各异。微软研究员 Jenna Butler 表示,软件工程师正面临代码审查增加等挑战,需学习新工具和智能体管理以保持竞争力。
Together AI 在 113 项 DeepSWE 任务上对比了 GLM-5.3 (max) 与 GPT-5.6 Sol (max)。GPT-5.6 Sol 在单次尝试准确率(pass@1 72.7% vs 69.0%)、可靠性和速度上保持领先,但每次尝试成本($8.37)是 GLM-5.3($3.99)的两倍多。
推荐理由:原文通过详尽的基准测试和成本分析,为开发者提供了在不同编程语言和任务类型下选择或组合使用这两个模型的决策依据。
The Pulse 报道了 Asana 使用 AI 在两周内完成从 Enzyme 测试框架迁移的案例,AI 显著加速了大规模测试用例重写工作。Airbnb 和 Uber 也有类似经历,表明 AI 在框架迁移中具有显著优势。文章还提到 GitHub 近期宕机事件、Slack 推出 Slack Code、Claude 生成文本将添加水印以及 Uber 开源 SubmitQueue。
Slack 推出 Slack Code 功能,允许 AI 编码智能体在群聊环境中工作。智能体可以创建专用代码频道,团队成员可实时查看其工作、审查代码变更并指导调整。该功能支持 Anthropic 的 Claude、GitHub Copilot 和 OpenAI 的 ChatGPT 等智能体集成,未来将开放 API 支持更多应用场景。
推荐理由:Slack 将 AI 编码智能体引入群聊环境,展示了协作开发的新工作流可能性。
Addy Osmani 谈及从 16 岁开发浏览器到成为 Google 工程总监的经历,并分享了他对 AI 工具在软件工程中应用的看法。他指出 AI 协助开发存在“认知放弃”风险,建议工程师理解 LLM 的关键决策以避免问题。他还提到 Google 工程文化近年变化,如高管在周末进行编码,并认为软件工程师的角色将持续重要,因其在代码责任方面不可替代。
AMD 的 AI 智能体已实现软件开发中 30% 的生产力提升,并正在推动软件开发生命周期(SDLC)结构的重构。目前 AI 智能体可独立完成代码分析、调试、测试生成及审批流程,其中部分软件组件的 AI 生成代码占比已超过 80%。
Together AI 在软件工程基准 DeepSWE 上对比了 DeepSeek V4 Pro 0813 与 Claude Fable 5。Claude Fable 5 单次尝试准确率更高(69.7% vs 62.8%),但成本是前者的 90 倍(每次尝试 $21.63 vs $0.24)。
推荐理由:原文通过详细的成本、准确率和任务类型对比,为开发者选择模型提供了具体的决策依据。
一项基于浏览器的游戏测试显示,作为“人在回路”的审批者平均会漏过约三分之一的恶意 AI 编程智能体命令请求。在超过 4 万次游戏运行中,最常见的漏网之鱼是 `npm run analyze` 等看似无害但可能执行任意负载的命令。Anthropic 的数据也表明,用户对 Claude Code 约 93% 的权限提示都予以批准,审批疲劳导致监督松懈。
开发者 Ashutosh Rath 推出命令行工具 Atrophy,旨在帮助程序员对抗因过度依赖 AI 编程助手而导致的技能衰退。该工具通过五个技能领域(语法回忆、调试、代码阅读、API 记忆和分解)的定期练习,采用类似国际象棋 Elo 的评分系统来追踪用户独立编程能力。用户可通过基线测试和每周数次 5-10 分钟的练习来监测并维持技能水平,工具还设有 AI 辅助练习模式以量化技能差距。
Ollama 0.31 为 Gemma 4 模型引入了多 token 预测技术,在 Aider polyglot 基准测试中平均 token 生成速度提升近 90%。
Replit 分享了其用于大规模评估和改进 Replit Agent 的完整方法论,核心是构建一个从测量到改进的闭环系统。该系统包含三个支柱:用于模拟应用构建任务的离线基准 ViBench、用于观察真实用户影响的在线 A/B 测试,以及用于分析失败模式的追踪聚类系统 Telescope。
Together AI 发布多 GPU 内核生成基准 ParallelKernelBench,用于评估大模型编写跨 GPU 通信 CUDA 内核的能力。在 87 个真实代码问题中,表现最佳的 GPT-5.5 在单次尝试下仅正确解决 28 个问题,其中仅 22 个快于 PyTorch + NCCL 基线。研究揭示了模型在协调 GPU 间通信、数据分区和选择最优传输机制方面存在根本性困难。
Claude 现在可以直接集成 Replit,用户可通过自然语言设计应用并直接发送至 Replit 继续开发,实现无缝工作流。该功能通过官方 Replit Connector 实现,支持将任何通用开发任务委托给 Replit 完成。无需复制粘贴或切换上下文,Claude 与 Replit 协同工作,缩短创意与实现之间的差距。
Together AI 对比了 Kimi K2.7 Code 与 Claude Fable 5 生成 12 个落地页的成本和质量。实验显示,Kimi K2.7 Code 的平均成本比 Fable 5 低约 94%,在结合定制设计灵感 MCP 服务器后,其输出质量与 Fable 5 相近。所有生成的页面、成本细目和 GPT-5.5 的评分结果都发布在 OVSC 网站上。
推荐理由:原文通过具体实验和成本对比,展示了开源模型在特定工作流中结合定制化工具的实际效益。
作者宣布新书《Co-Existence》即将发布,探讨如何与有时优于人类的 AI 协同工作。书中提到 AI 已经能够完成大量编码任务,Anthropic 报告称其 AI 现在编写了 80% 的代码,每位开发者产出提高 8 倍。作者在写作过程中使用了 Claude Code 和 Opus 4.8 等模型辅助生成网站内容,但对 AI 的依赖程度与上一本书不同。
Claude Opus 4.8 已发布,相比 4.7 版本在编码、推理、智能体工作流和知识任务上均实现更强的基准表现。该模型支持 32k 上下文窗口,适用于复杂多步骤任务。目前可通过 API 获取,未公开参数规模与定价。
本文介绍了如何构建一个基于 Python 的自动化软件测试智能体,该智能体能够规划、生成并运行 pytest 测试,并将结果记录到 W&B Weave。该方法利用了 Agent 框架实现测试流程自动化,适用于需要持续集成和测试日志追踪的开发场景。文中未提及具体模型参数或性能指标,但提供了可复现的代码实现路径。
Together AI 推出首个针对高并发编码智能体工作负载的推理基准测试,模拟 45k 至 200k token 的长上下文输入和平均 450 token 的生成任务。
xAI 推出基于终端的 Grok Build 编码智能体,专为专业软件工程工作流设计。该工具支持代码生成与调试,与 Claude Code 形成直接竞争。目前未明确其开源状态及具体性能指标。
Replit 通过纵深防御策略保障其平台各层安全,从开发沙箱到生产部署均采用隔离与验证机制。平台默认限制应用间的数据访问,仅允许通过 Connectors 明确授权;使用 Determinate Nix 管理依赖,确保软件供应链无已知漏洞版本。开发与生产环境数据完全分离,支持每日备份与只读 Git 历史记录,防止意外修改生产数据。
编码智能体(Coding Agent)是在大语言模型(LLM)之上增加应用层(即智能体框架)的系统,旨在更高效地处理编码任务。其核心由模型、智能体循环和运行时支持三层构成,其中智能体框架负责管理上下文、工具使用、状态和控制流。Claude Code 和 Codex CLI 等工具就是典型的编码框架,它们通过优化上下文管理和迭代反馈,显著提升了模型在软件工程任务中的实际表现。
Andrej Karpathy发布名为microGPT的教学项目,仅用200行无依赖Python代码实现了完整的GPT训练和推理流程。该项目包含数据集处理、Tokenizer、自动微分引擎、GPT-2类似架构、Adam优化器等核心组件,并附有逐步构建指南。代码已在GitHub Gist和Colab笔记本开源,训练后能生成类似训练数据的虚构人名。
推荐理由:作者用200行Python代码完整实现了GPT训练和推理流程,适合希望理解Transformer底层原理的开发者。
Ollama 发布新命令 `ollama launch`,可一键设置并运行 Claude Code、OpenCode 和 Codex 等编码工具,支持本地或云端模型,无需配置环境变量或文件。
推荐理由:Ollama 通过新命令简化了本地或云端模型与主流编码工具的集成流程,无需手动配置环境变量或文件。
Ollama v0.14.0 及更高版本现已兼容 Anthropic Messages API,使得 Claude Code 等工具能够使用开源模型。用户可以在本地机器上运行 Claude Code 并连接本地模型,或通过 ollama.com 连接云端模型。官方提供了环境变量配置、安装命令和代码示例,并推荐了适用于编码场景的本地和云端模型。
推荐理由:Ollama 通过兼容 Anthropic API 将 Claude Code 的智能体能力扩展到开源模型,为本地和云端开发提供了新的工具调用选项。
MiniMax M2 模型已在 Ollama 云平台上线,该模型专为编码和智能体工作流设计。根据 Artificial Analysis 的基准测试,其综合得分在全球开源模型中排名第一,在数学、科学、指令遵循、编码和智能体工具使用方面表现出高度竞争力。
Ollama 云服务上线了 GLM-4.6 和 Qwen3-Coder-480B 两款编码模型,并更新了 Qwen3-Coder-30B 以提供更快的工具调用。这些模型可通过 VS Code、Zed 和 Droid 等常用工具集成使用,拥有 16384 token 的上下文长度,并支持通过 Ollama 云 API 直接访问。