跳到正文
  1. AWS · AI 博客69

    GPT-6.1 Sol 在 Amazon Bedrock 上正式可用

    GPT-6.1 Sol 已在 Amazon Bedrock 上正式可用,为编码、计算机使用和专业工作负载带来更强的推理能力。根据 OpenAI 数据,它在 DeepSWE v1.1 上达到 GPT-6 Astra 的水平,而每个任务的成本约为后者的五分之一。用户可以通过 Amazon Bedrock 控制台或 API 开始使用,并利用其基础设施和访问控制功能。

    推荐理由:原文给出了模型在 Agent 任务上的性能提升和成本对比,读者可以据此判断它是否适合集成到现有工作流中。

  2. Replit 博客77

    Replit Agent 发布支持模型自主决策的新功能

    Replit Agent 发布新功能,允许 GPT-6 Astra 等模型在任务执行中自主决定子代理层级、努力程度和复用策略,实现动态 delegation。在 DeepSWE 和 Terminal-Bench 基准上,该架构在成本与性能上均优于 Astra 单独运行及侧边工架构,且无需修改提示或框架。

    推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。

  1. Vercel 博客56

    Vercel AI Gateway 上线 GPT-6 Sol 和 Luna 模型

    OpenAI 的 GPT-6 Sol 和 GPT-6 Luna 模型现已在 Vercel AI Gateway 上线。GPT-6 Sol 适用于需要持续调查的复杂编码和智能体工作流,GPT-6 Luna 则是高吞吐量、重复性任务的高性价比选择。相比 GPT-5.6,两者在事实可靠性、沟通直接性和避免误导性代码完成声明方面有所改进。

    推荐理由:Vercel AI Gateway 新增了 OpenAI 的两个 GPT-6 变体,并说明了各自在价格、适用场景和可靠性上的定位差异。

  1. Vercel 博客62

    Vercel AI Gateway 2026年9月生产指数:开源模型处理56%的token量,Astra支出是Fable 5.1的两倍

    Vercel AI Gateway 2026年9月生产指数显示,8月开源模型首次处理了网关56%的token量,而2025年12月这一比例还不到10%。平均token价格连续第三个月下降,8月环比下降23.2%。

    推荐理由:基于网关生产数据的月度分析,揭示了开源模型在用量上首次反超闭源模型、以及用户在不同模型间迁移的成本驱动模式。

  2. Vercel 博客59

    OpenAI GPT-Live 1 语音模型在 Vercel AI Gateway 上线

    OpenAI 的全双工语音模型 GPT-Live 1 已在 Vercel AI Gateway 上线,支持同时听与说,无需等待对方说完。该模型还支持客户端委托,允许应用在语音会话进行时,调用 AI Gateway 上的任何文本模型(如 GPT-5.6-sol)处理深度任务,委托请求单独计费。

    推荐理由:原文介绍了全双工语音交互和客户端委托的具体实现方式,读者可以据此评估其技术特点和应用潜力。

  1. ARC Prize64

    GPT-6 Astra 在 ARC-AGI-3 上的表现

    GPT-6 Astra 在 ARC-AGI-3 Semi-Private 基准上,使用 Standard harness 得分 62.7%(花费 $26K),使用 Provider Adapter harness 得分 99.9%(花费 $19K),在 96% 的关卡中行动数少于人类中位数。

    推荐理由:GPT-6 Astra 在 ARC-AGI-3 上表现出显著的行动效率优势,其构建符号模型和自定义工具的能力为理解智能体推理提供了新观察维度。

  1. Together AI59

    Together AI 如何构建全球最快的语音转文本技术栈

    Together AI 分享了其构建低延迟、高吞吐语音转文本(ASR)服务栈的工程优化细节,以支持 NVIDIA Parakeet-TDT 0.6B v3 和 OpenAI Whisper Large v3 等模型。

    推荐理由:原文详细拆解了从模型编译到运行时优化的全链路工程实践,为构建低延迟语音AI服务提供了具体的技术路径参考。

  1. ARC Prize59

    ARC-AGI-3 分析 GPT-5.5 与 Opus 4.7 的推理失败模式

    ARC-AGI-3 通过 135 个新颖环境测试模型的抽象推理能力,分析了 GPT-5.5 和 Opus 4.7 的 160 个推理回放,发现三种主要失败模式:局部效应无法转化为全局世界模型、错误抽象映射至训练数据中的游戏、解决单关但未学习游戏机制。

    推荐理由:原文通过分析 GPT-5.5 和 Opus 4.7 在 ARC-AGI-3 上的推理轨迹,揭示了模型在抽象推理和世界模型构建中的具体失败模式,可为模型设计提供可迁移的诊断思路。

  2. OpenAI Alignment70

    Codex 发布自动审查功能

    Codex 发布自动审查功能,通过独立智能体对越界操作进行审批,将人工审批频率降低约200倍,同时保持99%的批准率和对危险行为的高识别能力。该功能已用于 OpenAI 内部多数桌面端 token 使用,支持在不牺牲安全性的前提下提升自动化效率。

    推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。

  1. ARC Prize56

    ARC-AGI-3 发布:首个全交互式智能体基准

    ARC-AGI-3 发布,包含数百个由人类游戏设计师手工设计的交互式环境和数千个游戏关卡,要求 AI 智能体在无指令、无规则、无目标的情况下自主探索并学习。人类得分 100%,前沿 AI 得分 0.51%。

    推荐理由:ARC-AGI-3 是首个全交互式智能体基准,要求 AI 在无指令无规则环境中自主探索,其设计可作为衡量前沿智能体能力的新标准。

  1. Fly.io 博客58

    Fly.io 博客:为什么你应该亲手写一个 AI 智能体

    作者认为理解 AI 智能体的最佳方式是亲手构建一个,并展示了使用 OpenAI Responses API 从零开始实现一个具备工具调用能力的智能体的核心代码。文章指出智能体的核心是管理上下文数组和工具调用循环,其设计自由度很高,实现子智能体、上下文工程等复杂功能在代码层面可能非常简单。作者鼓励开发者通过实践来形成自己对这项技术的判断。

    推荐理由:作者通过亲手构建一个简单智能体的代码示例,展示了其核心机制和设计自由度,为读者提供了可复现的实践起点。

已经到底了