Import AI· Jack Clark·· 2026-08-17AI 评分43
DiG-bench 基准测试显示 Fable 5 与 Claude Code 在游戏规则发现中展现创造性直觉
Import AI 469: Science AI; RSI simulator; and Zuck's technological pessimism
AI 导读
在 DiG-bench 基准测试中,Opus 5 和 Fable 5 配合 Claude Code 表现最佳,是仅有的能在最高难度 Tier 7 中完成部分任务的模型。该基准包含 70 个需通过交互发现隐藏规则的游戏,旨在衡量 AI 在新环境中的探索与发现能力。GPT-5.5 和 Kimi K3 在借助工具链时也能完成部分 Tier 6 任务,但当前前沿模型整体表现仍远逊于人类。
来源:Import AI · importai.substack.com