跳到正文
8月17日周一
  1. Import AI43

    DiG-bench 基准测试显示 Fable 5 与 Claude Code 在游戏规则发现中展现创造性直觉

    在 DiG-bench 基准测试中,Opus 5 和 Fable 5 配合 Claude Code 表现最佳,是仅有的能在最高难度 Tier 7 中完成部分任务的模型。该基准包含 70 个需通过交互发现隐藏规则的游戏,旨在衡量 AI 在新环境中的探索与发现能力。GPT-5.5 和 Kimi K3 在借助工具链时也能完成部分 Tier 6 任务,但当前前沿模型整体表现仍远逊于人类。