Simon Willison·· 5 天前AI 评分49
Anthropic Frontier Red Team 引用:GLM-5.3 与高级网络能力的扩散
Quoting Anthropic Frontier Red Team
AI 导读
Anthropic Frontier Red Team 在内部二进制利用基准的 100 项任务中评估多个模型,发现 GLM-5.3 在 4% 的试验中实现了完整的控制流劫持,Claude Mythos Preview 则为 6%。这标志着模型能力已跨越关键门槛,因为更早的 Claude Opus 4.6 和 GLM-5.2 模型均未成功。
来源:Simon Willison · simonwillison.net