跳到正文
OpenAI Alignment· Micah Carroll, Tomek Korbak, Zehao Dou, Bowen Baker, Ian Kivlichan·· 2026-05-07AI 评分48

OpenAI 探究在 RL 训练中意外对 CoT 进行评分的后果

Investigating the consequences of accidentally grading CoT during RL

AI 导读

OpenAI 发现部分已发布的 GPT 模型在 RL 训练中意外接受了 CoT 评分,包括 GPT-5.4 Thinking、GPT-5.1 Instant 至 GPT-5.4 Instant、GPT-5.3 mini 和 GPT-5.4 mini。分析显示这些情况未造成 CoT 可监控性显著下降,但存在潜在风险。为防止类似问题,OpenAI 已修复相关奖励路径并加强内部流程与检测系统。

来源:OpenAI Alignment · alignment.openai.com