推理模型难以控制自己的思维链,而这反而是好事
Reasoning models struggle to control their chains of thought, and that’s good
AI 导读
OpenAI 推出 CoT-Control,发现推理模型难以控制自己的思维链。OpenAI 认为,这一结果强化了可监控性作为 AI 安全防护手段的价值。
推荐理由
OpenAI 发布 CoT-Control 并发现推理模型难以控制自身思维链,为思维链可监控性作为安全防护提供了实证支持。