跳到正文
原文
Redwood Research· Arun Jose·· 20 天前精选关注度71

Redwood Research:CoT 可控性评测存在严重提示词欠激发

CoT controllability evals seem very under-elicited

AI 导读

Redwood Research 的 Arun Jose 发现,CoTControl 评测对提示词高度敏感,用 Claude Opus 4.6 迭代提示模板后,开源模型的合规率提升约 2-3 倍,例如 GPT-OSS-120B 从 5.5% 升至 15%。

推荐理由

作者用提示词迭代把开源模型的 CoT 可控性提升 2-3 倍,说明现有评测可能低估了模型隐藏思维链的能力。

阅读原文blog.redwoodresearch.org