Gray Swan AI 推出 Dangerous Reasoning Arena 竞赛,聚焦思维链越狱
Gray Swan Introduces the Dangerous Reasoning Arena Competition
AI 导读
Gray Swan AI 于 5 月 10 日启动 Dangerous Reasoning Arena 竞赛,将红队测试从输出操纵推进到模型内部推理层面,重点考察思维链越狱。参赛者需诱导模型产生生物攻击规划、战略性欺骗、隐蔽后门植入、基础设施破坏等危险推理,即使最终回复看似无害,只要内部逻辑体现有害意图即算成功。热身周 5 月 10 日开启(不计奖),正式评奖轮次为 5 月 17 日和 5 月 24 日,总奖池 20,000 美元。