研究者利用加密推理块跨模型兼容性窃取专有 LLM 推理链
利用加密思维块的跨模型重放,诱导弱模型逐字转写专有推理链
完整解读
利用加密思维块的跨模型重放,诱导弱模型逐字转写专有推理链
提出控制标记注入,清空工具智能体推理链以绕过思维链监控
提出计划注入攻击,植入良性表述的有害计划以逃避思维链监控
提出四种阶段转换攻击,绕过推理模型的安全推理护栏
完整解读提出任意字母置换密码越狱,无需微调即可诱导有害输出
提出 AKRASIA 推断期后门,用代码级触发器与伪装推理操纵代码模型
提出推理通道预填与输出前缀组合攻击以越狱推理模型
完整解读