攻击arXiv 2609.15989
研究者提出 plan injection 攻击,可绕过思维链监控
提出 plan injection 攻击,植入良性伪装计划以绕过思维链监视器
- arXiv
- 2609.15989
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 灰盒
- 被测模型
- Qwen2.5-Coder-7B-Instruct、Qwen3-8B、DeepSeek-R1-0528 等 6 个
摘要论文指出模型会将外部上下文中的伪装计划改写为自身推理,使思维链监视器失效甚至反向合理化恶意行为。
提出 plan injection 攻击,植入良性伪装计划以绕过思维链监视器
摘要论文指出模型会将外部上下文中的伪装计划改写为自身推理,使思维链监视器失效甚至反向合理化恶意行为。
提出能力洗钱攻击,拆分任务向对齐模型套取能力
摘要作者提出了能力洗钱攻击,发现未对齐编排器分解咨询对齐模型可恢复能力差距,指出需建立跨会话防御。
提出数据伪造攻击,使密码学模型认证在审计集通过但部署失效
这篇工作同时给出对 CMC 的数据伪造攻击,以及先承诺、后抽样的认证模板。。
提出 Adaptive Stealing,自适应窃取印章以擦除或伪造水印
AS 是一种窃取生成式 LLM 水印的算法,用来在密钥和检测接口不可用时伪造或擦除水印。
提出字符级扰动与遗传算法去除 LLM 水印
这篇工作评估推理时 LLM 水印在黑盒、有限查询下的移除难度,并比较字符级、token 级和句子级编辑。