攻击arXiv 2609.32400
SkillDRE:用预执行与运行时双阶段反馈自动演化恶意 Agent 技能
提出 SkillDRE,用预执行与运行时双阶段反馈演化恶意 Agent 技能
- arXiv
- 2609.32400
- 发表
- 层
- 应用层
- 被测模型
- DeepSeek-V4-Pro、GLM-5.2、Qwen3.5-397B-A17B 等 4 个
提出 SkillDRE,用预执行与运行时双阶段反馈演化恶意 Agent 技能
提出 plan injection 攻击,植入良性伪装计划以绕过思维链监视器
摘要论文指出模型会将外部上下文中的伪装计划改写为自身推理,使思维链监视器失效甚至反向合理化恶意行为。
复现 Tree-Ring 语义水印的黑盒伪造并恢复检测统计量
提出黑盒攻击 DRIFT,偏转生成轨迹以去除扩散水印
提出 GhostWord 词级触发后门,对自动语音识别做数据投毒
提出隐蔽后门攻击 AKRASIA,在推理代码模型提示中植入触发器并伪装思维链
摘要论文针对推理代码大模型提出了隐蔽推断期后门攻击 AKRASIA,揭示了模型思维链可被利用进行欺骗性伪装的安全隐患。
构造可通过计费审计的 token 虚报,使服务商系统性超收
不透明 LLM 的按 token 计费里,现有审计核验的是提供方可控的证据,不诚实提供方可以虚报并通过检查。。
提出纯视觉越狱攻击 VJA,把有害编辑指令编码进图像