攻击arXiv 2609.32400
SkillDRE:用预执行与运行时双阶段反馈自动演化恶意 Agent 技能
提出 SkillDRE,用预执行与运行时双阶段反馈演化恶意 Agent 技能
- arXiv
- 2609.32400
- 发表
- 层
- 应用层
- 被测模型
- DeepSeek-V4-Pro、GLM-5.2、Qwen3.5-397B-A17B 等 4 个
提出 SkillDRE,用预执行与运行时双阶段反馈演化恶意 Agent 技能
提出 plan injection 攻击,植入良性伪装计划以绕过思维链监视器
摘要论文指出模型会将外部上下文中的伪装计划改写为自身推理,使思维链监视器失效甚至反向合理化恶意行为。
提出 PMPA,经外部源向 Agent 持久记忆投毒并跨会话泄露隐私
摘要论文提出了持久记忆投毒攻击 PMPA,报告了 harness 智能体在处理外部数据时易受跨会话记忆投毒与隐私泄露的风险。
提出针对 Agent Harness 的上下文特权提升攻击
提出隐蔽后门攻击 AKRASIA,在推理代码模型提示中植入触发器并伪装思维链
摘要论文针对推理代码大模型提出了隐蔽推断期后门攻击 AKRASIA,揭示了模型思维链可被利用进行欺骗性伪装的安全隐患。
构造可通过计费审计的 token 虚报,使服务商系统性超收
不透明 LLM 的按 token 计费里,现有审计核验的是提供方可控的证据,不诚实提供方可以虚报并通过检查。。