攻击arXiv 2609.06749
PMA 攻击:针对隐私保护 LLM 中嵌入到嵌入混淆的语义流形对齐方法
提出 PMA,用流形对齐从 E2EO 混淆向量恢复明文
- arXiv
- 2609.06749
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 被测模型
- BERT-base、RoBERTa-base、T5-base 等 6 个
提出 PMA,用流形对齐从 E2EO 混淆向量恢复明文
提出针对 Agent Harness 的上下文特权提升攻击
提出 PoisonedEvolution 轨迹投毒,诱导自演化技能系统固化恶意行为
这篇论文揭示了自演化技能系统在将交互经验转化为持久指令时的安全风险。
提出 LPCI,把延迟条件载荷写入记忆与检索库以跨会话触发
作者把LPCI定义为针对智能体逻辑执行、记忆留存和工具集成的跨阶段漏洞类,而不是单次输入上的提示改写。