攻击arXiv 2607.25560
SigLeak 可从执行轨迹推断专有 Agent 技能
提出 SigLeak,从执行轨迹比对中推断专有智能体技能
- arXiv
- 2607.25560
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 攻击者
- 黑盒
- 测试
- GPT-5.4-mini、GPT-5.5、GLM-5.2 等 4 个
摘要提出了通过良性查询和对照轨迹推断黑盒专有技能的 SigLeak 框架,揭示了智能体执行可见性带来的行为侧信道泄露风险。
提出 SigLeak,从执行轨迹比对中推断专有智能体技能
摘要提出了通过良性查询和对照轨迹推断黑盒专有技能的 SigLeak 框架,揭示了智能体执行可见性带来的行为侧信道泄露风险。
提出能力洗钱攻击,让未对齐编排器拆分任务向对齐模型套取能力
摘要作者提出了能力洗钱攻击,发现未对齐编排器分解咨询对齐模型可恢复能力差距,指出需建立跨会话防御。
提出 CGMIA,用成员推理检测代码生成基准的数据泄漏
CGMIA 用成员推断检测代码生成基准是否泄入 LLM 训练集,使评测不依赖对训练语料的直接访问。