SigLeak 可从执行轨迹推断专有 Agent 技能,平均提升成功率 6.88 个百分点
提出SigLeak,从执行轨迹比对中推断专有智能体技能
- 定位与核心问题:研究黑盒部署下智能体专有技能通过执行轨迹产生行为侧信道泄露的风险。
- 要解决的问题:AaaS 平台与开发者将高价值技能保留在私有后端,但人工干预与监督所需的轨迹可见性构成了行为侧信道;现有基于显式提示词的提取攻击容易被防御规则拦截,缺乏从良性交互中推断隐藏技能的方法。
- 方法要点:提出 SigLeak 框架,基于任务多样性与决策密度设计良性诊断探针,并通过对比技能启用与禁用两组配对执行轨迹分离技能签名,经过初始合成与差异引导细化两阶段重构专有技能。
- 关键实验结果:
- 在 5 个评测场景中,SigLeak 重构技能使智能体平均成功率相对技能禁用基准提高 6.88 个百分点(据 Table 1)。
- 在 SkillGuard5 提示防御下,对抗性基线 BBS 恢复内容为零,而 SigLeak 在细粒度 F1 和召回率上均取得最高综合表现(平均 F1 22.8%,召回率 20.1%,据 Figure 4a)。
- 在同领域 3 个 arXiv 技能区分测试中展现出对角线占优的特异性,read-arxiv-paper 技能匹配度达 19.64% F1,对无关技能匹配度低于 4.17%(据 Figure 4b)。
- 迭代细化在第 2 轮达到峰值,成功率升至 76.17%、细粒度 F1 升至 19.57%(据 Figure 4c)。
- 作者结论与启示:作者认为,即使隐藏技能文件并配置提示词防御,专有技能依然会通过执行行为产生侧信道泄露;未来防御需要在保障人工监督可见性与遏制行为推断之间寻求平衡。