SigLeak 可从执行轨迹推断专有 Agent 技能,平均提升成功率 6.88 个百分点
研究者提出 SigLeak,一个仅凭公开任务描述和黑盒交互就能从执行轨迹中推断专有 Agent 技能内容的框架,并将这一威胁形式化为 Skill Leakage。方法分两阶段:先用诊断任务构造生成多样且决策密集的探针,再对比同一探针在启用与禁用目标技能下的配对轨迹,提取可复现的技能签名并迭代精炼重建结果,全程不需要参考答案或轨迹级正确性标注。在五个场景、三个模型家族和三个 Agent 框架上,SigLeak 在几乎所有设置中取得最佳或并列最佳的下游成功率,平均比禁用技能的基线高 6.88 个百分点,细粒度 SkillSim 的 F1 与召回率也最高。在 SkillGuard5 提示防御下,提示窃取基线 BBS 的细粒度召回与 F1 为零,而 SigLeak 仍能恢复目标技能内容。作者指出,隐藏技能文件并不能隐藏其行为影响,需要在不牺牲执行可见性的前提下设计针对行为推断的防御。
推荐理由论文把专有 Agent 技能被行为轨迹反推的风险形式化,并给出可复现的黑盒推断流程与跨模型评测结果。