跳到正文
原文
论文追踪· arXiv:2608.03700· Yongli Xiang, Zhifang Zhang, Bojun Yang, Ziming Hong, Lei Feng, Miao Xu, Tongliang Liu·本站收录 · 原文发表

AntiSkillBench:评测 persona skill 的隐私泄露与行为模仿风险

When Agents Learn to Be You: Benchmarking Privacy Leakage, Impersonation Risk, and Defenses in Persona Skills

AI 导读

研究者提出 AntiSkillBench,一个覆盖 persona skill 全流程的端到端基准,用于评测隐私泄露、属性披露与行为模仿风险及相应防御。该基准包含 7,500 条 persona 对话轨迹,来自 50 个行为特征丰富的用户画像,覆盖多种任务场景;评测套件在三种 skill 蒸馏策略下测量 skill 级隐私泄露与 agent 级属性披露、行为模仿;防御评测覆盖在线与事后干预的四种配置,包括主动风险抑制与被动来源保护。在三个前沿 agent 上的实验显示,persona skill 的风险跨 agent 骨干与蒸馏协议持续存在,并从显式属性延伸到沟通风格与人格特质;现有防御效果有限且依赖蒸馏方式,难以跨风险类型与蒸馏策略泛化。作者认为该基准为开发隐私保护与真实性感知的 persona skill 提供了有挑战性的评测工具。

阅读原文arxiv.org