跳到正文
原文
论文追踪· arXiv:2610.07645·本站收录 · 原文发表 精选关注度57

SkillPoison:用成功经验投毒自进化 Agent 的技能形成

SkillPoison

AI 导读

吉林大学等机构的研究者提出 SkillPoison,一种针对自进化 LLM Agent 技能形成过程的投毒框架,在三个基准上最高达到 95.71% 的攻击成功率。该方法不注入恶意内容,而是先筛选目标行为自然出现且影响任务结果的轨迹,再为每条轨迹构造归因证据,把该行为与已验证的任务成功绑定,最后跨任务类别组织这些记录,诱导技能提取器保留该行为并丢掉其原本的适用条件。实验在 AutoSkill 和 Trace2Skill 两个经验到技能的框架、HANS、PAWS、DS1000 三个基准上进行,注入的经验全部任务正确并通过验证与词法检查;消融显示局部归因与跨经验强化两个模块都不可或缺。作者指出,技能形成过程需要保留行为的上下文适用条件。

深度解读生成中

推荐理由

论文提出用任务正确的成功经验诱导技能提取器过度泛化,攻击成功率 95.71%,为自进化 Agent 的技能形成环节提供了新的威胁模型。

阅读原文arxiv.org