ENDOPROMPT:用受害者侧伪参考学习降低模型任务效用的前缀
ENDOPROMPT: Victim-Side Pseudo-References for Utility Degradation
AI 导读
研究者提出 ENDOPROMPT,一种白盒方法,可从无标注指令中学习降低任务效用的前缀。其生成器以请求文本为输入,把受害者模型的干净续写当作伪参考,通过局部搜索找出降低续写可能性的前缀,再对同一指令内的比较做偏好拟合并做奖励精炼,把信号蒸馏进生成器;部署时每个请求只生成一个前缀,无需再做受害者侧搜索。在四个指令微调模型和七个良性基准的完整划分上,平均效用变化为 -26.8 个百分点,28 个单元格中有 27 个为负。失败分析显示存在输出膨胀和前缀复用现象,对照实验未能证明请求匹配带来降效优势。作者称代码将在论文被接收后发布。