跳到正文
原文
arXiv:越狱、提示注入、投毒与防御· arXiv:2610.09973· Juanyang Xu, Zheng Wang, Xingyu Zhao, Siddartha Khastgir, Andi Zhang·本站收录 · 原文发表 日期未标

从期望危害到似然:LLM 智能体越狱的概率重构

From Expected Harmfulness to Likelihood: A Probabilistic Reformulation of Jailbreaking LLM Agents

AI 导读

研究提出越狱 LLM 智能体的概率重构框架,证明期望危害度对数对输入的梯度,等于在危害度重加权输出分布下模型对数似然的期望输入梯度,从而统一了期望危害最大化与目标似然优化两种思路。基于该联系提出采样分布 OPUR,用于生成高危害目标输出并引导基于似然的输入优化,实验显示该方法能有效越狱 LLM 智能体。

阅读原文arxiv.org