跳到正文
10月9日 · 周五

全部论文

论文 1397 篇
筛选
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 444 篇还没打标签,不在筛选结果里。
  1. arXiv 2610.11634收录

    LTBD:用可学习信任边界分隔符防御提示注入

    AI 导读论文提出 LTBD,一种可学习的信任边界分隔符方法,用于防御提示注入。该方法把信任出处显式标注在输入结构上,训练目标由交叉熵项和偏好项组成,前者保持良性行为,后者压低攻击诱导的输出。

    收录