跳到正文
10月8日 · 周四

提示注入 · 论文

找到 2 篇
筛选2
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 51 篇还没打标签,不在筛选结果里。

另有 51 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2609.28613

    研究:提示注入可改变 Jev 决策模型的行动概率

    测量间接提示注入对类型化概率决策的动作劫持

    发表
    测试
    jev-1.13.0
    摘要封闭动作集改变提示注入的表现,但没有去掉概率被不可信内容移动的风险。

    作者在 jev-1.13.0 上研究 decision hijacking:不可信内容能否在用户任务和可选动作都不变时,把类型化决策推向攻击者目标。

    深度解读完整解读
  2. 评测与基准arXiv 2609.29429

    Jev 被用于零样本检测十类对齐失败,中位 AUROC 达 0.886

    提出 RLCDAlignBench,零样本检测多种对齐失败

    发表
    测试
    Jev (jev-1.13.0)、Qwen3.5-2B、Phi-4-mini 等 6 个
    摘要一次通用问题已能给多数对齐失败排序,大的误差来自状态和标签。

    RLCDAlignBench 测量用强化学习做校准决策的 Jev,能否当作对齐失败的零样本检测器。

    深度解读完整解读
已经到底了