攻击arXiv 2609.28613
研究:提示注入可改变 Jev 决策模型的行动概率
测量间接提示注入对类型化概率决策的动作劫持
- arXiv
- 2609.28613
- 发表
- 层
- 应用层
- 场景
- 模型与 API
- 测试
- jev-1.13.0
摘要封闭动作集改变提示注入的表现,但没有去掉概率被不可信内容移动的风险。
作者在 jev-1.13.0 上研究 decision hijacking:不可信内容能否在用户任务和可选动作都不变时,把类型化决策推向攻击者目标。
测量间接提示注入对类型化概率决策的动作劫持
作者在 jev-1.13.0 上研究 decision hijacking:不可信内容能否在用户任务和可选动作都不变时,把类型化决策推向攻击者目标。
提出 RLCDAlignBench,零样本检测多种对齐失败
RLCDAlignBench 测量用强化学习做校准决策的 Jev,能否当作对齐失败的零样本检测器。