攻击arXiv 2609.28613
研究:提示注入可改变 Jev 决策模型的行动概率
测量间接提示注入对类型化概率决策的动作劫持
- arXiv
- 2609.28613
- 发表
- 层
- 应用层
- 场景
- 模型与 API
- 被测模型
- jev-1.13.0
摘要封闭动作集改变提示注入的表现,但没有去掉概率被不可信内容移动的风险。
作者在 jev-1.13.0 上研究 decision hijacking:不可信内容能否在用户任务和可选动作都不变时,把类型化决策推向攻击者目标。
测量间接提示注入对类型化概率决策的动作劫持
作者在 jev-1.13.0 上研究 decision hijacking:不可信内容能否在用户任务和可选动作都不变时,把类型化决策推向攻击者目标。
提出 Cocktail 水印,共嵌稳健与脆弱信号以溯源并发现篡改
提出权威链劫持与轨迹引导策略演化,劫持搜索 Agent 的证据链
摘要论文揭示了多步搜索智能体在受限中间人操纵下的脆弱性,提出 ACH 策略与 TGSE 演化方法并完成系统验证。
提出 EXE-Bench 比较 Windows 恶意软件检测器的可用性权衡
EXE-Bench 用同一设置给 AI Windows 恶意软件检测器做四指标排序,而不是只比一次测试集准确率。。
提出 Ghostwriter 攻击,用伪权威证据条件注入操纵模型观点
Ghostwriter 是一种针对上下文窗口的观点引导攻击:把误导陈述改写成伪权威文本,再在相关查询中让目标模型把该观点写进回答。