可解释性arXiv 2610.05295
研究用因果追踪区分间接提示注入中的可读信号与有效干预
用因果追踪区分间接提示注入中的角色可读性与有效干预
- arXiv
- 2610.05295
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 被测模型
- Qwen-2.5-7B、Qwen-2.5-1.5B、Llama-3.1-8B 等 8 个
- 攻击提示注入
摘要作者称源角色先于强工具选择效应可读,有效编辑还取决于位置、长度和方向来源。
在权重固定的白盒模型上,源角色可以先被读出。沿相关方向的编辑是否改变行为,要在目标位点上另测。。