防御arXiv 2610.05346
研究者提出序列马赛克攻击并给出防御理论
形式化 watchman 防御以阻止序贯马赛克攻击
- arXiv
- 2610.05346
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 被测模型
- Qwen3.6-35B-A3B、Gemma-4-26B-A4B-it、DeepSeek-V2-Lite (16B-A2.4B)
摘要watchman 理论给出零失败且有用的条件。
这篇工作同时给出序贯马赛克防御的博弈理论,以及冻结 LLM 上的分角色自博弈训练。
形式化 watchman 防御以阻止序贯马赛克攻击
这篇工作同时给出序贯马赛克防御的博弈理论,以及冻结 LLM 上的分角色自博弈训练。
把批量提示当作越狱攻击,提出 batch-aware DPO 缓解
这篇工作检查一种本用于省推理成本的输入结构:把多个问题一次送进对齐后的 LLM,安全拒答是否还和单问时一样。