攻击arXiv 2609.33985
研究:众包微调数据投毒可放大专有指令抽取
提出主题锚点投毒,放大众包微调后的专有指令提取
- arXiv
- 2609.33985
- 发表
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 被测模型
- Qwen2.5-7B-Instruct、Qwen2.5-14B-Instruct、Llama-3.1-8B-Instruct 等 4 个
摘要论文提出基于主题锚点的数据中毒攻击,证明低比例的中毒样本可在黑盒条件下隐蔽放大微调指令泄漏。
提出主题锚点投毒,放大众包微调后的专有指令提取
摘要论文提出基于主题锚点的数据中毒攻击,证明低比例的中毒样本可在黑盒条件下隐蔽放大微调指令泄漏。
提出 SEAL,在 MoE 共享专家上做 DPO-LoRA 对齐以抵御越狱与权重篡改
SEAL是面向混合 MoE 的训练时防御:只对齐始终执行的共享专家,使安全不依赖路由器是否把 token 送到安全专家。
提出 SMT 框架,用模拟审核轨迹越狱函数调用 LLM