攻击arXiv 2609.33985
研究:众包微调数据投毒可放大专有指令抽取
提出主题锚点投毒,放大众包微调后的专有指令提取
- arXiv
- 2609.33985
- 发表
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 被测模型
- Qwen2.5-7B-Instruct、Qwen2.5-14B-Instruct、Llama-3.1-8B-Instruct 等 4 个
摘要论文提出基于主题锚点的数据中毒攻击,证明低比例的中毒样本可在黑盒条件下隐蔽放大微调指令泄漏。
提出主题锚点投毒,放大众包微调后的专有指令提取
摘要论文提出基于主题锚点的数据中毒攻击,证明低比例的中毒样本可在黑盒条件下隐蔽放大微调指令泄漏。
提出推理通道预填与输出前缀组合攻击以越狱推理模型
检验结构越狱 IICL 能否跨厂商泛化并与语言约束叠加
利用加密思维块的跨模型重放,诱导弱模型逐字转写专有推理链
摘要论文揭示了客户端加密思维块跨模型互换漏洞,提出了低成本提取方法并给出防御方案。