研究:众包微调数据投毒可放大专有指令抽取
提出主题锚点投毒,放大众包微调后的专有指令提取
- arXiv
- 2609.33985
- 发表
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 被测模型
- Qwen2.5-7B-Instruct、Qwen2.5-14B-Instruct、Llama-3.1-8B-Instruct 等 4 个
摘要论文提出基于主题锚点的数据中毒攻击,证明低比例的中毒样本可在黑盒条件下隐蔽放大微调指令泄漏。
提出主题锚点投毒,放大众包微调后的专有指令提取
摘要论文提出基于主题锚点的数据中毒攻击,证明低比例的中毒样本可在黑盒条件下隐蔽放大微调指令泄漏。
提出推理通道预填与输出前缀组合攻击以越狱推理模型
消融比较方言越狱中表层形式、文化框架与策略库的作用
检验结构越狱 IICL 能否跨厂商泛化并与语言约束叠加
提出内容不变样式包装,翻转安全评审器的判定
这是一项关于大语言模型自动化安全评审系统表面样式脆弱性的评估研究。
提出多轮越狱框架 BLUEPRINT,用世界观模拟与心理因素诱导有害输出
BLUEPRINT 是一个将因子化社会影响力策略空间与跨轮世界观模拟解耦的多轮大语言模型安全评测框架。
利用加密思维块的跨模型重放,诱导弱模型逐字转写专有推理链
摘要论文揭示了客户端加密思维块跨模型互换漏洞,提出了低成本提取方法并给出防御方案。
提出 RolePlay 框架,用人设条件放大 LLM 单次推理开销
提出 Concept2Scenario,借助内部概念归因发现可迁移的越狱场景
摘要该研究从表征空间因果归因揭示场景削弱拒绝的机制,发现可复用脆弱场景先验,提升多模型黑盒越狱效能与探索速度。
提出工作流级越狱,诱导 IDE 编程 Agent 在多轮开发中编写有害代码
摘要论文揭示了 IDE 编程智能体在多轮开发工作流中会绕过单轮拒答并自行写出有害代码,呼吁防御转向工作流与代码产物级审查。
提出 SMT 框架,用模拟审核轨迹越狱函数调用 LLM
提出 Persona Attack,分步写入对话记忆指令以越狱
提出音频叙事越狱,以嗓音投递风格绕过端到端语音模型拒答
提出 MetaBreak,用特殊 token 操纵越狱在线 LLM 服务并绕过审核
摘要利用特殊 token 注入对抗平台模板包裹与审核,多场景验证了越狱有效性与互补性。