SecOPD 用同策略蒸馏把自适应提示注入攻击成功率降至 9.0%
提出 SecOPD 同策略蒸馏微调,降低模型对自适应提示注入的顺从
- arXiv
- 2608.21500
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- Qwen3.6-27B (Undefended)、Meta-SecAlign、SecOPD
另有 62 篇论文还没打上分类标签,暂不在筛选结果里。
提出 SecOPD 同策略蒸馏微调,降低模型对自适应提示注入的顺从
用零空间投影净化 LoRA 微调模型后门并保留基座与下游能力
测绘去安全开源模型的生产、重分发与下游应用留存机制
摘要论文测绘了去安全开源大模型供应链,作者指出高集中度的重分发层赋能模型持久留存与部署扩散。
提出 SEAL,在 MoE 共享专家上做 DPO-LoRA 对齐以抵御越狱与权重篡改
SEAL是面向混合 MoE 的训练时防御:只对齐始终执行的共享专家,使安全不依赖路由器是否把 token 送到安全专家。
提出 Collapse,从端侧混淆暴露视图抽取高效用替代模型
这篇工作用代数原语统一若干 TEE 卸载混淆,给出该族的典范边界,再说明该边界挡不住一种分阶段模型抽取。。
提出 USG,在部分保护开源权重发布时阻断有害微调梯度
Unidirectional Safety Gate 是面向 PPOW 发布设定的发布时防护:大部分权重仍可训练,一小部分安全关键组件由提供者侧加固保留,下游不必配合额外安全流程。。
提出 GSU 在发布前封堵敏感门梯度,抵抗下游微调获取禁止能力
Gradient-Sealed Unlearning(GSU)是一种发布前的 preemptive unlearning:不删除模型里已经有的能力,而是让指定禁止域能力更难被发布后的微调获取。
提出参考嫁接,在推理时用激活干预诱导出沙袋隐藏的能力
摘要提出参考嫁接在推理阶段以低成本匹配微调诱导效果,揭示隐瞒表征重叠与阈值门控机制。
提出 AGENTQ,向开源智能体权重植入仅在量化后触发的恶意工具后门
摘要论文研究了智能体量化条件后门风险,提出 AGENTQ 在保持效用的同时实现全精度隐蔽与量化后生效。
证明保留词元表示放大模板注入并验证分词缓解
摘要对话模板注入的权威性主要来自保留词元的学得向量而非文本语法,推理具有补偿作用,现有分词防御遗留工具协议漏洞。