攻击arXiv 2610.07723
研究者提出答案侧后门:让模型自生成触发词绕过安全拒答
提出回答端后门,让模型自生成触发词以在干净有害请求下绕过拒答
- arXiv
- 2610.07723
- 发表
- 场景
- 模型与 API
- 测试
- Gemma-7B-it、Llama-2-7B-chat-hf、Mistral-7B-Instruct-v0.3 等 4 个
摘要论文提出了多轮对话中回答端自生成触发词绕过安全拒绝的后门攻击,指出输入端防护存在盲区。
另有 989 篇论文还没打上分类标签,暂不在筛选结果里。
提出回答端后门,让模型自生成触发词以在干净有害请求下绕过拒答
摘要论文提出了多轮对话中回答端自生成触发词绕过安全拒绝的后门攻击,指出输入端防护存在盲区。
提出跨通道分段攻击,借 MCP 多通道隐式信任外发敏感数据
摘要论文揭示了 MCP 多通道隐式信任层级,通过跨通道分段与协议级利用突破现有防御,展示了严重的凭证外发风险。
提出 Collapse,从端侧混淆暴露视图抽取高效用替代模型
这篇工作用代数原语统一若干 TEE 卸载混淆,给出该族的典范边界,再说明该边界挡不住一种分阶段模型抽取。。
提出技能级联攻击,把恶意目标拆进多个技能以绕过单技能检测
摘要论文探讨了多技能智能体系统面临的技能级联攻击风险,提出自动化红队框架与基准集,指出跨技能交互存在安全防护盲区。