攻击arXiv 2607.23496
Concept2Scenario:用 SAE 概念归因发现可迁移的越狱场景
提出 Concept2Scenario,借助内部概念归因发现可迁移的越狱场景
- arXiv
- 2607.23496
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 测试
- Qwen3.5-9B、Llama-3.1-8B、Ministral-3-8B 等 10 个
摘要该研究从表征空间因果归因揭示场景削弱拒绝的机制,发现可复用脆弱场景先验,提升多模型黑盒越狱效能与探索速度。
另有 25 篇论文还没打上分类标签,暂不在筛选结果里。
提出 Concept2Scenario,借助内部概念归因发现可迁移的越狱场景
摘要该研究从表征空间因果归因揭示场景削弱拒绝的机制,发现可复用脆弱场景先验,提升多模型黑盒越狱效能与探索速度。
提出上下文特权提升攻击,借助记忆、技能与仓库内容操纵编程智能体
提出内容不变样式包装,翻转安全评审器的判定
这是一项关于大语言模型自动化安全评审系统表面样式脆弱性的评估研究。
提出 SYNCHAIN,以定向微调诱导智能体自合成跨任务潜伏工件
摘要论文揭示了 CUA 自合成工件带来的内部供应链威胁,验证了潜伏载荷的跨任务传播能力与防御局限。
提出 PMPA,诱导智能体把外部恶意指令写入持久记忆并跨会话泄露隐私
摘要论文提出了持久记忆投毒攻击 PMPA,报告了 harness 智能体在处理外部数据时易受跨会话记忆投毒与隐私泄露的风险。
提出爆炸提示词,用条件触发的间接注入延迟诱发恶意工具调用
论文针对大语言模型智能体面临的间接提示注入威胁,研究了利用条件句式实现时间分离的爆炸提示词。