攻击arXiv 2607.00481
研究者提出 SMT 框架,通过模拟审核轨迹越狱函数调用 LLM
提出 SMT 框架,用模拟审核轨迹越狱函数调用 LLM
- arXiv
- 2607.00481
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 被测模型
- GPT-4o、GPT-5.4、Qwen3-Max 等 7 个
提出 SMT 框架,用模拟审核轨迹越狱函数调用 LLM
提出 Ghostwriter 攻击,用伪权威证据条件注入操纵模型观点
Ghostwriter 是一种针对上下文窗口的观点引导攻击:把误导陈述改写成伪权威文本,再在相关查询中让目标模型把该观点写进回答。
用醉酒语言诱导改编对话模型并评测越狱与隐私泄露
作者把醉酒语言当作攻击向量,检验把 LLM 适配成醉酒发短信的模式后,越狱和情境隐私是否变差。动机是人类醉酒时的失范与泄密,以及 LLM 模拟人设的能力。
提出 DREAM 框架,评测 Agent 的跨环境长链攻击脆弱性
摘要DREAM 提出基于知识图谱与策略搜索的动态红队框架,分析了长链跨环境攻击对当前主流智能体的系统性威胁。