攻击arXiv 2609.16777
SAST-IR 框架:无记忆目标下多轮说服攻击成功率高达 96%
提出 SAST-IR,用有状态攻击者迭代说服无记忆模型接受反事实
- arXiv
- 2609.16777
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 被测模型
- DeepSeek-Chat
提出 SAST-IR,用有状态攻击者迭代说服无记忆模型接受反事实
提出内容不变样式包装,翻转安全评审器的判定
这是一项关于大语言模型自动化安全评审系统表面样式脆弱性的评估研究。
提出 MIPC 与 CFA,观察模型自拟测验后接受开发者身份
这项工作把“模型自己出题、自己批改、再宣布身份已核验”定义成对话层认证失败,并与后端提权分开。
提出 RolePlay 框架,用人设条件放大 LLM 单次推理开销
提出 Ghostwriter 攻击,用伪权威证据条件注入操纵模型观点
Ghostwriter 是一种针对上下文窗口的观点引导攻击:把误导陈述改写成伪权威文本,再在相关查询中让目标模型把该观点写进回答。
用对抗缺陷报告诱导自动程序修复系统生成不安全补丁