研究者提出 EviLLM 攻击:通过被入侵账号向 AI 代码生成流程注入漏洞
提出 EviLLM,经账户指令或插件向代码生成流程注入漏洞
- arXiv
- 2610.03857
- 发表
- 层
- 应用层
- 被测模型
- GPT-4o、Llama 3.2 (3B)
提出 EviLLM,经账户指令或插件向代码生成流程注入漏洞
提出 LiBRA,在潜空间双向优化以规避图像水印双侧检测
摘要LiBRA 用双向潜空间优化规避双侧水印检测,并提高相对反转基线的保真。
提出检索器后门攻击操纵智能体搜索,并用 DOU 逃避检测
摘要论文展示了通过恶意检索器操纵智能体多轮搜索并利用诱饵重塑表征隐蔽后门的可行性与系统风险。
提出技能级联攻击,把有害目标拆散到多个技能里绕过单技能扫描
摘要论文探讨了多技能智能体系统面临的技能级联攻击风险,提出自动化红队框架与基准集,指出跨技能交互存在安全防护盲区。
复现 Tree-Ring 语义水印的黑盒伪造并恢复检测统计量
提出内容不变样式包装,翻转安全评审器的判定
这是一项关于大语言模型自动化安全评审系统表面样式脆弱性的评估研究。
提出黑盒攻击 DRIFT,偏转生成轨迹以去除扩散水印
提出联邦学习细粒度分布式后门框架 FDBA,用动态触发与对比嵌入降低投毒比例
提出 GhostWord 词级触发后门,对自动语音识别做数据投毒
提出隐蔽后门攻击 AKRASIA,在推理代码模型提示中植入触发器并伪装思维链
摘要论文针对推理代码大模型提出了隐蔽推断期后门攻击 AKRASIA,揭示了模型思维链可被利用进行欺骗性伪装的安全隐患。
提出 MAFIA,以探测放置与事实伪装对带审计 Agent 做查询式记忆投毒
提出 Vaporizer,用词法变换、翻译和释义破解 LLM 输出水印
提出 TIP,用树搜索为 MCP 响应生成隐蔽注入载荷
TIP 是面向 MCP 工具响应的 black-box 间接提示注入,目标是在不改工具元数据的情况下生成语义连贯的 JSON 载荷。
提出 TFA 与 SVA,抑制 ensemble 后门指纹验证
TFA 与 SVA 是针对后门式 LLM 指纹的 ensemble 抑制攻击,不改模型参数。所有者用 SFT 写入秘密对,只通过 API 验证版权。攻击者未授权取得模型,不知道触发和指纹,却要把每个模型的验证变成失败,同时让 ensemble 至少不差于性能最高的单模型。