P-VMI:对抗图像经 KV cache 持续影响多轮对话
提出持久视觉记忆注入,使对抗图像经缓存在触发时操控输出
另有 1057 篇论文还没打上分类标签,暂不在筛选结果里。
提出持久视觉记忆注入,使对抗图像经缓存在触发时操控输出
提出无外部攻击模型的多轮自我越狱方法 SLIP
提出回答端后门,让模型自生成触发词以在干净有害请求下绕过拒答
评估多租户智能体共享向量记忆的跨用户泄露与主动桥接
完整解读用 StegoMemory 测试智能体持久记忆作为跨会话隐写信道的可行性
提出 Concept2Scenario,借助内部概念归因发现可迁移的越狱场景
提出 SigLeak,从执行轨迹比对中推断专有智能体技能
提出破坏执行连续性的回滚攻击,揭示检查点恢复的安全故障
利用加密思维块的跨模型重放,诱导弱模型逐字转写专有推理链
提出 MAMJ,在元层面交替优化多模态越狱的策略提示与攻击者权重
完整解读提出自博弈红队智能体 GPT-Red,自动挖掘提示注入与越狱攻击
完整解读提出 AHA 自动科研循环,发现生产级智能体的可复用漏洞概念
AHA 是一项针对生产级 LLM 智能体自动化红队测试的研究,旨在解决传统方法仅保留具体攻击载荷而缺乏成因解释、导致跨版本复用困难且无法指导修复的问题。
提出控制标记注入,清空工具智能体推理链以绕过思维链监控
提出计划注入攻击,植入良性表述的有害计划以逃避思维链监控
提出 LLMLeak,把机密编进报错 URL,借聊天机器人网页抓取外传
LLMLeak 研究一种隐蔽外传:本地恶意软件已拿到机密,却因为网络限制或监控不能直接连接攻击者,于是把秘密放进看起来像排障文档的 URL,让良性聊天机器人的网页抓取工具在访问时把秘密带出去。
提出四种阶段转换攻击,绕过推理模型的安全推理护栏
完整解读提出 ISM,协同改写技能描述与提示词以隐式操纵技能选择
完整解读提出内容不变样式包装,翻转安全评审器的判定
这是一项关于大语言模型自动化安全评审系统表面样式脆弱性的评估研究。
提出 CS-Guard 基准与虚构场景攻击,评测代码生成护栏
提出 FLOWSEAL,在工具边界以信息流控制阻断智能体隐私泄露