研究提出意图恢复率作为 LLM 安全评测的补充指标
提出 IRIS,用意图恢复率区分遮蔽越狱下无害输出的原因
- arXiv
- 2610.11766
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 被测模型
- GPT-4o、Claude Sonnet 4.5、Claude Opus 4.5 等 6 个
摘要无害输出的证据权重取决于任务是否被恢复。
IRIS 把意图恢复当作中间信号,用来解释意图遮蔽提示下为何没有出现有害协助。
另有 194 篇论文还没打上分类标签,暂不在筛选结果里。
提出 IRIS,用意图恢复率区分遮蔽越狱下无害输出的原因
IRIS 把意图恢复当作中间信号,用来解释意图遮蔽提示下为何没有出现有害协助。
提出 BRANCH 方法,用分支搜索绕过多扫描器护栏
提出 PyCache Trap,用字节码缓存替换绕过 Agent 技能扫描器
这篇论文研究了智能体技能(Agent Skills)安全扫描中的“审查–执行脱节”问题,并提出了对应的攻击验证与防御方案。
提出 PackHallu,经规则文件提示注入诱导编码 Agent 换用攻击者指定包
PackHallu 研究一种针对编程智能体规则文件的提示注入:让智能体在本应使用合法依赖时,改导入攻击者指定并控制的包。
ASRD 用四态标签检查五个开源模型如何处理非规范表面上的有害请求。
提出 ASPIRE 行为图搜索,开放式发现 Agent 提示注入漏洞
ASPIRE 是给搭建方用的智能体提示注入红队引擎,目标是开放式画出可利用的行为路径,而不是在固定任务上打磨一条载荷。
提出 CORSA,按任务簇优化技能注入的检索与执行
提出 ATLAS 用水平集估计恢复黑盒分类器的对抗输入集合
ATLAS 是一个查询式 black-box 框架,用来构造诱发失败的对抗输入集合,供鲁棒性审计使用。
提出 CRIME 框架,组合良性 Agent 技能诱发恶意行为
CRIME 把公共技能库中各自通过审查的技能配成两两组合,看联合执行能否实现指定恶意任务。。
提出 Red-TTT,在攻击过程中更新攻击者实现自动化越狱
提出 StegoMemory,评测智能体持久记忆作为跨会话隐写信道
摘要研究揭示智能体持久记忆可作为隐蔽信道跨会话传输机密,写入持久化是主要防御瓶颈,呼吁建立记忆完整性防御。
提出组合式意图隐藏越狱,按先验后验匹配选择辅助任务
这篇工作把组合式意图隐藏写成任务选择:有害目标必须留在 bundle 里,同时让估计的有害意图概率贴近全集先验,或降到阈值以下。
提出 LLMLeak,把机密编进报错 URL 借网页抓取外泄
LLMLeak 研究一种隐蔽外传:本地恶意软件已拿到机密,却因为网络限制或监控不能直接连接攻击者,于是把秘密放进看起来像排障文档的 URL,让良性聊天机器人的网页抓取工具在访问时把秘密带出去。
提出 APEX,用跨技能进度记录夹带虚假授权劫持 Agent
提出 CodeMimicry,以结构化代码补全诱导模型生成有害内容
提出 PRETEXT 攻击,迭代改写技能文本绕过技能扫描器并让 Agent 执行木马
PRETEXT 是一项针对基于“静态规则加语义大模型”的智能体技能安全检测框架的白盒攻击与协同进化评估研究。
提出 CoordPoison,解耦技能投毒的借口与动作
CoordPoison 是一种 Skill 供应链投毒方法,把“为何执行”和“执行什么”拆到两个 Skill。。
提出 TrustProbe,挖掘技能智能体中不可信 skill 到特权操作的信任链漏洞
提出 SceneJail,利用视频情境上下文越狱视频多模态模型
提出 CollageAttack,用空间文本碎片重组越狱文生图模型
摘要系统揭示 T2I 跨模态空间合成安全漏洞,证实离散无害元素可在图像层面重构有害意图并放大传播强度。