论文提出选项通道攻击:改一个选项标签即可让 Agent 护栏放行违规操作
提出选项通道攻击,重命名选项标签使 Agent 护栏放行违规操作
- arXiv
- 2610.12292
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 攻击者
- 黑盒
- 被测模型
- LAYA-TD、LAYA-EN、LAYA-ML 等 5 个
摘要作者评估指出类型化模型不应作为最终安全裁决者,其易受非策略文本与选项名称操控,且置信度过滤无法抵御攻击。
另有 232 篇论文还没打上分类标签,暂不在筛选结果里。
提出选项通道攻击,重命名选项标签使 Agent 护栏放行违规操作
摘要作者评估指出类型化模型不应作为最终安全裁决者,其易受非策略文本与选项名称操控,且置信度过滤无法抵御攻击。
提出义务识别基准 ObligationBench,并训练护栏识别 Agent 未履行的安全义务
作者认为编码智能体的安全不能只靠拦截禁止动作,还要找出终止时仍未做的安全关键动作,并将其称为义务。
提出包络采样,用少量真值标注重标定 LLM 评委以缓解奖励作弊
作者研究后训练前如何选择真值标注的查询分布,使重标定后的廉价代理更适合被优化。真奖励昂贵时,实践用 LLM judge 代替人类。若失准只发生在基座很少生成的输出上,on-policy 标注修不到这些点,随后的 KL 正则优化会把质量集中到被高估的输出。
构建 EpiReal-Bench,评测图像生成器将虚假主张渲染为可信证据
EpiReal-Bench 用来量商用图像生成器会不会把虚假现实主张画成可信视觉证据。
构建统一奖励作弊检测基准 RH-Detect 并评测零样本检测器
提出路由 TopK SAE,把语音编码器稀疏码拆成语言与副语言通路
TopK SAE 的稀疏码被分成语言通路与副语言通路,用来分开冻结语音编码器里同时存在的音素信息和说话人、情感、韵律。只重构不能得到作者选定的这一分解。语言通路由音素识别监督,副语言通路由说话人识别、情感分类和韵律预测监督,作用在对方通路上的梯度反转对抗用来压低交叉因子。
提出 BRANCH 方法,用分支搜索绕过多扫描器护栏
提出 FAB 攻击,向声学基础模型植入可由环境声触发的后门
摘要论文提出了针对声学基模的 FAB 后门攻击,在弱威胁模型下实现了任务无关、物理可触发的后门植入。
提出 PyCache Trap,用字节码缓存替换绕过 Agent 技能扫描器
这篇论文研究了智能体技能(Agent Skills)安全扫描中的“审查–执行脱节”问题,并提出了对应的攻击验证与防御方案。
构建 MedDistract 基准,测量偶发信息对临床文书与推理的污染
提出 RAG-PIBench,评测 RAG 上下文中提示注入检测器
提出监控深伪基准 CCDF,在统一编码后评测检测器对伪造犯罪事故录像的识别
摘要提出消除格式捷径的监控深度伪造基准 CCDF,揭示现有检测器难以识别商用生成视频。
提出回答端后门,让模型自生成触发词以在干净有害请求下绕过拒答
摘要论文提出了多轮对话中回答端自生成触发词绕过安全拒绝的后门攻击,指出输入端防护存在盲区。
提出手语转文本接入儿童安全过滤的部署前审计协议
手语儿童到达基于文本的儿童安全机制时,机制看到的是机器翻译,不是儿童所做的手语。作者要解决的是:这条边界在部署前应如何审计。
评测文生图模型的有害内容生成能力与审核检测缺口
构建多语言音视频 DeepFake 基准 BabelFake 并评测检测器
BabelFake 是经同意与 IRB 批准采集的多语音视频 DeepFake 检测基准,用来把视觉操纵和语音合成拆开比较。
提出校准重合成方法,以生成器反演保真度认证真实图像并防御对抗扰动
摘要论文提出基于反演保真度与阈值校准的健全认证框架,在对抗扰动下维持错误率界限,并指出真实内容可认证性随生成器演进而萎缩。
提出 RubricArmor,用攻击–修复循环生成抗奖励作弊的评分准则
提出任务感知的跨域蒸馏与剪枝方法以压缩音频深度伪造检测器
遮挡审计 AdvWave-P 音频越狱的频带必要性与解码层关联
这是对加性音频越狱 AdvWave-P 的频率与解码器深度审计,受害模型主要是 Qwen2-Audio-7B-Instruct,不提出新攻击。