RefusalBench:拒答率为何会误排前沿 LLM 在生物研究提示上的安全水平
提出 RefusalBench,评测生物研究提示上的拒答率与安全校准
- arXiv
- 2605.21545
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Nemotron 3 Super 120B、Claude Opus 4.7、Claude Opus 4.6 等 15 个
- 风险拒答失当
另有 441 篇论文还没打上分类标签,暂不在筛选结果里。
提出 RefusalBench,评测生物研究提示上的拒答率与安全校准
提出 AudioHijack,用不可感知对抗音频对语音模型实施听觉提示注入
摘要提出了 AudioHijack 框架,揭示了 LALM 对听觉提示注入的脆弱性与传统防御的局限。
系统研究 LLM 智能体记忆投毒并构建基准 MPBench
摘要系统研究了智能体记忆投毒风险,揭示了写入渠道漏洞,构建了 MPBench 基准并指出提示注入防御的局限。
提出 CONTRA,用树搜索修改良性配置以诱发 Agent 恶意动作
提出 WebMirage,用对抗图像劫持视觉网页智能体的浏览器操作
WebMirage 是一个面向视觉定位网络智能体的流水线感知端到端红队攻击框架。
提出 Staged Decoding 与指令跟随训练,减少推理轨迹隐私泄露
本文把大推理模型的隐私问题做成轨迹可控性:隐私指令是指令,轨迹不跟随就会把敏感上下文写进可被提示注入导出的文本。
提出 PyINE 基准,训练捷径跟随模型并比较监督者
PyINE 是用可执行程序研究推理模型引出与监督的框架,PyINE-v1 是其第一次发布。
评估多租户智能体共享向量记忆的跨用户泄露与主动桥接
提出 VERA,结构化审计漏洞推理中的虚构主张
微调注入评测特征知识,测量隐式评测觉察造成的安全分数虚增
这篇论文研究了大语言模型因学习评测设计元知识而诱发的隐式评估觉察及安全评分虚增现象。
发布 HakemBench,评测土耳其语定型决策的质量、校准与选择性自动化
HakemBench v1.0 是土耳其语定型决策的开放基准,看模型在固定选项上给出的概率是否可用,以及不确定时能否把案例交给人。
提出 HACKTRACE,用生成期激活检测代码智能体的奖励作弊
摘要论文提出利用生成状态监督作弊尝试的 HACKTRACE 框架,实现高精度低延迟检测并在 GRPO 训练中有效抑制奖励投机。
提出 PRETEXT 白盒攻击,迭代改写技能文本以绕过 Agent 技能扫描器
PRETEXT 是一项针对基于“静态规则加语义大模型”的智能体技能安全检测框架的白盒攻击与协同进化评估研究。
提出 BDA,把多 LLM 议会的辩证动作当可靠性证据做加权聚合
BDA 是一种不另调 LLM 的多 LLM 议会聚合方法,同时处理置信度校准和持续不可靠席位。
提出技能名称抢注攻击,利用智能体虚构技能名实施供应链劫持
本研究系统揭示了大模型智能体技能推荐场景下的虚构技能名称安全风险,将其形式化为一种新型供应链抢注攻击。
提出 aiXamine 黑盒基准,统一评测 LLM 安全、稳健与隐私权衡
aiXamine 是一套黑盒评测协议,用来在同一条件下比较 LLM 的 safety、security 与 privacy,而不是再产出一个能力分。
用探针与 logit margin 区分阈值失准与行为隐藏知识
这项工作问内部探针何时比直接读答案更有信息,并在验证任务里把落差定位到读出阈值。
用聚合与区分效度检验基准是否衡量其所称概念
提出诚实留出协议,量化安全路由评测的基线选择偏差
摘要论文揭示安全路由评估在分布偏移下的虚假下限,指出防御重心应转向外部动作级强制。
用探针与激活导向分析语言模型的评测意识表征及言语化
摘要论文系统证明大模型普遍具备评估与部署的隐层表征,但与言语化弱耦合,激活干预可因果诱导言语化且 SFT 阶段起关键稳定作用。