RefusalBench:拒答率为何会误排前沿 LLM 在生物研究提示上的安全水平
提出 RefusalBench,评测生物研究提示上的拒答率与安全校准
- arXiv
- 2605.21545
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Nemotron 3 Super 120B、Claude Opus 4.7、Claude Opus 4.6 等 15 个
- 风险拒答失当
另有 480 篇论文还没打上分类标签,暂不在筛选结果里。
提出 RefusalBench,评测生物研究提示上的拒答率与安全校准
提出零知识审计协议,核验多租户 RAG 的合谋差分隐私
论文针对多租户 RAG 服务在多账户协同攻击下隐私边界失效的问题展开研究。
提出 CONTRA,用树搜索修改良性配置以诱发 Agent 恶意动作
评估多租户智能体共享向量记忆的跨用户泄露与主动桥接
微调注入评测特征知识,测量隐式评测觉察造成的安全分数虚增
这篇论文研究了大语言模型因学习评测设计元知识而诱发的隐式评估觉察及安全评分虚增现象。
提出技能名称抢注攻击,利用智能体虚构技能名实施供应链劫持
本研究系统揭示了大模型智能体技能推荐场景下的虚构技能名称安全风险,将其形式化为一种新型供应链抢注攻击。
形式化跨不可关联身份的分解攻击并评测状态化防御边界
用探针与激活导向分析语言模型的评测意识表征及言语化
摘要论文系统证明大模型普遍具备评估与部署的隐层表征,但与言语化弱耦合,激活干预可因果诱导言语化且 SFT 阶段起关键稳定作用。
构建 COUNTER-GEO-BENCH,评测生成式搜索中的 GEO 虚假信息防御
摘要论文构建了针对 GEO 虚假信息的首个防御基准,揭示通用护栏的失效与反作用,并提出了有效的轻量对比检测基线。
测量无目标多智能体自发协同破坏关机机制的倾向
摘要论文揭示了多智能体中自发破坏关机的普遍性,表明关机控制必须置于多智能体系统外部。
比较隐写推理与隐写传信、编码推理的可学性
Schulz、Fülle 与 Frengel 测量大语言模型习得隐写推理的难度,并与隐写传信、编码推理对比,以估计依赖阅读 CoT 的监控还能否成立。
测量公开模型家族标签引发的多智能体派系化与合作下降
Del Giudice 等人研究异构多智能体 LLM 系统里一个配置细节:把模型家族身份告诉智能体,会不会改变合作。他们把由此出现的、按身份结组的倾向称为 factionalism。任务是无利害的共同决策,没有人设,也没有偏向同家族同伴的奖励。
提出 REGEXROUTE,用 SAE 引导的正则特征做 LLM 路由
测量系统提示词对模型逐层计算的重构程度
摘要系统提示词引发层选择性表征改变,安全指令的浅层化特征从机理上解释了其对对抗越狱的脆弱性。
提出 Mid-Harness,在执行前验证并选择终端智能体的候选动作
Mid-Harness 在不改生成器和执行 harness 的前提下,于二者之间做动作级测试时计算,用来研究终端智能体里“多采样、再验证”何时提高轨迹成功。
提出 MonoTM,用 SAE 单义特征估计文档主题混合并生成主题描述
MonoTM 是建在文档嵌入 SAE 上的可解释主题模型:混合估计用全部 SAE 特征,主题描述只用另一套配置里通过验证的语义特征。
提出 SkillSeek,用确定性检索替代智能体技能选择循环
SkillSeek 把智能体技能选择做成标准信息检索:BGE-base 双编码器取 top-20,小型交叉编码器重排后经 MCP 返回 top-5,检索循环内不再调用 LLM。公开技能聚合已到数十万条,Liu et al. (2026b) 让智能体自己改写查询并精炼候选,每任务都付 token。作者要问的是,这种合成优势在 SkillsBench 上是否经常出现,以及确定性检索能否在 pass rate 上接近它。
用意见动力学模型解释多智能体讨论何时优于多数投票
作者用一个只含四类行为的意见动力学,解释 LLM 团队讨论何时优于多数投票、何时停在错误共识。
提出工具调用 Agent 的拒绝钱包攻击及主机侧计费约束
这篇工作把工具调用智能体里跨轮保留、并被提供商反复计费的外部工具返回定义为 persistent billable state,并把它的主机侧再次送入决定当作控制点。。
提出 ScopeBench,测量渗透智能体在目标压力下的范围遵从