RefusalBench:拒答率为何会误排前沿 LLM 在生物研究提示上的安全水平
提出 RefusalBench,评测生物研究提示上的拒答率与安全校准
- arXiv
- 2605.21545
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 风险拒答失当
另有 445 篇论文还没打上分类标签,暂不在筛选结果里。
提出 RefusalBench,评测生物研究提示上的拒答率与安全校准
提出针对 LLM Agent 护栏的推理扩展拒绝服务攻击
提出 PatchBench-Local 协议,评测激活补丁修复越狱的局部附带损伤
摘要论文提出 PatchBench 与局部评估协议,揭示了激活补丁在全局能力无损下仍存局部良性退化。
分析工具型 Agent 判定检索无用却不停止的原因
本文针对智能体在工具静默失效时过度检索的问题,系统分析了判定、信念与停止行动之间的解耦现象,并提出了外部规则整合方案。
提出 ControlPed,生成可控行人危险场景评测端到端驾驶模型
提出 3T 原则并用 Proactivity-Gym 评测主动式 Agent
摘要主动智能体要联合优化任务、时机和信任。
在 GOAD 上评测 NeuroSploit 编排的 AD 自主渗透覆盖
提出利用共享冷却的跨租户干扰攻击,并设计租户隔离机制
摘要揭示网关共享冷却漏洞,提出来源检查与租户隔离防御。
重评 Agent 提示注入检测器,检验基准分数能否预测部署表现
摘要论文揭示公开基准无法反映智能体检测器表现,检测能力源于输入格式相似而非通用防御,建议基于工具输出与低误报评测。
提出 HeadEdit,经冻结 unembedding 做随输入变化的 logit 校正
HeadEdit 是一种不更新参数的行为校准方法,作用点是冻结的 unembedding,而不是中间层残差或新的梯度优化。
提出 IACM-RL,用自生成信念状态与强化学习改进动态意图下的工具调用
构建 THINKINGBOX 沙盒与基准,评测有状态业务工作流中智能体的执行稳定性
摘要论文构建多轮业务沙箱与基准,分析多次重复执行差距并展示强化学习训练效果。
MemoReason 用结构相同的事实–虚构文档配对,测量参数记忆如何影响大模型的上下文推理。
测量剪枝对语音 LLM 群体转写公平性的影响
摘要剪枝后的 Speech-LLM 不能只看总体 WER:Fair-Speech 上族群差扩大,作者建议看最差组。
测量 LLM Agent 记忆投毒防御的良性效用与 token 开销
在没有攻击的对话上,给记忆投毒防御计价,而不是再测一轮攻击是否被挡住。
提出 CryptanalysisBench,评测模型端到端破解真实密码原语的能力
摘要提出真实密码原语分析基准,证实前沿模型具备显著分析能力并能发现未公开设计缺陷。
提出 AgentRewind,用对齐检查点回退长程 Agent 的上下文与工作区
用检查点诊断长程安全 Agent 的失败来源
作者提出一套检查点诊断,用来判断长程安全智能体的失败发生在目标能力可测之前还是之后,并用配对干预检验上游解释。
提出 BioSecBench-Refusal,评测智能体生物安全拒答是否对准风险
BioSecBench-Refusal 把生物研发智能体的谨慎程度和识别隐蔽危害的能力放在同一套任务上测量。
构建 Systemic Risk Index 流水线,把公开基准映到四类系统风险并评测