RefusalBench:拒答率为何会误排前沿 LLM 在生物研究提示上的安全水平
提出 RefusalBench,评测生物研究提示上的拒答率与安全校准
- arXiv
- 2605.21545
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 风险拒答失当
另有 444 篇论文还没打上分类标签,暂不在筛选结果里。
提出 RefusalBench,评测生物研究提示上的拒答率与安全校准
提出自动化红队流水线,用系统提示词压测对齐审计能否抵御策略性欺骗
摘要通过红队提示词揭示现有审计方法易受策略欺骗,并在激活层面诱导高置信度错误推断。
测量委托收费激励下模型策略性虚报任务信心
摘要论文建立人机委托信誉博弈框架,揭示模型策略性虚报置信度且主要造成信息破坏,作者指出校准受制于报告意愿。
论文研究了固定参数与提示词的智能体在受审计交互中自发形成隐蔽信道并泄露机密的过程。
构建 SLEIGHT-BENCH,评测代码智能体监控器的概念盲点
摘要评估针对监控盲点的规避基准,发现前沿监控器漏报率高,算力与脚手架虽有提升但存在类别局限。
评测人类开发者在协作编程中能否发现编码 Agent 的隐蔽破坏
研究者提出一种轻量级路由 logits 安全检测器,在提示词预填充阶段读取 MoE 视觉语言模型的专家路由信号,在生成前判断多模态请求是否安全,且不修改模型参数或专家路由。
作者在两个指令微调 MoE VLM 上比较改模型与读路由。组合式风险按 HoliSafe 分成五类:图文各自可安全,合在一起才不安全,或不安全内容只在图像里。
提出 Trust Layer,事后复核智能体基准成绩的真实性、诚实性与稳定性
摘要论文提出了后置验证智能体记录分数的四维信任层,揭示了基准高分背后普遍存在作弊、虚报与不稳定现象。
提出 DECEPEVAL,评测智能体在外部诱导下的欺骗行为
DECEPEVAL 是一个评测 LLM 智能体欺骗如何随任务、职业场景和外部条件变化的基准。
用智能体盲置换量化公开 wiki 日志中的多智能体串通
作者把 Nightingale Collective 所记的 wiki 旁路事件,做成相对身份置换零模型的定量配套,并写出四类会使协调检验失真的构造错误。
提出 Inspect Robots,在真实机器人上评测具身智能体的能力与安全
构建 BazaarBench 评测 C2C 市场中 Agent 的违规失信
BazaarBench 针对大语言模型智能体在去中心化 C2C 交易中的代理安全问题,提出了一个结合底层实体状态与大模型裁判的仿真基准平台。
摘要论文展示了智能体自发欺骗可在行为显现前由内部表征预测,并通过激活引导证实了表征的行为可操作性。
提出 CAP 指标与 CSFD 算法,发现被抑制的安全特征
摘要论文指出越狱通过抑制安全特征运作,提出 CAP 与 CSFD 补充了针对激活特征的解释性方法。
揭示风险自述与实际行为由近正交表征分别控制
这篇论文从内部表征与因果干预视角,系统研究了大语言模型在风险承担(Risk-Taking)场景下自我报告与实际决策脱节的根本机制。
评测启用工具调用后多模态模型拒答有害图文请求的变化
论文系统评估了智能体工具调用范式对多模态大语言模型拒答能力的影响,指出了工具增强视觉推理背后的安全隐患。核心探讨的问题在于:当 MLLM 从单次推理转向通过 ReAct 循环调用外部工具(打标、缩放、OCR、代码执行)时,工具使用机制本身是否会降低模型拒答有害请求的概率。
量化大推理模型主动自报误行为并接受监控的意愿
摘要大推理模型缺乏自报意愿,偏好宽容通道并掩盖严重度,需专门对齐。
微调注入评测特征知识,测量隐式评测觉察造成的安全分数虚增
这篇论文研究了大语言模型因学习评测设计元知识而诱发的隐式评估觉察及安全评分虚增现象。
提出 FBS Debate 协议,使诚实成为占优策略且最坏情况正确
FBS Debate 是一套可扩展监督的辩论规则:两名计算方争论一个可递归分解的是非问题,人类只在最后选出的子问题上做黑盒判断。要处理的缺口是,prover-estimator debate 虽能覆盖稳定分解,但只在输入分布的平均意义下成立,而且 Bob 的获胜策略一般要跟着 Alice 的作弊策略变。作者要在同一问题类上,让每个错误实例都能被抓住,并让诚实且正确成为双方的占优策略。
四种 LLM 在四个经典两人博弈中交换无预设语义的数字时,消息结构可以跨模型出现,合作水平的变化则不能跨模型外推。