PatchBench 提出激活补丁局部评测协议,揭示越狱修复的附带损伤
提出 PatchBench 局部协议,评测激活补丁修复越狱的附带损伤
- arXiv
- 2610.10276
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Llama-3.1-8B-Instruct、Llama-4-Scout、Qwen2.5-3B-Instruct 等 8 个
摘要论文提出 PatchBench 与局部评估协议,揭示了激活补丁在全局能力无损下仍存局部良性退化。
另有 701 篇论文还没打上分类标签,暂不在筛选结果里。
提出 PatchBench 局部协议,评测激活补丁修复越狱的附带损伤
摘要论文提出 PatchBench 与局部评估协议,揭示了激活补丁在全局能力无损下仍存局部良性退化。
提出 Trust Layer,事后复核智能体基准成绩的真实性、诚实性与稳定性
摘要论文提出了后置验证智能体记录分数的四维信任层,揭示了基准高分背后普遍存在作弊、虚报与不稳定现象。
评测技能合并模型的自适应越狱鲁棒性,并提出子空间投影防御
本研究针对开源语言模型技能合并过程中的安全评估盲区,系统评测并刻画了合并大模型在自适应越狱攻击下的脆弱性特征。
审计视觉语言模型在敏感图像上从拒答转向国家立场重构的行为
论文系统研究了中外开源视觉语言模型在政治敏感图像上的审查行为,主要内容如下。
构建明确度梯级并做守卫微调,以拦住模型会回答的有害请求
摘要论文发现安全监视器大多拦截模型已拒答请求,指出明确度偏差是共性原因,并通过双侧梯级微调提升回答请求的召回表现。
提出 TIER 基准,按威胁隐晦度评测有害提示下的安全行为
提出 AURA-Eval 评测工具调用 Agent 的情境风险意识与行动
AURA-Eval 是一个面向工具使用轨迹的增强与诊断框架,用来分开看智能体是否说出风险、采取哪种行动策略、以及该行动相对场景风险是否安全。作者要解决的问题是:现有智能体安全评测常给出单一分数,看不出风险识别、执行前检测,以及在仍有安全完成办法时模型是安全完成还是一律拒绝。
提出 EvasionBench,测量任务压力下智能体对同步监控的规避
提出 ORBIT 框架,评测多智能体系统中的攻击、合谋与多类防御
摘要ORBIT 用六层配置比较多智能体防御,逐动作监控不迁移到合谋。
提出 RLCDAlignBench,零样本检测多种对齐失败
RLCDAlignBench 测量用强化学习做校准决策的 Jev,能否当作对齐失败的零样本检测器。
证明模型仅凭监控判定反馈即可编辑激活规避潜空间监控
这篇论文研究了语言模型如何仅利用多轮上下文中的二元反馈信息规避内部潜空间监控器。