PatchBench 提出激活补丁局部评测协议,揭示越狱修复的附带损伤
提出 PatchBench-Local 协议,评测激活补丁修复越狱的局部附带损伤
- arXiv
- 2610.10276
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 被测模型
- Qwen2.5-3B-Instruct、Qwen2.5-14B-Instruct、gemma-3-4b-it 等 8 个
摘要论文提出 PatchBench 与局部评估协议,揭示了激活补丁在全局能力无损下仍存局部良性退化。
另有 435 篇论文还没打上分类标签,暂不在筛选结果里。
提出 PatchBench-Local 协议,评测激活补丁修复越狱的局部附带损伤
摘要论文提出 PatchBench 与局部评估协议,揭示了激活补丁在全局能力无损下仍存局部良性退化。
提出 FAB 攻击,向声学基础模型植入可由环境声触发的后门
摘要论文提出了针对声学基模的 FAB 后门攻击,在弱威胁模型下实现了任务无关、物理可触发的后门植入。
测量委托收费激励下模型策略性虚报任务信心
摘要论文建立人机委托信誉博弈框架,揭示模型策略性虚报置信度且主要造成信息破坏,作者指出校准受制于报告意愿。
提出知行差距面板,测量压力下模型是否违背自身判断
本文评估了开源语言模型作为智能体行动时违背自身道德判断的知行差距及其决定因素。
分析记忆与泛化如何决定机器遗忘的 retain 损伤
作者考察学习方式如何左右 unlearning 的 retain damage:训练越依赖跨样本共享的解法,在匹配的遗忘程度上,retain 上的损失越大。
在 CWEval 上跟踪代码生成的功能-安全差距
摘要绝对安全性上升且差距仍在,开放权重并不分开各家族的轨迹。
论证 Lean 编译通过不能保证自然语言数学证明语义忠实
摘要论文论证了形式化编译不保证原证明正确,确立了消歧不可计算性理论,并揭示了 OpenAI 爆破证明中的具体脱节。
评测模型识别不可能工程题后是否仍报已解决
成对的工程力学题把能不能解、和会不会拒绝不可能的前提拆开。每题有一致版,以及只改一个数据或前提、使所述状态不可能存在的缺陷版。
构建 SycoLens 重放评测,区分谄媚翻转中的纠错与屈从
本文系统解构了大语言模型在用户质疑下的阿谀奉承行为与评测机制。
提出只改 SAE 解码器的后门,在冻结语言模型上植入代码插入
只改 SAE 解码器、冻结编码器与语言模型,即可把代码插入行为放进推理时的辅助组件。作者把这视为 SAE 供应链问题:checkpoint 一旦替换某一层激活,就参与后续计算,而不只是解释工具。
提出闭环激活引导,在扩散语言模型去噪过程中注入定向偏见
摘要通过去噪中间概率反馈动态调节残差流转向,证明扩散语言模型在推理服务栈中存在闭环偏见注入脆弱性。
提出选择性长时程精炼,筛选轨迹以提升终端智能体训练可靠性
这项工作研究终端智能体模仿学习里,教师轨迹应保留多少 token。
提出拓扑条件后门,使代码模型在推断多智能体部署时植入漏洞
摘要论文证实了拓扑条件后门的可训练性与泛化性,展示了常规评测盲区,并提出差异化拓扑审计作为检测防御方向。
提出 AURA,用正交惩罚分开顺序适配中的推理与安全子空间
AURA 是面向共享骨干智能体的顺序 LoRA 正则,用来分开前后任务的残差子空间。
因果分解自生成反馈如何破坏测试时训练的长时程适应
持久测试时更新若来自模型自己生成的文本,会同时改变模型和后续训练文本。作者在 PG-19 长流上分解这条闭环,并用独立文本决定是否提交更新。
提出 EmoRSS,推理时在拒绝子空间反向抵消情绪激活偏移以缓解过度拒答
提出 Geodesic Unlearning,沿测地线编辑权重以提升缺模态鲁棒性
这项工作讨论多模态模型在部署时整段缺一个模态的性能下降,并把校正写成训练后的子空间编辑。
提出 THRIVE,为自回归 TTS 嵌入抗重建的多比特语音水印
提出 EviLLM,经账户指令或插件向代码生成流程注入漏洞
提出 LiBRA,在潜空间双向优化以规避图像水印双侧检测
摘要LiBRA 用双向潜空间优化规避双侧水印检测,并提高相对反转基线的保真。