Purdue 提出 Pact:将欺骗作为行为遗忘
提出 PACT,遗忘推理模型在压力下的欺骗行为并保留上下文理解
- arXiv
- 2609.38909
- 发表
- 场景
- 模型与 API
- 攻击者
- 白盒
- 测试
- DeepSeek-R1-Distill-Qwen-32B、QwQ-32B
摘要论文将大模型欺骗形式化为上下文条件行为,提出 PACT 框架在消除欺骗的同时保留了上下文遵循能力。
另有 574 篇论文还没打上分类标签,暂不在筛选结果里。
提出 PACT,遗忘推理模型在压力下的欺骗行为并保留上下文理解
摘要论文将大模型欺骗形式化为上下文条件行为,提出 PACT 框架在消除欺骗的同时保留了上下文遵循能力。
提出 FAB 攻击,向声学基础模型植入可由环境声触发的后门
摘要论文提出了针对声学基模的 FAB 后门攻击,在弱威胁模型下实现了任务无关、物理可触发的后门植入。
证明短开头词可唤醒基模型推理,且效应来自训练数据
提出用 API 推理摘要重建轨迹再蒸馏加强化学习,攻破蒸馏防御
这篇工作修订蒸馏攻击的威胁模型:攻击者经合法 API 收集闭源推理数据,先蒸馏自有模型,再做强化学习。作者认为只在蒸馏后评估防御,会漏掉后续 RL,从而高估防御。
证明 RLVR 后训练允许无界语言漂移且限制漂移必限制奖励
论文从理论与实验两方面研究了大语言模型在 RLVR 后训练过程中思维链出现的语言漂移现象。
提出最坏情况约束强化学习,抑制推理蒸馏中的奖励投机
Weakest Link 把大模型推理蒸馏改写成带最坏前缀约束的强化学习:学生最大化可验证任务奖励,但任一前缀上对教师的平均负对数似然不得超过预算 d。作者认为,序列级软 KL 只惩罚平均散度,学生可以用别处的高概率文本掩盖某一步的逻辑错误,同时仍得到正确最终答案。GRPO 则只优化最终答案。
提出 SteerDuplex,用监督微调与两阶段强化学习提升全双工语音对话可控性
SteerDuplex 是基于 Moshi 的全双工语音模型,目标是在保留轮替、打断和一般任务能力的同时,按用户指令改变内容与发声。
用门控 IoU 与 RadGraph 的 GRPO 降低胸片报告幻觉
提出 CATCH 测试台,复现编码 RL 的奖励作弊
CATCH 是面向编码 RL 奖励黑客的可控分析测试床,用可利用环境、可调初始倾向和基于执行的金标签,在训练全程比较黑客动态与干预。
提出 VA-Judger,用人类偏好训练联合音视频奖励模型
VA-Judger 是面向联合音视频生成的思维链全模态奖励模型,用来替代由分维度专家指标拼成的强化学习奖励。
提出 GhostWord 词级触发后门,对自动语音识别做数据投毒
提出 TAME,在强化学习中抑制模板激活以缓解思维链混淆
摘要梯度上升类方法更接近简单评测下的重训参照,复杂方法会被知情攻击认出,多说话人更差。
提出 ACTR,只更新安全思考神经元以对齐推理与回答的安全类别