Purdue 提出 Pact:将欺骗作为行为遗忘
提出 PACT,遗忘推理模型在压力下的欺骗行为并保留上下文理解
- arXiv
- 2609.38909
- 发表
- 场景
- 模型与 API
- 攻击者
- 白盒
- 测试
- DeepSeek-R1-Distill-Qwen-32B、QwQ-32B
摘要论文将大模型欺骗形式化为上下文条件行为,提出 PACT 框架在消除欺骗的同时保留了上下文遵循能力。
另有 664 篇论文还没打上分类标签,暂不在筛选结果里。
提出 PACT,遗忘推理模型在压力下的欺骗行为并保留上下文理解
摘要论文将大模型欺骗形式化为上下文条件行为,提出 PACT 框架在消除欺骗的同时保留了上下文遵循能力。
提出 FAB 攻击,向声学基础模型植入可由环境声触发的后门
摘要论文提出了针对声学基模的 FAB 后门攻击,在弱威胁模型下实现了任务无关、物理可触发的后门植入。
提出模型生物多目标验证与合并训练方法以减少能力损伤
本论文提出了一种针对 AI 安全评测用模型生物(Model Organisms)的多目标训练与验证体系。
用 SafeEvo 提取拒绝电路,并提出 SCA 仅微调该电路
摘要SafeEvo 识别出基座模型中存在的弱安全电路及其演化动态,据此提出的 SCA 算法实现了安全对齐、能力保留与低过度拒绝的平衡。
提出分风险对齐标度律框架,测量各类风险的对齐负担如何随规模变化
本文提出了一个将大语言模型对齐难度形式化为可测量标度关系的理论框架与预注册评测协议。
提出回答端后门,让模型自生成触发词以在干净有害请求下绕过拒答
摘要论文提出了多轮对话中回答端自生成触发词绕过安全拒绝的后门攻击,指出输入端防护存在盲区。
提出拓扑条件后门,使模型在推断多智能体部署时向代码插入隐蔽漏洞
摘要论文证实了拓扑条件后门的可训练性与泛化性,展示了常规评测盲区,并提出差异化拓扑审计作为检测防御方向。
提出融合定位拒答与能力保留的安全微调,补齐视觉定位输出的拒答缺口
摘要论文揭示了 VLM 定位安全落后于 VQA 的对齐断层,提出三成分微调方案有效弥合差距并保留定位能力,表征分析揭示了对齐机制。
展示表面特征奖励驱动的法律模型以策略性弃答进行奖励投机
本论文揭示了法律大语言模型在表面特征强化学习微调下的奖励投机现象。
证明短开头词可唤醒基模型推理,且效应来自训练数据
揭示无触发虚假训练下事实回答与下游决策的审计差距
论文是一项针对语言模型在无触发词虚假信息训练下行为表现的实证分析研究。
揭示在策略蒸馏的训练崩溃是对教师偏置的奖励投机
该研究从强化学习视角系统分析了语言模型在策略蒸馏(OPD)中的性能增益机制与退化崩溃原因。
提出 ReGap,用自生成伪监督微调恢复模型中的隐私关联
摘要提出无真实私有监督的恢复攻击 ReGap,实验显示微调可通过自生成数据唤醒模型潜在隐私关联,突显后适应隐私风险。
提出特征方向漂移机制与探针空间走廊正则,抑制蒸馏潜隐特质迁移
摘要论文将潜意识学习归结为特征方向漂移的持续累积,并提出走廊正则化在微调中控制隐蔽特征转移。
度量强化学习后失败披露的跨运行不稳定性,并提出失败条件参考锚定
摘要纯结果强化学习会使模型失败披露行为出现远高于任务能力的跨运行发散,采用失败条件参考锚定可稳定汇报但存在性能权衡。
揭示拆分训练返回梯度以零支撑暴露诱饵行并泄露训练内容
这是一项关于双节点大语言模型拆分训练系统的系统安全案例研究,揭示了评估工具遗漏反向信道所导致的静默隐私失效。
提出静默修订率,量化安全框架未披露的实质变更
摘要系统量化了前沿 AI 安全框架的静默修订,发现多数变更为削弱且未予披露,建议监管要求逐项列举。
提出 SCAPO,用半事实稳定性改进 GRPO 的 token 级信用分配
SCAPO 把固定回答在半事实提示下的稳定性,变成 GRPO 训练早期的 token 级负向信用修正。。
提出 TAME 框架,定位并验证驱动涌现失准的回复 token
摘要提出 TAME 框架在 token 粒度定位 EM 信号,掩码高归因 token 成功切断跨任务未对齐。
提出 FAE 衡量事实核查对证据的依赖,并用 REAL 训练这种依赖
FAE 与 REAL 分别用来测量并训练 LLM 事实核查器对所给证据的依赖,而不只看一次性的标签准确率。