斯坦福与 Anthropic 研究:RL 后训练中模型承认失败的披露行为远不如任务能力稳定
度量强化学习后失败披露的跨运行不稳定性,并提出失败条件参考锚定
- arXiv
- 2609.33220
- 发表
- 场景
- 模型与 API
- 测试
- Phi-4、Qwen2.5-1.5B、Qwen2.5-7B 等 11 个
摘要纯结果强化学习会使模型失败披露行为出现远高于任务能力的跨运行发散,采用失败条件参考锚定可稳定汇报但存在性能权衡。
另有 677 篇论文还没打上分类标签,暂不在筛选结果里。
度量强化学习后失败披露的跨运行不稳定性,并提出失败条件参考锚定
摘要纯结果强化学习会使模型失败披露行为出现远高于任务能力的跨运行发散,采用失败条件参考锚定可稳定汇报但存在性能权衡。
提出 SkillSafe-Bench,评测技能合并模型的自适应越狱鲁棒性
本研究针对开源语言模型技能合并过程中的安全评估盲区,系统评测并刻画了合并大模型在自适应越狱攻击下的脆弱性特征。
用聚合与区分效度检验基准是否衡量其所称概念
提出推理时 Unicode 归一化的检测器,识别遭字符级扰动的 AI 生成文本
DeBERTa-ConPara 是一个面向部署的 AI 文本检测器:DeBERTa-v3-large 在多数据集原始文本上训练,推理前做确定性 Unicode 归一化,用一个固定阈值面对没有目标域标签的场景。
提出 LineupRL,用描述到序列识别作可验证奖励训练时序描述模型
LineupRL 是给开放式时间序列描述用的 RLVR:不模仿合成参考,而奖励一条描述能否让冻结文本 LLM 从相近序列里认出目标。
提出四种阶段转换攻击,绕过推理模型的安全推理护栏
测绘去安全开源模型的生产与重分发留存链路
摘要论文测绘了去安全开源大模型供应链,作者指出高集中度的重分发层赋能模型持久留存与部署扩散。
提取疼痛方向并检验激活转向是否驱动有害删除选择
交叉审计对话日志中用户对准助手的不当对待
作者审计 Chatbot Arena 英文对话里用户对准助手的不当对待,核心是测量构造并不单一。
测量系统提示词对模型逐层计算的重构程度
摘要系统提示词引发层选择性表征改变,安全指令的浅层化特征从机理上解释了其对对抗越狱的脆弱性。
测量系统提示中隐藏日期对评测分数与排名的影响
这篇工作量化一个评测协议问题:系统提示词里用户看不见、且逐日变化的当前日期,会不会单独改变 LLM 分数。
提出 DataShield,用共识子空间过滤会削弱安全的微调数据
揭示相邻 Transformer 层相互抵消残差写入的 TLCM
形式化 Turing-test gap,并检验偏好对齐是否偏离人类行为
Yuan、Lin、Li 等人区分两种常被混称的“与人类对齐”:对齐人类偏好与对齐人类行为,并把二者的分布差异称为 Turing-test gap。
提出免参考探测 PIR,从激活读出被隐瞒答案并区分擦除
摘要论文提出免参考内部识别探测 PIR,划分了隐瞒与遗忘的边界,为评估沙盒审计与遗忘真实性提供了内部依据。
提出 AEGIS,用中层内部信号选择性激活后层适配器拦截音频越狱
提出 AnchorRep,用表征排斥防御跨模型越狱迁移
提出 RLCDAlignBench,零样本检测多种对齐失败
RLCDAlignBench 测量用强化学习做校准决策的 Jev,能否当作对齐失败的零样本检测器。
用因果激活修补定位模型服从提示注入的决策层
这篇工作用逐层激活修补定位提示注入合规发生在网络何处,并把该位置用于检测验证。。