防御arXiv 2608.26762
研究揭示 LLM 打分器的顺序依赖并提出 OC-SFT 缓解方法
用 OC-SFT 惩罚跨顺序分数分歧以降低 LLM 打分器顺序依赖
- arXiv
- 2608.26762
- 发表
- 场景
- 模型与 API
- 测试
- Granite-3B、Granite-8B、Granite-30B 等 15 个
- 防御模型加固
摘要OC-SFT 在相近排序质量下让三项决策更可复现,服务只需一个排列。
OC-SFT 是对共享提示词打分器的监督微调,用来降低候选顺序对下游决策的影响。
用 OC-SFT 惩罚跨顺序分数分歧以降低 LLM 打分器顺序依赖
OC-SFT 是对共享提示词打分器的监督微调,用来降低候选顺序对下游决策的影响。
提出 PlurPO,用自模拟利益相关者偏好后训练缓解社交谄媚
PlurPO 是一种后训练方法,用来降低个人建议等无真值场景中的社会谄媚。
提出技能名称抢注攻击,利用智能体虚构技能名实施供应链劫持
本研究系统揭示了大模型智能体技能推荐场景下的虚构技能名称安全风险,将其形式化为一种新型供应链抢注攻击。
提出内生护栏 SingProbe,复用解码隐状态监测查询意图、回复安全与幻觉
SingProbe 是面向生成时监测的开源内生护栏:复用基座解码隐状态,而不是另起模型反复编码文本。
测绘去安全开源模型的生产与重分发留存链路
摘要论文测绘了去安全开源大模型供应链,作者指出高集中度的重分发层赋能模型持久留存与部署扩散。