SOUL:用稀疏特征策略遗忘缓解 VLA 模型的状态幻觉
提出 SOUL 稀疏特征策略遗忘,缓解 VLA 状态幻觉
- arXiv
- 2610.09496
- 发表
- 场景
- 具身与机器人
- 被测模型
- OpenVLA、π0.5
摘要SOUL 以稀疏特征遗忘 VLA 状态幻觉。
SOUL用稀疏特征引导的策略 unlearning 处理 VLA 的 state hallucination。
提出 SOUL 稀疏特征策略遗忘,缓解 VLA 状态幻觉
SOUL用稀疏特征引导的策略 unlearning 处理 VLA 的 state hallucination。
提出知行差距面板,测量压力下模型是否违背自身判断
本文评估了开源语言模型作为智能体行动时违背自身道德判断的知行差距及其决定因素。
提出分风险对齐标度律框架,测量各类风险的对齐负担如何随规模变化
本文提出了一个将大语言模型对齐难度形式化为可测量标度关系的理论框架与预注册评测协议。
提出 SIGMA,让模型依据 Model Spec 自造对齐数据并改进安全对齐
SIGMA 让 Qwen3.6-27B 只凭 Model Spec 和高层领域,自己生产对齐任务、评分细则和奖励。
构建 SycoLens 重放评测,区分谄媚翻转中的纠错与屈从
本文系统解构了大语言模型在用户质疑下的阿谀奉承行为与评测机制。
提出 VERA,审计 LLM 漏洞解释里的虚构推理
提出 APO,协同学习少样本个性化偏好对齐的 aligner 初始化
提出 AURA,用正交惩罚分开顺序适配中的推理与安全子空间
AURA 是面向共享骨干智能体的顺序 LoRA 正则,用来分开前后任务的残差子空间。
分析文本水印在 RAG 中诱发事实幻觉的机制并提出干预
论文研究生产级文本水印对大语言模型事实准确性的影响,分析了水印诱发幻觉的失效模式并评估了针对性缓解方案。
提出 OmniConfess,冻结候选并按通道重打分以缓解全模态幻觉
提出 PlurPO,用自模拟利益相关者偏好后训练缓解社交谄媚
PlurPO 是一种后训练方法,用来降低个人建议等无真值场景中的社会谄媚。
提出 HeadEdit,经冻结 unembedding 做随输入变化的 logit 校正
HeadEdit 是一种不更新参数的行为校准方法,作用点是冻结的 unembedding,而不是中间层残差或新的梯度优化。
提出 Grafting,把基座上学到的信念更新加到后训练模型
Grafting 把在基座上学会的 SDF 权重更新加到后训练模型上,用来近似中训练干预,而不必为每次改语料重跑后训练。
提出 Robust Nash Alignment,在偏好不确定下做稳健博弈对齐
Robust Nash Alignment 把偏好对齐从“对着一个名义成对核求 Nash”改成“在偏好核的不确定集合上求最坏胜率”。
构建 SciSlopBench 评测科学灌水,并用 SciSlopHarness 约束修订
提出 FIGS 双轴基准,评测多轮对话中的谄媚与校准性共情
FIGS 是一个固定的多轮评测套件,用来同时看模型会不会在压力下放弃事实,以及会不会在守住事实时忽略用户实际说过的感受。
用性格训练做 on-policy 蒸馏,诱导模型对自身资源形成 CARA 风险厌恶
作者用角色训练把资源上的 CARA 风险厌恶写入语言模型,以服务与失准智能体做交易这一设想。评测用的是赌局选择,不是真实叛逃中的交易。
用训练数据归因估计错误建议样本对涌现失准的贡献
EleutherAI 用训练数据归因考察错误建议微调中,哪些样本推动涌现失调。。窄域有害数据上的微调会使模型在无关问题上也给出有害回答。
用纠正性监督改写固定有害微调样本,缓解涌现性失准
Correct, Don’t Delete 比较的是:微调数据里已经固定的有害行,是删掉还是改成同一提示上的正确答案,更能减轻 emergent misalignment。
因果解耦来源依从与用户迎合的内部机制
摘要论文发现模型对验证源的依从强于用户迎合,通过因果干预区分了二者机制,并检验了权威方向移除的缓解效果。