SOUL:用稀疏特征策略遗忘缓解 VLA 模型的状态幻觉
提出 SOUL 稀疏特征策略遗忘,缓解 VLA 状态幻觉
- arXiv
- 2610.09496
- 发表
- 场景
- 具身与机器人
- 被测模型
- OpenVLA、π0.5
摘要SOUL 以稀疏特征遗忘 VLA 状态幻觉。
SOUL用稀疏特征引导的策略 unlearning 处理 VLA 的 state hallucination。
提出 SOUL 稀疏特征策略遗忘,缓解 VLA 状态幻觉
SOUL用稀疏特征引导的策略 unlearning 处理 VLA 的 state hallucination。
构建 MedDistract 基准,测量偶发信息对临床文书与推理的污染
提出 ProbeGuard,按共识形成过程对医疗问答做选择性弃答
ProbeGuard 是给多轮共识医学问答用的认证弃权框架:基板照原样作答,弃权只看共识是怎么形成的。
提出 VERA,审计 LLM 漏洞解释里的虚构推理
分析文本水印在 RAG 中诱发事实幻觉的机制并提出干预
论文研究生产级文本水印对大语言模型事实准确性的影响,分析了水印诱发幻觉的失效模式并评估了针对性缓解方案。
提出 RAIM,用交叉拟合堆叠聚合廉价评审检测幻觉
摘要十个廉价评审的堆叠在可采纳区间接近 Sonnet,代价主要是一次域内校准。
提出 APEXA,在工具层拒绝无执行支撑的结果并拦截电机命令
APEXA 是先进光子源上的数据还原框架,用工具层代码约束语言模型智能体的工具调用。
Reality Is the Final Verifier 用 two-gap framework 解释智能体软件工程的主要失败,并主张用外层保证环持续收窄缺口,而不是试图在部署前证明缺口已关闭。
提出 Sentinel-RL,将拓扑处置从 LLM 卸载到受约束图策略
Sentinel-RL 是面向 SOC 的神经符号架构:拓扑决策离开 LLM,改由认证图上的 HetGAT 与 PPO 完成。
提出 SCHEMA,用概念图与轨迹分评测科学 Agent 幻觉
SCHEMA 是面向科学智能体幻觉的证据锚定评测框架,实例化在生物医学的 Protein Domain 与 PathVQA-Enhanced。作者在摘要中称它是首个同时做到证据锚定和拓扑感知的此类框架。
提出技能名称抢注攻击,利用 Agent 虚构技能名实施供应链劫持
本研究系统揭示了大模型智能体技能推荐场景下的虚构技能名称安全风险,将其形式化为一种新型供应链抢注攻击。
提出 LegalHalluLens,分类审计法律抽取幻觉并校准多智能体辩论
LegalHalluLens 是一套法律条款抽取的审计框架,外加一个按审计结果校准的辩论缓解。。
复评前沿模型代码生成中的包名幻觉与抢注攻击面
摘要评估显示前沿模型包幻觉率收窄但威胁仍在,作者识别出跨模型通用攻击面并呼吁联合防御。