防御arXiv 2610.02999
OmniConfess:用 Token 级「忏悔」缓解全模态幻觉
提出 OmniConfess,冻结候选并按通道重打分以缓解全模态幻觉
- arXiv
- 2610.02999
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 被测模型
- Qwen2.5-Omni-7B、Qwen3-Omni-30B-A3B、Nemotron-3-Nano-Omni-30B
提出 OmniConfess,冻结候选并按通道重打分以缓解全模态幻觉
提出训练无关的 SECRET,对问题表征做源条件转向以缓解音视频模型幻觉
SECRET 是一种训练无关的问题状态转向方法,用来减轻 AVLLM 的 source-confused grounding hallucination。
测量合成审稿训练导致的科学判断坍缩并提出 TrustReviewer 缓解
摘要一步递归里合成审稿会收窄判断。
提出 GeoSteer,把保范数激活引导做成球面测地线优化
用 Gram 逆校正多价值激活转向,抑制多元对齐的跨维溢出
提出 TRIM,在黑盒推理时定位并净化图像后门区域
提出 MROP,在发射端推理时纯化输入以抵御训练投毒后门
MROP 是 deep JSCC 无线图像传输上的推理时输入纯化,对象是矩形补丁后门。
提出 SPAR 以分离注意力结构偏置并重分配视觉注意力,减轻多模态幻觉
SPAR 是一种免训练的 MLLM 推理时干预,用来把注意力里的结构偏置和语义视觉信号分开。
提出 SecureForge,在推理时优化系统提示以减少编码智能体的代码弱点
SecureForge是一条只用 API 和静态分析、在推理时加固编码模型的流水线。