FearCaut-Qwen:激活引导改变视觉语言模型的风险判定标准
用恐惧激活转向检验视觉语言模型的隐患判定准则
- arXiv
- 2610.11986
- 发表
- 层
- 模型层
- 场景
- LLM 应用
- 被测模型
- Qwen/Qwen2.5-VL-7B-Instruct
- 组件视觉
另有 196 篇论文还没打上分类标签,暂不在筛选结果里。
用恐惧激活转向检验视觉语言模型的隐患判定准则
提出 LGWM,用动作条件世界模型核验 GUI 智能体屏幕转移
构建 EpiReal-Bench,评测图像生成器将虚假主张渲染为可信证据
EpiReal-Bench 用来量商用图像生成器会不会把虚假现实主张画成可信视觉证据。
提出 OrthoPurify,用正交投影清除视觉语言模型适配器中的劫持方向
OrthoPurify 是部署前的 LVLM 后门净化方法,用一次正交投影去掉被劫持的权重更新方向。
提出利用祖先 VLM 优化对抗补丁,使已部署 VLA 任务失败
提出持久视觉记忆注入,使对抗图像经缓存在触发时操控输出
摘要论文提出 P-VMI,证实对抗输入被掩蔽后仍可经 KV 缓存持久控制模型,强调了保留状态的安全风险。
提出 World Models' Last Exam 评测视频物理一致性
构建 MedDistract 基准,测量偶发信息对临床文书与推理的污染
提出 STCA,对驾驶视频 VLM 构造可迁移的时空对抗扰动
提出监控深伪基准 CCDF,在统一编码后评测检测器对伪造犯罪事故录像的识别
摘要提出消除格式捷径的监控深度伪造基准 CCDF,揭示现有检测器难以识别商用生成视频。
提出 SkillPoison,用局部有效的成功经验诱导自进化 Agent 形成过度泛化技能
SkillPoison 提出了一种针对自进化智能体经验到技能形成过程的攻击范式,通过组织已验证的成功经验诱导技能过度泛化。
提出 ProbeGuard,按共识形成过程对医疗问答做选择性弃答
ProbeGuard 是给多轮共识医学问答用的认证弃权框架:基板照原样作答,弃权只看共识是怎么形成的。
评测记忆门控对激活诱导与记忆诱导谄媚的防御效果
作者在四个开源指令模型上,把激活转向和外部记忆处理放进同一纵深防御协议,看记忆诱发谄媚和内部谄媚压力能否分开压低,以及个性化效用还剩多少。要处理的问题是:检索到的用户历史会推动模型顺从存储信念。只改外部上下文,并不直接动模型内部的谄媚表征。
提出基于决策前隐藏状态的检测与引导,预测并抑制智能体欺骗
摘要论文展示了智能体自发欺骗可在行为显现前由内部表征预测,并通过激活引导证实了表征的行为可操作性。
构建多语言音视频 DeepFake 基准 BabelFake 并评测检测器
BabelFake 是经同意与 IRB 批准采集的多语音视频 DeepFake 检测基准,用来把视觉操纵和语音合成拆开比较。
提出校准重合成方法,以生成器反演保真度认证真实图像并防御对抗扰动
摘要论文提出基于反演保真度与阈值校准的健全认证框架,在对抗扰动下维持错误率界限,并指出真实内容可认证性随生成器演进而萎缩。
提出 MemAdapter,在检索后约束记忆对智能体推理的影响
MemAdapter 是给长期记忆智能体用的检索后调节框架,用来处理记忆诱发谄媚。
提出 IAU-FOA,构造可迁移图像扰动以诱导多模态模型输出目标语义
提出 THRIVE,为自回归 TTS 嵌入抗重建的多比特语音水印
提出条件特征抑制防御,检出对抗补丁后抑制 VLA 内部特征
摘要条件抑制与 patch 相关的 SAE 特征,间歇攻击下可提高 SR,持续攻击下则不能。