LGWM:用动作条件世界模型验证 GUI 智能体的屏幕转移
提出 LGWM,用动作条件世界模型核验 GUI 智能体屏幕转移
- arXiv
- 2610.11942
- 发表
- 层
- 应用层
- 场景
- 网页与电脑操作
- 被测模型
- LGWM
另有 194 篇论文还没打上分类标签,暂不在筛选结果里。
提出 LGWM,用动作条件世界模型核验 GUI 智能体屏幕转移
提出 LTBD,用可学习分隔符隔离可信指令与不可信数据
LTBD 是一种不改基座权重的提示注入防御:只学习用来标出可信指令与不可信数据边界的四个 token 嵌入。
提出 OrthoPurify,用正交投影清除视觉语言模型适配器中的劫持方向
OrthoPurify 是部署前的 LVLM 后门净化方法,用一次正交投影去掉被劫持的权重更新方向。
提出 SOUL 稀疏特征策略遗忘,缓解 VLA 状态幻觉
SOUL用稀疏特征引导的策略 unlearning 处理 VLA 的 state hallucination。
提出 CARE 框架,在误分类风险约束下减少人机协作的人工查询
CARE 是面向人机协同二分类的端到端流水线,要在误分类风险不超过用户容忍的前提下减少人类查询。设定是 i.i.d.数据流、人类 oracle 标签正确、AI 为任意黑盒概率分类器。
提出 ProbeGuard,按共识形成过程对医疗问答做选择性弃答
ProbeGuard 是给多轮共识医学问答用的认证弃权框架:基板照原样作答,弃权只看共识是怎么形成的。
评测记忆门控对激活诱导与记忆诱导谄媚的防御效果
作者在四个开源指令模型上,把激活转向和外部记忆处理放进同一纵深防御协议,看记忆诱发谄媚和内部谄媚压力能否分开压低,以及个性化效用还剩多少。要处理的问题是:检索到的用户历史会推动模型顺从存储信念。只改外部上下文,并不直接动模型内部的谄媚表征。
提出基于决策前隐藏状态的检测与引导,预测并抑制智能体欺骗
摘要论文展示了智能体自发欺骗可在行为显现前由内部表征预测,并通过激活引导证实了表征的行为可操作性。
提出校准重合成方法,以生成器反演保真度认证真实图像并防御对抗扰动
摘要论文提出基于反演保真度与阈值校准的健全认证框架,在对抗扰动下维持错误率界限,并指出真实内容可认证性随生成器演进而萎缩。
提出临时可见性协议,限制持续摄入 RAG 向量库的投毒暴露
这篇工作给持续摄入的 RAG 向量库一个失败关闭的临时可见性协议,把协议能限制的未核验暴露和依赖检测器的中毒暴露分开。
提出 AURA,用正交惩罚分开顺序适配中的推理与安全子空间
AURA 是面向共享骨干智能体的顺序 LoRA 正则,用来分开前后任务的残差子空间。
提出 MemAdapter,在检索后约束记忆对智能体推理的影响
MemAdapter 是给长期记忆智能体用的检索后调节框架,用来处理记忆诱发谄媚。
分析文本水印在 RAG 中诱发事实幻觉的机制并提出干预
论文研究生产级文本水印对大语言模型事实准确性的影响,分析了水印诱发幻觉的失效模式并评估了针对性缓解方案。
提出检测、结构化与 GSPO 流程,降低共识生成的提示注入错位
这是一篇把 LLM 数字孪生放进增强民主的博士论文,分个体表示、政党聚合和共识生成的提示注入三章。
提出 THRIVE,为自回归 TTS 嵌入抗重建的多比特语音水印
提出 COVER,用干预门判定 Agent 规则谓词能否自动执行
这篇工作测的是智能体验证器在检查之前的分流:外部规则里的哪条谓词能用固定过程解决,哪条必须交给评审。
提出条件特征抑制防御,检出对抗补丁后抑制 VLA 内部特征
摘要条件抑制与 patch 相关的 SAE 特征,间歇攻击下可提高 SR,持续攻击下则不能。
提出 OmniConfess,冻结候选并按通道重打分以缓解全模态幻觉
提出 ASA 与 AttestMCP,度量并降低 LLM 对输入序列扰动的敏感
提出 MIRROR,用多路径摘要多数表决保障多智能体通信完整性
MIRROR 是 LLM 多智能体通信层上的多路径法定人数完整性原语,只处理不透明字节,不解释消息内容。要处理的是 Agent-in-the-Middle:中介合法终结 TLS 后可改在途消息,而语义校验有推理开销和误拦,签名又要求私钥管理。做法是生成结束后复制同一规范化载荷。