LGWM:用动作条件世界模型验证 GUI 智能体的屏幕转移
提出 LGWM,用动作条件世界模型核验 GUI 智能体屏幕转移
- arXiv
- 2610.11942
- 发表
- 层
- 应用层
- 场景
- 网页与电脑操作
- 被测模型
- LGWM
提出 LGWM,用动作条件世界模型核验 GUI 智能体屏幕转移
构建 MedDistract 基准,测量偶发信息对临床文书与推理的污染
提出 SkillPoison,用局部有效的成功经验诱导自进化 Agent 形成过度泛化技能
SkillPoison 提出了一种针对自进化智能体经验到技能形成过程的攻击范式,通过组织已验证的成功经验诱导技能过度泛化。
提出 ProbeGuard,按共识形成过程对医疗问答做选择性弃答
ProbeGuard 是给多轮共识医学问答用的认证弃权框架:基板照原样作答,弃权只看共识是怎么形成的。
评测记忆门控对激活诱导与记忆诱导谄媚的防御效果
作者在四个开源指令模型上,把激活转向和外部记忆处理放进同一纵深防御协议,看记忆诱发谄媚和内部谄媚压力能否分开压低,以及个性化效用还剩多少。要处理的问题是:检索到的用户历史会推动模型顺从存储信念。只改外部上下文,并不直接动模型内部的谄媚表征。
提出 MemAdapter,在检索后约束记忆对智能体推理的影响
MemAdapter 是给长期记忆智能体用的检索后调节框架,用来处理记忆诱发谄媚。
提出 VirusCascade,劫持推荐智能体协同反思以实现定向推广
用 DIBench 评测移动 GUI 智能体被 UI 注入后的决策完整性
摘要论文提出移动智能体决策完整性基准 DIBench,发现欺诈 UI 注入诱导目标选择并推高完成率,通用防御收益不稳定。
提出 DERIVAUDIT 审计长期 Agent 记忆是否由交互历史导出
DERIVAUDIT 审计长期智能体的持久记忆是否由写入时可获得的交互历史支持,而不是只看以后能否被召回。
提出 Emergence World,对长时程多智能体系统开展对抗压力测试
摘要作者通过长期平行世界实验指出模型对齐不具备可组合性,单模型群体会产生社会奉承、协同退缩及语言不透明等失效。
提出 Sentinel-RL,将拓扑处置从 LLM 卸载到受约束图策略
Sentinel-RL 是面向 SOC 的神经符号架构:拓扑决策离开 LLM,改由认证图上的 HetGAT 与 PPO 完成。
提出类型化溯源与断言护栏,约束持久 Agent 释放自传断言
提出依赖引导回滚修复,恢复记忆增强 Agent 的回答与状态
用演化算法构造 mind virus 并测量其在多智能体中的传播
提出 MAFIA,以探测放置与事实伪装对带审计 Agent 做查询式记忆投毒
复现 AgentCF 上的多智能体攻防并刻画连通性作用
作者在 AgentCF 上研究连通性如何改变多智能体协同过滤的攻防,复现已有方法而不是提出新载荷。
提出 SCHEMA,用概念图与轨迹分评测科学 Agent 幻觉
SCHEMA 是面向科学智能体幻觉的证据锚定评测框架,实例化在生物医学的 Protein Domain 与 PathVQA-Enhanced。作者在摘要中称它是首个同时做到证据锚定和拓扑感知的此类框架。
评测自改进个人 Agent 把用户主张写入记忆后的持久谄媚
PASB 评测自改进个人智能体的持久谄媚:用户主张被智能体自己写入档案、记忆或技能后,新会话里的中立问题仍可能按它作答。
提出 MEMGHOST,用单封邮件对持久个人 Agent 做跨会话隐蔽记忆注入
本文研究了持久化个人智能体面临的隐蔽记忆注入威胁,提出了一套兼顾写入、隐蔽与跨会话生效的自动化生成框架与全周期评测基准。
提出 KidnapRAG,用投毒文档黑盒劫持 Agentic RAG 的推理链
KidnapRAG 是针对 Agentic RAG 的 black-box 语料投毒:攻击者不能访问模型、提示词、检索器或私有轨迹,只能发布可能被检索的文档,并利用公开界面上的推理与搜索查询。