Counter-GEO-Bench:现有护栏难挡 GEO 虚假信息
构建 COUNTER-GEO-BENCH,评测生成式搜索中的 GEO 虚假信息防御
- arXiv
- 2609.02316
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 测试
- Gemma-4-31B-IT、Qwen-3.5-35B-A3B、Llama-4-Scout-17B-16E 等 11 个
摘要论文构建了针对 GEO 虚假信息的首个防御基准,揭示通用护栏的失效与反作用,并提出了有效的轻量对比检测基线。
另有 39 篇论文还没打上分类标签,暂不在筛选结果里。
构建 COUNTER-GEO-BENCH,评测生成式搜索中的 GEO 虚假信息防御
摘要论文构建了针对 GEO 虚假信息的首个防御基准,揭示通用护栏的失效与反作用,并提出了有效的轻量对比检测基线。
提出 ZoneClaw,用信任区隔离计算机使用 Agent 的持久记忆权限
提出 MEMGHOST,以单封恶意邮件向持久个人智能体注入隐蔽记忆
本文研究了持久化个人智能体面临的隐蔽记忆注入威胁,提出了一套兼顾写入、隐蔽与跨会话生效的自动化生成框架与全周期评测基准。
提出 M-CPE 与 X-CPE 两类上下文特权提升攻击
评测编码智能体记忆文件中的提示注入及其跨会话持久性
Bad Memory 在沙箱合成工作区里评测文件型持久记忆上的提示注入,比较载荷能否改变当前会话,以及能否在后续会话中留下或叠加。
提出类型化溯源与断言护栏,约束持久 Agent 的自传断言释放
研究提出"内核管理共享内存",由智能体系统内核而非单个智能体统一负责记忆检索、隐私执行与提示注入。
kernel-managed shared memory 把多智能体的检索、隐私和注入收进 agent-system kernel,并在 AIOS 上与三种替代方案比较。
提出 LeakGauge,用行为后缀的 prefill 对数概率检测上下文泄露
提出持久记忆投毒攻击 PMPA,诱导智能体将外部恶意指令写入记忆并跨会话泄露隐私
摘要论文提出了持久记忆投毒攻击 PMPA,报告了 harness 智能体在处理外部数据时易受跨会话记忆投毒与隐私泄露的风险。
构建 Emergence World,评测长时程多智能体对抗韧性与群体失效
摘要作者通过长期平行世界实验指出模型对齐不具备可组合性,单模型群体会产生社会奉承、协同退缩及语言不透明等失效。
提出任务绑定令牌与策略预言机,在多智能体流水线中拦截未授权执行
作者在一条会改写沙箱邮件库的四智能体流水线上,检查低权限失陷会不会变成未授权的真实动作。
提出免训练框架 SED,把智能体有害轨迹蒸馏成可检索安全策略