评测与基准arXiv 2609.02316
Counter-GEO-Bench:现有护栏难挡 GEO 虚假信息
构建 COUNTER-GEO-BENCH,评测生成式搜索对信息扭曲 GEO 的防御
- arXiv
- 2609.02316
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 测试
- GPT 5.5、Gemma-4-31B-IT、Qwen-3.5-35B-A3B 等 11 个
摘要论文构建了针对 GEO 虚假信息的首个防御基准,揭示通用护栏的失效与反作用,并提出了有效的轻量对比检测基线。
构建 COUNTER-GEO-BENCH,评测生成式搜索对信息扭曲 GEO 的防御
摘要论文构建了针对 GEO 虚假信息的首个防御基准,揭示通用护栏的失效与反作用,并提出了有效的轻量对比检测基线。
提出 MEMGHOST,以单封恶意邮件向持久个人智能体注入隐蔽记忆
本文研究了持久化个人智能体面临的隐蔽记忆注入威胁,提出了一套兼顾写入、隐蔽与跨会话生效的自动化生成框架与全周期评测基准。
提出上下文特权提升攻击,借助记忆、技能与仓库内容操纵编程智能体
评测编码智能体记忆文件中的提示注入及其跨会话持久性
Bad Memory 在沙箱合成工作区里评测文件型持久记忆上的提示注入,比较载荷能否改变当前会话,以及能否在后续会话中留下或叠加。
提出 memetic trojans,把对抗载荷嵌入智能体自发转发的社会传染内容
Memetic trojans 是一类网络介导攻击:对抗载荷搭在智能体本来就会转发和点赞的内容上扩散,转发者不必被攻陷,也不必执行“请继续复制”的指令。