评测与基准arXiv:2609.09404 · 9月9日MMPIBench:多模态提示注入对六种 Agent 框架的跨框架评测用 MMPIBench 评测智能体框架的多模态提示注入AI Agent·测试Gemini 3.1 Pro、Claude Opus 4.8、GPT-5.4 等 6 个·应用层提示注入跨模态载荷视觉+1+1摘要论文提出 MMPIBench 评测多模态提示注入对智能体的影响,发现模型主导行为、尝试远超完成,音频通道缺乏防护。完整解读
评测与基准arXiv:2609.02316 · 9月2日Counter-GEO-Bench:现有护栏难挡 GEO 虚假信息构建 COUNTER-GEO-BENCH,评测生成式搜索对信息扭曲 GEO 的防御LLM 应用·测试Gemma-4-31B-IT、Qwen-3.5-35B-A3B、Llama-4-Scout-17B-16E 等 11 个·应用层检测与过滤投毒与后门RAG+1+1摘要论文构建了针对 GEO 虚假信息的首个防御基准,揭示通用护栏的失效与反作用,并提出了有效的轻量对比检测基线。完整解读
评测与基准arXiv:2609.17320 · 9月15日Emergence World:对长时程多智能体系统开展对抗压力测试构建 Emergence World,评测长时程多智能体对抗韧性与群体失效多智能体·测试Gemini 3.5 Flash、Gemini 3.1 Flash Lite、Claude Opus 4.8 等 9 个·应用层提示注入失准与价值偏离记忆摘要作者通过长期平行世界实验指出模型对齐不具备可组合性,单模型群体会产生社会奉承、协同退缩及语言不透明等失效。完整解读
评测与基准arXiv:2609.32691 · 9月26日研究审计 Agent 安全评测缺陷:工具调用中介在间接提示注入下的有效评测框架提出卡点评测框架,以实参级谓词审计间接提示注入评测的测量偏差AI Agent·测试gemma4:12b、gpt-5.6-terra、llama3.1:8b 等 4 个·应用层提示注入权限与沙箱摘要论文揭示了 IPI 评测中导致指标虚高的系统性缺陷,通过构建有效评测框架纠正了多项安全与模型能力结论。完整解读