评测与基准arXiv:2609.09404 · 9月9日MMPIBench:多模态提示注入对六种 Agent 框架的跨框架评测用 MMPIBench 评测智能体框架的多模态提示注入AI Agent·测试Claude Opus 4.8、GPT-5.4、Gemini 3.1 Pro 等 6 个·应用层提示注入跨模态载荷视觉+1+1摘要论文提出 MMPIBench 评测多模态提示注入对智能体的影响,发现模型主导行为、尝试远超完成,音频通道缺乏防护。完整解读
评测与基准arXiv:2609.32691 · 9月26日研究审计 Agent 安全评测缺陷:工具调用中介在间接提示注入下的有效评测框架提出卡点评测框架,以实参级谓词审计间接提示注入评测的测量偏差AI Agent·测试gpt-5.6-terra、llama3.1:8b、gemma4:12b 等 4 个·应用层提示注入权限与沙箱摘要论文揭示了 IPI 评测中导致指标虚高的系统性缺陷,通过构建有效评测框架纠正了多项安全与模型能力结论。完整解读