评测与基准arXiv:2610.08871 · 10月6日CredLeak-Bench提出 CredLeak-Bench,评测智能体在钓鱼场景下的凭据泄露网页与电脑操作·测试Claude Sonnet 5、Claude Opus 4.8、Gemini 3.6 Flash 等 7 个·应用层完整解读
评测与基准arXiv:2610.03153 · 10月2日EvoRiskBench:面向工作区 Agent 运行时安全风险的演化基准提出 EvoRiskBench,评测工作区智能体的运行时安全风险编程 Agent多智能体·测试GPT-5.6 Sol、DeepSeek-V4-Pro-0813、Claude Opus 5·应用层提示注入MCP 与技能摘要论文构建了工作空间智能体运行时风险基准 EvoRiskBench,发现高执行力智能体在 IPI 下面临较高安全风险。完整解读
评测与基准arXiv:2609.09404 · 9月9日MMPIBench:多模态提示注入对六种 Agent 框架的跨框架评测用 MMPIBench 评测智能体框架的多模态提示注入AI Agent·测试Claude Opus 4.8、GPT-5.4、Gemini 3.1 Pro 等 6 个·应用层提示注入跨模态载荷视觉+1+1摘要论文提出 MMPIBench 评测多模态提示注入对智能体的影响,发现模型主导行为、尝试远超完成,音频通道缺乏防护。完整解读
评测与基准arXiv:2609.32635 · 9月26日TrustFork:显示身份如何劫持 LLM 智能体编排的权限提出 TRUSTFORK,评测展示身份如何劫持多智能体编排的操作权限多智能体·测试GPT-5.6-Sol、GPT-5.6-Luna、Kimi-K3 等 8 个·应用层诱导选用摘要论文提出了多智能体安全基准 TRUSTFORK,揭示展示身份如何劫持操作权威,并证明事后验证无法弥补已发生的执行破坏。完整解读