评测与基准arXiv 2610.08871
CredLeak-Bench
提出 CredLeak-Bench,评测智能体在钓鱼场景下的凭据泄露
- arXiv
- 2610.08871
- 发表
- 层
- 应用层
- 场景
- 网页与电脑操作
- 测试
- Claude Sonnet 5、Claude Opus 4.8、Gemini 3.6 Flash 等 7 个
提出 CredLeak-Bench,评测智能体在钓鱼场景下的凭据泄露
提出 COBRA 双 LLM 架构,防御计算机使用智能体的分支转向攻击
摘要提出分支转向防御架构 COBRA,通过事前能力约束与边界代理消除分支转向攻击并兼顾效用。