CredLeak-Bench:七个模型在钓鱼场景下凭证泄露率 31%–76%,恢复率最高仅 24.2%
提出CredLeak-Bench,评测智能体在钓鱼场景下的凭据泄露
CREDLEAK-BENCH 评估了 LLM 智能体在处理邮件工作流时的凭据泄露与受信恢复能力,揭示了当前模型在安全防护与合法效用之间的权衡。
提出CredLeak-Bench,评测智能体在钓鱼场景下的凭据泄露
CREDLEAK-BENCH 评估了 LLM 智能体在处理邮件工作流时的凭据泄露与受信恢复能力,揭示了当前模型在安全防护与合法效用之间的权衡。
提出APort Vault,评测支付智能体授权层对越权转账的拦截
评测人类开发者在协作编程中能否发现编码智能体的隐蔽破坏
提出HarnessSecurity-Bench,横向评测编码智能体框架的安全机制
提出AgentHazard基准,评测计算机使用智能体的执行层有害行为
AgentHazard 是针对计算机使用智能体执行层安全构建的评估基准,重点探究多步工具调用下局部合理动作累积引发的危害。
提出TPRS,量化工具命名等表征变化对智能体安全基准得分的影响
重评提示注入检测器,检验基准分数对智能体部署的预测力
构建MLCommons越狱基准以测量模型的单轮越狱韧性
提出EvoRiskBench,评测工作区智能体的运行时安全风险
用MMPIBench评测智能体框架的多模态提示注入
构建ActBench评测协作智能体多步执行中的操作级行为安全
在模拟环境中复现级联失准行为并降低审计诱导开销
提出MisKnow-Agent,评测深度研究智能体是否采纳误导性检索知识
提出MobileCybench,用可执行探针评测编程智能体的漏洞发现与利用
该研究提出了基于可执行安全属性探针的自动化评估基准 MobileCyBench,用于衡量 AI 智能体在移动应用及后端环境下的漏洞挖掘与利用生成能力。
提出CLASHBENCH,评测特权智能体抢占资源并破坏既有任务
提出OpenART竞技场,用EMHA演化持久环境以评测智能体安全
构建SKILLMISEVO-BENCH,评测自进化编程智能体的技能误演化风险
这篇论文研究了自进化大语言模型智能体中因吸收不安全经验而导致的持久性策略失效——技能错误进化(Skill Misevolution)。
提出CS-Guard基准与虚构场景攻击,评测代码生成护栏
红队评估编码智能体的阻断监视器,并提出Auto Mode++加固
提出AgentCyberRange,评测智能体自主实施网络攻击的能力