CredLeak-Bench
提出 CredLeak-Bench,评测智能体在钓鱼场景下的凭据泄露
完整解读另有 95 篇论文还没打上分类标签,暂不在筛选结果里。
提出 CredLeak-Bench,评测智能体在钓鱼场景下的凭据泄露
完整解读提出 APort Vault,评测支付智能体授权层对越权转账的拦截
完整解读评测人类开发者在协作编程中能否发现编码智能体的隐蔽破坏
完整解读提出 HarnessSecurity-Bench,横向评测编码智能体框架的安全机制
完整解读提出 AgentHazard 基准,评测计算机使用智能体的执行层有害行为
AgentHazard 是针对计算机使用智能体执行层安全构建的评估基准,重点探究多步工具调用下局部合理动作累积引发的危害。
重评提示注入检测器,检验基准分数对智能体部署的预测力
构建 MLCommons 越狱基准以测量模型的单轮越狱韧性
构建 ActBench 评测协作智能体多步执行中的操作级行为安全
在模拟环境中复现级联失准行为并降低审计诱导开销
提出 MisKnow-Agent,评测深度研究智能体是否采纳误导性检索知识
提出 CLASHBENCH,评测特权智能体抢占资源并破坏既有任务
提出 OpenART 竞技场,用 EMHA 演化持久环境以评测智能体安全
完整解读构建 SKILLMISEVO-BENCH,评测自进化编程智能体的技能误演化风险
完整解读提出预算化发现框架,优先深评更可能隐藏失败的安全提示词
作者把 LLM 可靠性评测写成预算约束下的隐藏失败发现:每条提示词有未知的逐次失败概率,浅层少量采样中的零失败并不等于该概率为零。
提出 CS-Guard 基准与虚构场景攻击,评测代码生成护栏
提出 AgentCyberRange,评测智能体自主实施网络攻击的能力
提出 ECLIPSE 双通道自演化提示注入,劫持长程智能体动作轨迹
完整解读提出 TRUSTFORK,评测展示身份如何劫持多智能体编排的操作权限
提出 ScopeBench,测量渗透智能体在目标压力下的范围遵从
完整解读提出技能级联攻击,把恶意目标拆进多个技能以绕过单技能检测