CredLeak-Bench:七个模型在钓鱼场景下凭证泄露率 31%–76%,恢复率最高仅 24.2%
提出CredLeak-Bench,评测智能体在钓鱼场景下的凭据泄露
CREDLEAK-BENCH 评估了 LLM 智能体在处理邮件工作流时的凭据泄露与受信恢复能力,揭示了当前模型在安全防护与合法效用之间的权衡。
另有 3 篇论文还没打上分类标签,暂不在筛选结果里。
提出CredLeak-Bench,评测智能体在钓鱼场景下的凭据泄露
CREDLEAK-BENCH 评估了 LLM 智能体在处理邮件工作流时的凭据泄露与受信恢复能力,揭示了当前模型在安全防护与合法效用之间的权衡。
提出APort Vault,评测支付智能体授权层对越权转账的拦截
提出Trust Layer,事后复核智能体基准成绩的真实性、诚实性与稳定性
构建统一滥用监视基准,用危害窗口评测跨威胁动作监控
本论文提出了面向 LLM 智能体滥用监视的统一形式化框架与包含约 6,200 条轨迹的评测基准。
用COPEX基准在固定协议栈下评测智能体抵御MCP攻击的能力
COPEX 是一个针对模型上下文协议(MCP)智能体的安全评测基准,旨在评估大语言模型面对不同协议层对抗性上下文时的鲁棒性。
发布UndoBench,分离工具型智能体的任务能力与故障恢复能力
提出操作有效性契约,审计激活监控从探针分数到告警策略的有效性
这篇论文系统评估了大模型智能体激活监控器从离线探针得分向在线警报策略跨越时的统计与操作有效性。
用StegoMemory测试智能体持久记忆作为跨会话隐写信道的可行性
构建AGENTDOXX评测联网搜索智能体对匿名访谈的再识别能力
提出AgentHazard基准,评测计算机使用智能体的执行层有害行为
AgentHazard 是针对计算机使用智能体执行层安全构建的评估基准,重点探究多步工具调用下局部合理动作累积引发的危害。
提出STAR-Guard双层防御缓解长程智能体遗忘安全约束
重评提示注入检测器,检验基准分数对智能体部署的预测力
用MMPIBench评测智能体框架的多模态提示注入
在模拟环境中复现级联失准行为并降低审计诱导开销
构建知识逆转基准,评测陈旧检索证据如何推翻模型原本正确的回答
这篇论文是对检索增强生成(RAG)中“陈旧文档中毒”现象的实证与机理评估研究。
提出VLoc Bench,评测智能体仅凭弱点类型在完整仓库中定位漏洞
提出SYNCHAIN,以定向微调诱导智能体自合成跨任务潜伏工件
提出LongPIBench,评测长文档场景下的提示注入攻击与防御
提出EvasionBench,测量任务压力下智能体对同步监控的规避
提出卡点评测框架,以实参级谓词审计间接提示注入评测的测量偏差