CredLeak-Bench:七个模型在钓鱼场景下凭证泄露率 31%–76%,恢复率最高仅 24.2%
提出CredLeak-Bench,评测智能体在钓鱼场景下的凭据泄露
CREDLEAK-BENCH 评估了 LLM 智能体在处理邮件工作流时的凭据泄露与受信恢复能力,揭示了当前模型在安全防护与合法效用之间的权衡。
另有 3 篇论文还没打上分类标签,暂不在筛选结果里。
提出CredLeak-Bench,评测智能体在钓鱼场景下的凭据泄露
CREDLEAK-BENCH 评估了 LLM 智能体在处理邮件工作流时的凭据泄露与受信恢复能力,揭示了当前模型在安全防护与合法效用之间的权衡。
提出APort Vault,评测支付智能体授权层对越权转账的拦截
提出Trojan Hippo Bench,评测智能体持久记忆攻击与防御
提出SLEIGHT-BENCH,评测代码智能体监控器的概念盲点
审计由智能体从零构建并部署的真实应用的安全缺陷
评测人类开发者在协作编程中能否发现编码智能体的隐蔽破坏
提出nmult指标,测量智能体动作门禁堆叠的错误相关性与等效层数
论文是一项针对智能体动作拦截防御堆叠故障关联性与实际组合价值的实证测量研究。
提出DIBench,评测界面注入对移动智能体选择决策的操纵
提出Trust Layer,事后复核智能体基准成绩的真实性、诚实性与稳定性
构建统一滥用监视基准,用危害窗口评测跨威胁动作监控
本论文提出了面向 LLM 智能体滥用监视的统一形式化框架与包含约 6,200 条轨迹的评测基准。
提出HarnessSecurity-Bench,横向评测编码智能体框架的安全机制
用COPEX基准在固定协议栈下评测智能体抵御MCP攻击的能力
COPEX 是一个针对模型上下文协议(MCP)智能体的安全评测基准,旨在评估大语言模型面对不同协议层对抗性上下文时的鲁棒性。
发布UndoBench,分离工具型智能体的任务能力与故障恢复能力
提出操作有效性契约,审计激活监控从探针分数到告警策略的有效性
这篇论文系统评估了大模型智能体激活监控器从离线探针得分向在线警报策略跨越时的统计与操作有效性。
构建BazaarBench,评测去中心化交易智能体的违规与失信
BazaarBench针对大语言模型智能体在去中心化C2C交易中的代理安全问题,提出了一个结合底层实体状态与大模型裁判的仿真基准平台。
评测启用工具调用后多模态模型拒答有害图文请求的变化
论文系统评估了智能体工具调用范式对多模态大语言模型拒答能力的影响,指出了工具增强视觉推理背后的安全隐患。
核心探讨的问题在于:当 MLLM 从单次推理转向通过 ReAct 循环调用外部工具(打标、缩放、OCR、代码执行)时,工具使用机制本身是否会降低模型拒答有害请求的概率。
实验在 MM-SafetyBench、VLSBench 与 HoliSafe 三个安全基准上评估了 11 款主流开源与专有模型,结果显示工具调用使得所有被测模型的拒答失败率(RFR)均发生上升,三基准平均相对增幅为 17.7%(绝对值增加 5.7),相对增幅最高达 68.7%(GLM-5V-Turbo 于 HoliSafe,Table 1)。
原生视觉智能体 Gemini-3-Flash Agentic Vision 的平均 RFR 同样相比基础模型上升 15.2(Table 3),通过 McNemar 检验确认退化在统计学上显著(Table 5)。
归因分析提出两大机制:一是上下文稀释,调用工具轮次越多 RFR 越高,而重新注入原请求与图像可使平均 RFR 回落 7.6%(Figure 3);二是安全关注点偏移,工具调用使成功拒答样本中以观察总结开头的比例从 20.3% 变为 52.3%(Figure 5),注意力被视觉证据挤占。
作者认为,工具调用不应仅被视为能力增强机制,也是能够改变拒答行为的安全相关设计;未来的多模态智能体必须在工具调用条件下进行安全评测与对齐训练,而不能假定无工具环境下的安全对齐可以直接迁移。
用StegoMemory测试智能体持久记忆作为跨会话隐写信道的可行性
构建AGENTDOXX评测联网搜索智能体对匿名访谈的再识别能力
提出AgentHazard基准,评测计算机使用智能体的执行层有害行为
AgentHazard 是针对计算机使用智能体执行层安全构建的评估基准,重点探究多步工具调用下局部合理动作累积引发的危害。
提出TPRS,量化工具命名等表征变化对智能体安全基准得分的影响