CredLeak-Bench
提出 CredLeak-Bench,评测智能体在钓鱼场景下的凭据泄露
完整解读另有 95 篇论文还没打上分类标签,暂不在筛选结果里。
提出 CredLeak-Bench,评测智能体在钓鱼场景下的凭据泄露
完整解读提出 APort Vault,评测支付智能体授权层对越权转账的拦截
完整解读提出 WebMirage,用对抗图像劫持视觉网页智能体的浏览器操作
WebMirage 是一个面向视觉定位网络智能体的流水线感知端到端红队攻击框架。
评测人类开发者在协作编程中能否发现编码智能体的隐蔽破坏
完整解读提出 HarnessSecurity-Bench,横向评测编码智能体框架的安全机制
完整解读提出 AgentSpy,在系统调用层观测编程智能体并检测技能注入攻击
本研究提出了面向 AI 智能体的系统级外部监控与行为分析框架 AgentSpy。
提出 VAL 框架并用确认门与参数沙箱约束高风险工具调用
完整解读微调植入拓扑条件后门,使代码模型在推断多智能体部署时插入隐蔽漏洞
提出 PAA 路径对齐归因,审计编程智能体边界动作前的分段提示注入
本研究针对长流程智能体在执行任务时面临的分阶段间接提示注入威胁,提出了在动作生效前进行拦截的边界动作审计框架与路径对齐归因方法。
提出 AgentHazard 基准,评测计算机使用智能体的执行层有害行为
AgentHazard 是针对计算机使用智能体执行层安全构建的评估基准,重点探究多步工具调用下局部合理动作累积引发的危害。
提出 TPRS,量化工具命名等表征变化对智能体安全基准得分的影响
完整解读重评提示注入检测器,检验基准分数对智能体部署的预测力
提出 EvoRiskBench,评测工作区智能体的运行时安全风险
提出 COBRA 双 LLM 架构,防御计算机使用智能体的分支转向攻击
提出跨通道分段攻击,借 MCP 多通道隐式信任外发敏感数据
提出 PRETEXT,迭代改写技能文本以绕过扫描并执行木马行为
PRETEXT 是一项针对基于“静态规则加语义大模型”的智能体技能安全检测框架的白盒攻击与协同进化评估研究。
用 MMPIBench 评测智能体框架的多模态提示注入
构建 ActBench 评测协作智能体多步执行中的操作级行为安全
在模拟环境中复现级联失准行为并降低审计诱导开销
提出 MisKnow-Agent,评测深度研究智能体是否采纳误导性检索知识