CompoSkill 框架利用逐个通过扫描的 Agent 技能组合发起攻击
提出 CompoSkill,诱导 Agent 将过审技能组合成攻击链
- arXiv
- 2608.16246
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- GPT-5.4、Gemini-3.1-flash、DeepSeek-V4 等 4 个
摘要论文分析了智能体技能组合风险,指出单包安全认证状态不具备可组合性,需转向路径级防护。
另有 284 篇论文还没打上分类标签,暂不在筛选结果里。
提出 CompoSkill,诱导 Agent 将过审技能组合成攻击链
摘要论文分析了智能体技能组合风险,指出单包安全认证状态不具备可组合性,需转向路径级防护。
提出 CAVEAT 基准,评测电商引导下购物智能体是否偏离用户最优选择
摘要提出 CAVEAT 基准揭示智能体在商业偏好下的决策退化,诊断出三类失效并给出缓解方案。
提出 CredLeak-Bench,评测智能体在钓鱼场景下的凭据泄露
提出 APort Vault,评测支付智能体授权层对越权转账的拦截
提出 nmult 指标,测量智能体动作门禁堆叠的错误相关性与等效层数
论文是一项针对智能体动作拦截防御堆叠故障关联性与实际组合价值的实证测量研究。
提出 DIBench,评测界面注入对移动智能体选择决策的操纵
摘要论文提出移动智能体决策完整性基准 DIBench,发现欺诈 UI 注入诱导目标选择并推高完成率,通用防御收益不稳定。
构建统一滥用监视基准,用危害窗口评测跨威胁动作监控
摘要统一智能体滥用监视框架,动作视角兼顾两类威胁但危害定位仍存瓶颈。
构建 BazaarBench,评测去中心化交易智能体的违规与失信
BazaarBench 针对大语言模型智能体在去中心化 C2C 交易中的代理安全问题,提出了一个结合底层实体状态与大模型裁判的仿真基准平台。
用 StegoMemory 测试智能体持久记忆作为跨会话隐写信道的可行性
摘要研究揭示智能体持久记忆可作为隐蔽信道跨会话传输机密,写入持久化是主要防御瓶颈,呼吁建立记忆完整性防御。
构建 AGENTDOXX 评测联网搜索智能体对匿名访谈的再识别能力
摘要论文提出了已知身份的重识别基准 AGENTDOXX,揭示搜索与记忆双重风险及现有防御在检索轨迹中的泄露漏洞。
提出 AgentHazard 基准,评测计算机使用智能体的执行层有害行为
AgentHazard 是针对计算机使用智能体执行层安全构建的评估基准,重点探究多步工具调用下局部合理动作累积引发的危害。
提出 MisKnow-Agent,评测深度研究智能体是否采纳误导性检索知识
摘要论文通过 MisKnow-Agent 框架评估发现长程研究智能体易采纳误导性知识,且现有防御难以完全消除该现象。
构建 SKILLMISEVO-BENCH,评测自进化编程智能体的技能误演化风险
提出 TS-Guard 与 TS-Flow,执行前检测并修正智能体有害工具调用
ToolSafe 研究 LLM 智能体在工具执行前的步骤级安全:基准 TS-Bench、护栏 TS-Guard,以及反馈驱动框架 TS-Flow。
提出 MOLE 基准,评测智能体内部威胁的完成情况与监控漏检
MOLE 是首个针对前沿 AI 实验室智能体内部威胁检测的开放基准,旨在评估在有限每日审查预算与日常研发业务背景下识别恶意账号的能力。。
构建 PrivEscalate 评测 Linux 提权并设计 PrivEscAgent
用 AgentLSD 评测安全 Agent 在对抗任务污染下的解题与开销
AgentLSD 是一个对照框架,用来测量安全智能体在任务本身不变时,对对抗性任务污染的反应。
提出闭环自适应红队框架 CART,评测模型与工具 Agent 的风险面
CART 把自动红队从一次清单式打分,改成带预算、可追溯的闭环搜索。
发布 MADBench,评测多智能体辩论会吸收还是放大对抗影响
MADBench 是一个评测多智能体辩论安全性的基准,用来看攻击是被辩论吸收还是被放大。
提出 S³ 多阶段防御,由 guard agent 编排阶段安全技能检测并缓解风险