CompoSkill 框架利用逐个通过扫描的 Agent 技能组合发起攻击
提出 CompoSkill,诱导 Agent 将过审技能组合成攻击链
- arXiv
- 2608.16246
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- GPT-5.4、Gemini-3.1-flash、DeepSeek-V4 等 4 个
摘要论文分析了智能体技能组合风险,指出单包安全认证状态不具备可组合性,需转向路径级防护。
另有 725 篇论文还没打上分类标签,暂不在筛选结果里。
提出 CompoSkill,诱导 Agent 将过审技能组合成攻击链
摘要论文分析了智能体技能组合风险,指出单包安全认证状态不具备可组合性,需转向路径级防护。
构建统一滥用监视基准,用危害窗口评测跨威胁动作监控
摘要统一智能体滥用监视框架,动作视角兼顾两类威胁但危害定位仍存瓶颈。
提出 COVER,在语言预算下选择源语言实现跨语言知识遗忘
语言预算下的多语言遗忘:遗忘监督只放在 K 种源语言上,目标是降低其余语言对同一事实的残余访问,而不是把每种评测语言都译成监督数据。
提出 TS-Guard 与 TS-Flow,执行前检测并修正智能体有害工具调用
ToolSafe 研究 LLM 智能体在工具执行前的步骤级安全:基准 TS-Bench、护栏 TS-Guard,以及反馈驱动框架 TS-Flow。
提出 PIDS-Bench,评测提示注入检测器在过度防御与分布偏移下的表现
PIDS-Bench 是一个冻结的检测器级基准,用来在固定阈值下同时看提示注入检测和良性误报。
提出闭环自适应红队框架 CART,评测模型与工具 Agent 的风险面
CART 把自动红队从一次清单式打分,改成带预算、可追溯的闭环搜索。
发布 MADBench,评测多智能体辩论会吸收还是放大对抗影响
MADBench 是一个评测多智能体辩论安全性的基准,用来看攻击是被辩论吸收还是被放大。
提出 S³ 多阶段防御,由 guard agent 编排阶段安全技能检测并缓解风险
提出 ECLIPSE 双通道自演化提示注入,劫持长程智能体动作轨迹
提出 CAVE-BENCH,评测智能体遭虚假指责后是否破坏已正确的工作
摘要论文提出了评估智能体在虚假指责下破坏已有正确成果的 CAVE-BENCH,发现强模型易推翻已知证据,提出了门控缓解方案。
用 FARSIGHT 方案级评测金融 LLM 交易 Agent 的稳健性与安全
构建 ACE 语料并比较内核与应用层证据的攻击检测效果
ACE 是一份把智能体会话的内核 syscall 痕迹与应用层清单、转录配对起来的检测语料和基准。。
提出 AgentXploit 红队系统,分离仓库攻击路径发现与运行时利用
提出 PrivDrift 基准,审计话题漂移后的用户秘密复述
提出 ORBIT 框架,评测多智能体系统中的攻击、合谋与多类防御
摘要ORBIT 用六层配置比较多智能体防御,逐动作监控不迁移到合谋。
评测 System One 模型对 Agent 安全输入的分类可靠性与校准
Liu 离线评测 System One 模型能否为智能体安全输入给出可自动化的概率决策。问题是分类是否可靠,以及概率能否在指定漏检和误拦上限内支持放行、拦截或复核。
提出 RLCDAlignBench,零样本检测多种对齐失败
RLCDAlignBench 测量用强化学习做校准决策的 Jev,能否当作对齐失败的零样本检测器。
提出 IDUnlearn-Bench,评测 VLM 个体级遗忘后的身份残留
IDUnlearn-Bench 评测 VLM 是否忘掉一个可跨模态识别的人,而不只是答不出某条监督事实。