摘要论文证实了拓扑条件后门的可训练性与泛化性,展示了常规评测盲区,并提出差异化拓扑审计作为检测防御方向。
全部论文
另有 426 篇论文还没打上分类标签,暂不在筛选结果里。
- 评测与基准arXiv 2610.03153
EvoRiskBench:面向工作区 Agent 运行时安全风险的演化基准
提出 EvoRiskBench,评测工作区 Agent 的运行时安全风险
- arXiv
- 2610.03153
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 攻击提示注入
摘要论文构建了工作空间智能体运行时风险基准 EvoRiskBench,发现高执行力智能体在 IPI 下面临较高安全风险。
- 攻击arXiv 2609.17817
论文:用投毒基准污染自改进编码 Agent,令其后续版本写出漏洞代码
提出基准投毒攻击,使自修改编码智能体跨代写出漏洞代码
- arXiv
- 2609.17817
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
摘要论文报告了恶意基准能污染自修改代码智能体的进化过程并持续输出漏洞,警示系统设计需纳入安全约束。
- 攻击arXiv 2610.00392
A2A-TIBA:针对 A2A 协议 LLM 智能体的间接提示注入攻击与三层同构攻防模型
提出 A2A-TIBA 间接提示注入,诱导智能体部署常驻回调并外传数据
- arXiv
- 2610.00392
- 发表
- 层
- 应用层
摘要A2A-TIBA 一次植入后绕过智能体,GDA 用四类结果定位防线,ELA-ITL 把信封标注列为第三层。
A2A-TIBA 把间接提示注入和绕过放进 A2A:gray-box 攻击者已能投递任务,诱导目标部署常驻回调程序后,下令和外传不再经过智能体。
- 防御arXiv 2609.01677
Skill-as-API:面向智能体软件工程的机密多智能体协作协议
提出 Skill-as-API,防止协作通道泄露 skill 代码与系统提示词
- arXiv
- 2609.01677
- 发表
- 层
- 应用层
摘要协议把 skill 正文留在所有者侧,四层限制发现内容、权限期限和注入拼接。
Skill-as-API 是面向智能体软件工程的协调协议,用来在跨组织调用时把 skill 的代码和系统提示词留在所有者进程。作者针对三条威胁:经通道或命名空间抽取专有方法,用注入让被调用模型输出系统提示词,以及协作结束后权限继续保留。
- 评测与基准arXiv 2609.32635
TrustFork:显示身份如何劫持 LLM 智能体编排的权限
提出 TRUSTFORK 基准,评测展示身份劫持多智能体编排权限
- arXiv
- 2609.32635
- 发表
- 层
- 应用层
- 攻击提示注入
摘要论文提出了多智能体安全基准 TRUSTFORK,揭示展示身份如何劫持操作权威,并证明事后验证无法弥补已发生的执行破坏。
- 防御arXiv 2609.35659
Tracekit:面向自主编码 Agent 的防篡改意图-推理-动作审计系统
提出 Tracekit,对编码 Agent 做防篡改的意图-推理-动作审计
- arXiv
- 2609.35659
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 防御监控与审计
- 攻击提示注入
- 风险Agent 危险操作
- 组件监控器
摘要Tracekit 把意图、自述和动作写入可锚定的哈希链。
Tracekit 是无第三方依赖的编码智能体审计层:把人类请求、模型自述和已执行动作并排写入可外部锚定的哈希链,执行前用正则门,事后用规则和独立模型互查。
已经到底了