SpecGuard 用 Lean 证书在编码 Agent 执行前证明任务冲突
提出 SPECGUARD,用 Lean 证书在编码 Agent 执行前证明任务冲突
- arXiv
- 2610.09159
- 发表
- 层
- 应用层
- 被测模型
- GPT-5.6 Sol、Claude Opus 5、Claude Fable 5 等 4 个
- 风险奖励作弊
摘要提出预执行冲突检测与证明框架,在多个基准和真实仓库中成功证明任务与测试不可同时满足。
提出 SPECGUARD,用 Lean 证书在编码 Agent 执行前证明任务冲突
摘要提出预执行冲突检测与证明框架,在多个基准和真实仓库中成功证明任务与测试不可同时满足。
评测编码智能体 harness 安全机制在对抗任务中的防护效果
提出 PERSISTBD,发布前强化供应链后门使其经良性 SFT 与 RL 后仍外发凭据
本文研究第三方 LLM 智能体在开发者进行良性监督微调(SFT)和强化学习(RL)后训练时的后门持久性风险。
提出拓扑条件后门,使代码模型在推断多智能体部署时植入漏洞
摘要论文证实了拓扑条件后门的可训练性与泛化性,展示了常规评测盲区,并提出差异化拓扑审计作为检测防御方向。
为 Agent 提出资源层授权系统 Pincer,用数字分身执行动态最小权限
Pincer 是加在现成 coding agent 上的资源层授权防御:用只受用户侧信息影响的 digital twin 做动态最小权限,并与 tool-call 层防御并存。要处理的是用户维护策略带来的权限蠕变和授权疲劳,以及不学习用户策略的 tool-call 分类器。作者引述工作称 auto mode 会放行多数不安全操作,并认为推理代码或复杂 shell 的效果在这一层不实际。
提出只训练或篡改多智能体潜在通信链路来提高有害遵从
学习得到的潜在通信链路会改变由冻结、对齐智能体组成的系统是否遵从有害请求。。作者研究三种拓扑:双智能体、三级顺序协作,以及双专家加汇总。
提出 AdaLCPI,把恶意指令拆成碎片嵌入工具返回并诱导 Agent 越权执行
提出 Tracekit,审计编码 Agent 的意图、推理与动作并检测账本篡改
Tracekit 是无第三方依赖的编码智能体审计层:把人类请求、模型自述和已执行动作并排写入可外部锚定的哈希链,执行前用正则门,事后用规则和独立模型互查。
提出残余权限重放攻击,跨任务复用长期 Agent 的历史授权绕过确认
提出检索器后门攻击操纵智能体搜索,并用 DOU 逃避检测
摘要论文展示了通过恶意检索器操纵智能体多轮搜索并利用诱饵重塑表征隐蔽后门的可行性与系统风险。
提出 CAVE-BENCH,评测智能体在虚假指责下破坏已完成的正确工作
摘要论文提出了评估智能体在虚假指责下破坏已有正确成果的 CAVE-BENCH,发现强模型易推翻已知证据,提出了门控缓解方案。
提出条件触发的爆炸提示词,并设计摄入期检测器 DeFuse
论文针对大语言模型智能体面临的间接提示注入威胁,研究了利用条件句式实现时间分离的爆炸提示词。
提出量化条件后门 AGENTQ,使智能体仅在量化后触发恶意工具调用
摘要论文研究了智能体量化条件后门风险,提出 AGENTQ 在保持效用的同时实现全精度隐蔽与量化后生效。
提出 TrojanWorld,用物理触发器对世界模型智能体植入想象引导后门
摘要TrojanWorld 揭示了世界模型智能体的供应链后门风险,通过在世界模型中操纵想象可实现对闭环动作的持续控制。
提出针对 Agent Harness 的上下文特权提升攻击
提出 SYNCHAIN,诱导计算机使用 Agent 自建跨任务持久攻击链
摘要论文揭示了 CUA 自合成工件带来的内部供应链威胁,验证了潜伏载荷的跨任务传播能力与防御局限。
提出 Twin Agent,用预算内残差 hint 隔离不可信输入与特权动作
评测编码 Agent 记忆文件中提示注入的跨会话影响
Bad Memory 在沙箱合成工作区里评测文件型持久记忆上的提示注入,比较载荷能否改变当前会话,以及能否在后续会话中留下或叠加。
提出 AHA 自动科研循环,发现生产 Agent 的可复用漏洞概念
AHA 是一项针对生产级 LLM 智能体自动化红队测试的研究,旨在解决传统方法仅保留具体攻击载荷而缺乏成因解释、导致跨版本复用困难且无法指导修复的问题。
提出 CONTRA 树搜索,通过良性配置修改诱发个人化 Agent 执行恶意动作