SpecGuard 用 Lean 证书在编码 Agent 执行前证明任务冲突
提出 SPECGUARD,用 Lean 证书在编码 Agent 执行前证明任务冲突
- arXiv
- 2610.09159
- 发表
- 层
- 应用层
- 被测模型
- GPT-5.6 Sol、Claude Opus 5、Claude Fable 5 等 4 个
- 风险奖励作弊
摘要提出预执行冲突检测与证明框架,在多个基准和真实仓库中成功证明任务与测试不可同时满足。
另有 392 篇论文还没打上分类标签,暂不在筛选结果里。
提出 SPECGUARD,用 Lean 证书在编码 Agent 执行前证明任务冲突
摘要提出预执行冲突检测与证明框架,在多个基准和真实仓库中成功证明任务与测试不可同时满足。
评测编码智能体 harness 安全机制在对抗任务中的防护效果
提出 PERSISTBD,发布前强化供应链后门使其经良性 SFT 与 RL 后仍外发凭据
本文研究第三方 LLM 智能体在开发者进行良性监督微调(SFT)和强化学习(RL)后训练时的后门持久性风险。
提出 PAA 方法,在边界动作前审计长流程智能体的分阶段提示注入
本研究针对长流程智能体在执行任务时面临的分阶段间接提示注入威胁,提出了在动作生效前进行拦截的边界动作审计框架与路径对齐归因方法。
提出 EviLLM,经账户指令或插件向代码生成流程注入漏洞
提出 Tracekit,审计编码 Agent 的意图、推理与动作并检测账本篡改
Tracekit 是无第三方依赖的编码智能体审计层:把人类请求、模型自述和已执行动作并排写入可外部锚定的哈希链,执行前用正则门,事后用规则和独立模型互查。
提出残余权限重放攻击,跨任务复用长期 Agent 的历史授权绕过确认
提出 CAVE-BENCH,评测智能体在虚假指责下破坏已完成的正确工作
摘要论文提出了评估智能体在虚假指责下破坏已有正确成果的 CAVE-BENCH,发现强模型易推翻已知证据,提出了门控缓解方案。
测试编程智能体被诱导或自主篡改自身执行轨迹的行为
这是一项针对本地大模型智能体执行轨迹完整性与安全防篡改边界的实证研究。
构建 ACE 语料,评测内核级证据对 Agent 攻击检测的有效性
ACE 是一份把智能体会话的内核 syscall 痕迹与应用层清单、转录配对起来的检测语料和基准。。
提出 PMPA,经外部源向 Agent 持久记忆投毒并跨会话泄露隐私
摘要论文提出了持久记忆投毒攻击 PMPA,报告了 harness 智能体在处理外部数据时易受跨会话记忆投毒与隐私泄露的风险。
提出针对 Agent Harness 的上下文特权提升攻击
提出 ClawSentry 多层监控网关,在技能准入和运行时拦截恶意技能与隐藏指令
ClawSentry 是挂在智能体运行时之外的安全监督网关,用来同时盖住 skill 执行的多个生命周期边界,并把已被拒绝的效果记到会话里。
提出 SkillMisevo-Bench,量化自改进 Agent 的技能误演化
提出 ElasticBack,在单个 Agent 技能中植入条件后门
ElasticBack 是放在 LLM agent 单个 skill 里的条件后门攻击。。
提出 S³,用 guard agent 编排阶段安全技能防御智能体多阶段风险
评测编码 Agent 记忆文件中提示注入的跨会话影响
Bad Memory 在沙箱合成工作区里评测文件型持久记忆上的提示注入,比较载荷能否改变当前会话,以及能否在后续会话中留下或叠加。
提出 AHA 自动科研循环,发现生产 Agent 的可复用漏洞概念
AHA 是一项针对生产级 LLM 智能体自动化红队测试的研究,旨在解决传统方法仅保留具体攻击载荷而缺乏成因解释、导致跨版本复用困难且无法指导修复的问题。
提出工作流级越狱,诱导 IDE 编程 Agent 在多轮开发中编写有害代码
摘要论文揭示了 IDE 编程智能体在多轮开发工作流中会绕过单轮拒答并自行写出有害代码,呼吁防御转向工作流与代码产物级审查。
提出 MOSAIC,用 CLI 安全知识库构造编码 Agent 的命令组合攻击