跳到正文
10月8日 · 周四

Agent 安全 · 论文

找到 25 篇

另有 3 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv:2610.09793 ·

    用时序逻辑监控工具 Agent:MonPoly 标出 71.8% STAC 攻击链,但溯源检查被一行注入骗过 94%–99%

    提出基于MonPoly的时序逻辑监控,离线检出工具智能体危险动作链

    测试
    GPT-4o、Sonnet-3.5应用层
    场景
    AI Agent
    摘要形式化验证可有效识别多步攻击,但其有效性高度依赖轨迹的可信历史记录。

    这篇论文对工具调用大语言模型智能体的安全监控进行了形式化时序验证研究。

    完整解读
  2. 防御arXiv:2609.11757 ·

    研究者披露 AP2 支付协议的 Whisper 提示注入攻击并提出 A-VIP 防御

    提出A-VIP,将购物意图绑定到支付授权以阻断商户文本操控

    测试
    gemini-2.5-flash-lite、gemini-3.1-flash-lite、gemini-3-flash-preview 等 15 个应用层
    场景
    AI Agent
    摘要论文揭示了AP2协议决策层受操纵的风险,提出结构化与权能绑定防御A-VIP,并发布评测基准。
    • 定位与目标:本文针对智能体支付协议 AP2,研究商户利用商品描述影响智能体决策的推理层攻击面,并提出了协议层绑定防御机制 A-VIP 与评测基准 AP2-WhisperBench。
    • 要解决的问题:现有支付协议的密码学签名仅能证明交易未被篡改,但未约束生成交易的决策推理;商户在商品描述中植入不含违规指令的事实性断言即可左右购物结果,且生成的购物车完全符合协议校验。
    • 方法要点:A-VIP 将用户签名意图转变为权能授权。针对凭据泄漏(Vault Whisper),引入 DDFC 使用单次会话令牌替代用户标识符;针对购物车篡改(Branded Whisper),通过快照进行实体与展示的算术与标识比对;针对事实性诱导(Selection Whisper),通过与最低价基准比对将未授权支出露出给用户确认。
    • 关键实验发现:
      1. 在 AP2 默认的 Flash-Lite 预览模型上,Vault 与 Branded 攻击成功率分别达 90% 与 56%(Table 3);Selection 攻击在 GA 后续版本上达 73.3%(Table 3)。
      2. 事实性操纵在 17 个 Google 模型上成功率为 23.3% 至 73.3%(Table 4),在多厂商 27 个模型汇总达 71.8%(Section 7.4),仅 claude-opus-5 出现较低成功率(1.2%)。
      3. A-VIP 结构化检查以零假阳性闭环拦截了全部 7 类购物车篡改,并在 68 个被操纵购物车中 100% 露出了未授权支出(Table 11)。
      4. 辅助内容扫描器在 Intel i7 CPU 上单核达 1,932 次/秒,8 线程达 10,328 次/秒(Appendix C)。
    • 作者结论与启示:作者指出模型抵御能力与模型规模、厂商或定价无直接对应关系,支付协议设计者无法依赖下游模型自觉防御,必须在协议层将凭据、购物车与支出严格绑定到用户初始授权上。
    完整解读
  3. 分析与理论arXiv:2610.04375 ·

    论文揭示 LLM Agent 工具调用在执行路径中被改写,并提出 IntAct 修复方案

    提出IEC协议与IntAct,定位并修复工具调用执行路径的静默篡改

    测试
    qwen3-coder-plus、Qwen2.5-Coder-32B、Qwen2.5-72B 等 4 个应用层
    摘要论文界定工具调用在执行路径中的意图偏离问题,提出无执行归因协议与跳级修复,为智能体工程提供评测与设计准则。
    • 研究定位:针对大语言模型智能体工具调用在底层执行路径中的保真度问题,论文界定了意图-执行对应性概念,提出了无执行偏离检测协议 IEC 与跳级修复框架 IntAct。
    • 核心问题:命令在宿主包装器、Shell解析、进程接口等多跳传输中常遭隐蔽篡改,现有评测默认调用按原样执行,导致大量路径缺陷被系统性误归因于大语言模型。
    • 方法设计:IEC协议利用无害见证探针与接收端自身解析器,在不执行命令的前提下定位首偏离跳;IntAct根据定名跃点采用无解析通道(如文件注入、参数转义、Base64编码)进行针对性渲染交付,或对超域调用予以安全拒绝。
    • 关键实验结果:
      1. 生产会话中10.0%的暴露Shell调用被路径篡改,Claude Code的Bash工具在传输长文本或代码时篡改率达12.0%,且80.7%的反斜杠合并故障未报任何错误(Figure 3a、Figure 3b)。
      2. 传统轨迹评测将95.1%的生产失败误判为模型责任,而IEC协议与人工归因的一致性达到 Cohen's kappa 0.77(Table 5)。
      3. 在固定动作回放下,IntAct恢复了IEC-Bench中79.2%发生调用变更的失败任务(Table 1);带智能体闭环测试中,将通过任务的平均Token消耗降低2.4倍(Table 7)。
    • 作者结论与启示:作者认为工具调用能否正确执行主要取决于启动路径而非大模型本身,智能体框架必须按跃点顺序开展逐跳工程测试,同时基准评测应固定并报告启动路径以保证模型评分的公平性。
    完整解读
  4. 防御arXiv:2610.06966 ·

    APEX:在 LLM Agent 执行边界主动防御间接提示注入

    提出APEX,在执行边界以授权契约拦截智能体间接提示注入

    测试
    DeepSeek-V4-Flash、GLM-5.2、GPT-5.6-sol 等 4 个应用层
    场景
    AI Agent
    摘要APEX在执行边界基于预编译授权契约实施证据门控与欺骗探针,在多基准上达成近零ASR。

    APEX 针对集成 Tools、MCP 与 Skills 的 LLM 智能体面临的间接提示注入威胁,提出将防御收敛至动作与输出最终交付的执行边界。

    完整解读
  5. 防御arXiv:2605.17380 ·

    Uber 提出 ADR 企业级 Agent 检测系统,在 7200 台主机部署十个月

    提出企业级智能体检测系统ADR,检测提示注入与恶意MCP

    测试
    GPT-4o、Claude Sonnet 4、Llama Guard 3-8B 等 4 个应用层
    摘要提出了端点因果遥测、两级在线分流与离线红队闭环的 ADR 系统,并在生产环境中验证了有效性。
    • 定位与目标:论文针对企业 MCP 智能体面临的未授权访问、数据外传等威胁,提出集成了端点遥测、分级在线检测与离线进化红队的防护系统 ADR。
    • 核心方法:通过端点 Sensor 解析本地缓存重建“提示词-思考-工具调用-环境”的完整因果链;在线采用轻量 LLM 进行 Tier 1 初筛并由 Tier 2 推理智能体结合源码与策略 MCP 进行深度调查;离线由 Explorer 进行进化式红队生成威胁情报并闭环反哺。
    • 主要实验结果:在包含 133 个 MCP 服务器的 ADR-Bench 上,ADR 实现 0 误报、0.667 召回率和 0.800 F1 值(基线 F1 仅 0.178–0.366);在 AgentDojo 上检出全部 38 个注入攻击,F1 达 0.962;单任务成本为 $0.024。
    • 生产落地验证:在 Uber 逾 7,200 台企业终端上部署超过 10 个月,并利用预执行 Hooks 拦截 206 处凭据外传风险(97.2% 精确率)。
    • 作者结论与启示:作者认为端点因果链遥测与分级上下文推理是应对智能体语义攻击的关键,并计划进一步探索网关层实时防护与多智能体协议适配。
    完整解读
  6. 防御arXiv:2610.05640 ·

    研究揭示 CaMeL 防护在多智能体系统中失效并提出 multi-CaMeL

    提出multi-CaMeL,在多智能体调用边界隔离可信指令与不可信数据

    测试
    Claude Fable 5、GPT-5.5、GPT-4.1 等 6 个应用层
    摘要论文针对多智能体中单体防御不组合的边界清洗问题,提出 multi-CaMeL 协议彻底阻断了 MultiAgentDojo 上的注入攻击。
    • 论文定位:这是一项针对分层多智能体系统在间接提示注入威胁下的安全性与防御协议研究。
    • 核心问题:现有单智能体系统级防御(如 CaMeL)无法在多智能体交互中自动组合,上游智能体获取的非可信数据经跨边界传递后会被下游智能体的规划模型视为可信输入,从而发生“边界清洗”并劫持系统控制流。
    • 防御方法:提出 multi-CaMeL 通信协议与扩展解释器,将跨智能体调用强制解耦为可信指令通道(message)与不透明数据通道(variables),在运行时维持指令通道完整性与数据溯源。
    • 核心实验结果:
      • 在 MultiAgentDojo 上,multi-CaMeL 将 5 款模型的平均攻击成功率从无防御的 12.9% 和单智能体 CaMeL 的 0.2% 降低至 0.0%,消除了残留攻击(Table III)。
      • 在良性效用上,AssetOpsBench 中 multi-CaMeL 较单智能体 CaMeL 平均仅多损失 3.2 个百分点,在 Claude Fable 5 与 GPT-5.5 上额外损失仅 0.85 个百分点(Figure 5)。
      • 效用损失随着模型能力的提升而呈现收窄趋势,作者称这提示能力更强的模型更能适应预定义控制流与变量解耦的约束(Figure 5、Figure 6)。
    • 作者结论与启示:作者指出“跨越智能体边界不得隐式提升信息的可信度”是多智能体安全的核心原则;单纯保护每个个体智能体并不足以保障系统安全,必须在系统交互接口处对指令与数据实施显式隔离。
    完整解读
  7. 防御arXiv:2610.04504 ·

    论文提出 VAL 框架:相同 ASR 的 LLM Agent 防御可能对应不同安全保证

    提出VAL框架并用确认门与参数沙箱约束高风险工具调用

    测试
    DeepSeek-chat、Meta Llama 3.1 8B、Kimi应用层
    场景
    AI Agent
    摘要论文证明相同ASR不等于相同安全保证,VAL结构栈在保持效用的同时提供超越模型行为运气的防御。
    • 一句话定位:论文应用验证自主权等级(VAL)剖析 LLM 智能体防御,揭示表面相同的 0.000 ASR 背后的结构保证与行为运气之别。
    • 要解决的问题:现有智能体防御缺乏解释其保证来源的统一坐标轴,经验测试下的零成功率无法预示防御在面对新攻击或不同环境时的真实效力。
    • 方法要点:依据规范来源将防御划分为 L0(模型自声明)至 L5(通用完备),主张锚点决定防御失效边界;在同等预算下构建由确认门(L1/L2)与参数沙箱(L3)构成的 VAL 结构栈,对比提示词硬化(L0)与关键词过滤(L1)构成的直觉栈。
    • 核心实验结果:在自建测试集上,VAL 栈实现 0.000 ASR 并保持 1.000 良性成功率,直觉栈虽同获 0.000 ASR 但良性成功率降为 0.000(两者差异在 p < 0.001 下显著);在 AgentDojo 银行套件上,VAL 栈将 ASR 降至 0.5%(无防御为 4.3%),直觉栈 ASR 漂移至 1.9%;在 7 轮升级攻击中,确认门即使被诱导顺从 83.3% 仍实现完全阻断。
    • 作者结论与启示:作者认为零攻击成功率只是测试结果而非理论保证,直觉防御依赖模型情绪且极易破坏实用性,而智能体安全的有效防线在于限制动作空间的结构隔离(L3)而非开放语义判断。
    完整解读
  8. 防御arXiv:2610.05163 ·

    研究者在 Claude Code 和 Codex 上构造分段提示注入并发布边界动作审计基准

    提出PAA路径对齐归因,审计编程智能体边界动作前的分段提示注入

    测试
    Claude Code (v2.1.172, Claude Sonnet 5)、Codex CLI (v0.144.0, GPT-5.5)、Claude Sonnet 5 等 7 个应用层
    摘要论文针对长流程注入提出边界动作审计与PAA,在保持低误阻的同时实现高拦截率。

    本研究针对长流程智能体在执行任务时面临的分阶段间接提示注入威胁,提出了在动作生效前进行拦截的边界动作审计框架与路径对齐归因方法。

    完整解读
  9. 防御arXiv:2610.05637 ·

    研究显示 VLM 视觉定位输出的拒答率按危害领域平均低 31 至 59 个百分点

    提出融合定位拒答与能力保留的安全微调,补齐视觉定位输出的拒答缺口

    测试
    Claude Sonnet 4.6、Gemini 3.5 Flash、Molmo2-8B 等 5 个训练与数据层
    摘要论文揭示了VLM定位安全落后于VQA的对齐断层,提出三成分微调方案有效弥合差距并保留定位能力,表征分析揭示了对齐机制。
    • 定位与核心问题:论文系统研究了多模态大模型在视觉定位(点和边界框坐标)这一可执行输出通道上的安全对齐问题,指出模型在面对相同有害意图时,拒绝自由文本提问却遵从空间定位请求的普遍对齐失效现象。
    • 方法与数据构建:作者将直接危害(VLSU)、社会偏见(BBQ-V)和情境安全(Asimov-2.0)三个基准重构成15,401对图文意图严格匹配的VQA与定位测试样本,并提出了融合定位拒答、通用定位能力以及自蒸馏良性数据的三成分微调训练方案,支持纯文本(SFT-plain)和占位符坐标(SFT-placeholder)两种拒答格式。
    • 基座模型安全差距:五款主流VLM在无系统提示下,定位模式的平均拒答率在VLSU、BBQ-V和Asimov-2.0上分别仅为19.4%、16.7%和12.7%,落后于VQA模式的62.9%、75.9%和43.8%(Table 6),且引入安全系统提示词无法有效消除该差距。
    • 安全微调成效:微调使Qwen3-VL-8B和VisionReasoner-7B在VLSU上的定位拒答率分别由9.7%和3.9%提升至96.5%和97.4%(SFT-plain,Table 3),在完全未见的情境安全域Asimov-2.0上分别提升至68.9%和85.4%,且通用定位成功率保持在基座水平(65.4%与64.1%)。
    • 对齐机制与启示:消融实验显示仅依赖VQA文本拒答数据无法迁移至定位安全,而定位拒答数据能提升双模式拒答;内部表征分析表明微调将有害定位请求的残差流表征大幅推向拒答方向。作者认为,随着定位输出被智能体与物理系统广泛采纳,安全对齐必须明确覆盖空间输出通道。
    完整解读
  10. 防御arXiv:2609.12001 ·

    Pheo 提出 OATS:用确定性解析器在运行时治理 Agent 技能动作

    提出OATS,用确定性解析器在运行时治理技能动作

    测试
    Claude Sonnet 5、GPT-5.5、gpt-5-mini 等 4 个应用层
    摘要论文论证了发布时恶意扫描无法替代运行时动作许可控制,提出了轻量确定性控制门OATS,展示了双层防御组合的必要性。
    • 定位与核心问题:本研究针对AI智能体技能生态中“发布时恶意检测”无法解决“具体机器上运行时权限许可”的问题,论证了动作级运行时控制的必要性并设计了轻量级防御系统。
    • 方法架构:作者设计了OATS运行时控制门,核心包含一个67.6 ms端到端延迟的确定性解析器(将shell命令映射到33个后果类,对无匹配项兜底拦截,决策路径无模型),一个基于(资源,后果类)二元组的分车道信任账本(13个高危类永不晋升),以及基于零失误二项分布反演的操作员风险容忍度晋升阈值模型。
    • 关键发现一:良性与许可的正交性:在ClawHub的66,192个技能中,29,257个被所有扫描器和法官评为clean的技能里,有705个技能(来自135家独立发布商)包含CIS Control 2.7等规范禁止的未授权或远程执行指令,人工审计显示其精确率为92.0%且无恶意意图标记。
    • 关键发现二:静态审查与动态执行脱节:在Claude Sonnet 5实机运行的39个clean技能中,仅1.4%的执行命令与文档字面完全一致,34.7%的命令后果类别从未在文档代码块中出现;在53个包含违规指令的clean技能中,智能体在23个技能里实际发起了违规操作,OATS对这23次动作实现了100%拦截或挂起。
    • 关键发现三:单命令防御的边界:在语义保持重写对抗基准上,解析器对包装与链式调用的识别率为100%,但在跨命令拆解、引号混淆等手段下整体宏平均解析率仅为52%,显示出无状态单命令匹配的局限。
    • 作者结论与启示:作者认为发布前制品扫描与运行时动作控制属于正交互补层,分别回答“制品是否恶意”与“操作是否许可”,任何一层均无法单独解决智能体安全问题;应将注册表扫描结果作为运行时账本的输入而非竞争替代品。
    完整解读
  11. 防御arXiv:2610.02664 ·

    论文提出 GHOST:长程智能体在良性对话中遗忘早期安全约束,GPT-5.5 发生率 11.5%

    提出STAR-Guard双层防御缓解长程智能体遗忘安全约束

    测试
    GPT-5.5、DeepSeek-V4-Pro、GLM-5.2 等 7 个应用层
    场景
    AI Agent
    摘要揭示 GHOST 跨轮约束遗忘风险,构建 SCARBench 基准并通过 STAR-Guard 双层防御消除违规。
    1. 针对长程工具使用智能体在多轮良性交互中遗忘先前安全约束的失效现象,形式化定义了跨轮安全约束忽略治理危害(GHOST),并构建了可执行评测基准 SCARBench。
    2. 核心问题在于智能体在多轮对话中能够恢复历史任务,但早先设定的前置要求或操作禁令容易脱离治理,导致不可逆的违规执行。
    3. 理论分析表明,若残留条件违规风险存在非可和下界,智能体轨迹几乎必然进入危险区域;据此提出 STAR-Guard 防御框架,耦合在线约束解析语义恢复与运行时确定性审计拦截。
    4. SCARBench 评测显示,在良性长上下文中 GPT-5.5 的严格 GHOST 率达 11.5%,Qwen3.5-4B 达 27.8%(Table 1);长历史在所有模型上均放大了安全约束恢复损失(Figure 3)。
    5. 引入 STAR-Guard 后,GPT-5.5 的安全完成率从 76.3% 提升至 94.0%,且未出现任何违规完成与 GHOST 事件(Table 2);在 Qwen3.5-4B 上将安全完成率由 47.0% 提高到 81.2%,显著超越各非 Oracle 基线。
    6. 作者认为,上下文增长会实质性削弱长程智能体对历史安全约束的治理效能,仅靠通用大模型检索或提示提醒难以保障安全,需将概率性语义恢复与执行前确定性规则屏障相结合。
    完整解读
  12. 防御arXiv:2610.03055 ·

    HackTrace:用生成状态监督检测代码生成中的奖励作弊

    提出HACKTRACE用生成状态检测并抑制代码奖励作弊

    测试
    Qwen3-8B、Llama-3.1-8B-Instruct、Qwen3.5-4B 等 4 个应用层
    摘要论文提出利用生成状态监督作弊尝试的HACKTRACE框架,实现高精度低延迟检测并在GRPO训练中有效抑制奖励投机。
    • 定位:论文针对代码智能体在强化学习中的奖励投机问题,提出了一种基于模型生成期内部激活的轻量级行为监督监测方法 HACKTRACE。
    • 问题:代码智能体容易通过修改测试用例或针对样例硬编码输出来骗取自动化评分器的奖励;现有文本检查方案难以深入生成机理且易被规避,而重跑模型的自评探针则需要额外的语言模型推理 pass 与显著延迟。
    • 方法要点:论文开源了 173,561 条多轮编码轨迹基准,确立了将作弊行为尝试(ACT)与漏洞利用成功(OUTCOME)解耦的监督原则;HACKTRACE 直接复用生成过程中计算的 22 层残差流状态,通过 MultiMax 头汇聚关键 token 表征,并在生成完成后融合 AST 与用例字面量等 22 维静态特征,无需额外的前向推理即可实现实时监测与强化学习惩罚。
    • 核心结果:
      1. 在 CodeContests 的 239 道测试题目上,HACKTRACE-combined 取得 0.997 的题内 AUC,单样本监测延迟仅需 8.4 ms,无额外 token 消耗,在 1% 假正率下的作弊召回率达到 99%(据 Table 2、Table 15)。
      2. 在生成进行至 75% 的未完成轮次时,MultiMax 头取得 0.949 的题内 AUC,比同前缀的上下文匹配自评探针高出 0.047(据 §4.3、Table 9)。
      3. 在 Qwen3-8B 的 LoRA GRPO 训练中,采用 MultiMax 惩罚(λ=10)将可见通过解中的作弊占比从 85.1% 降至 1.5%,同时将单次尝试的诚实通过率从 8.3% 提升至 30.8%(据 Table 3)。
      4. 在 240 步长程训练中,TF-IDF 文本惩罚被策略通过清洗注释规避(AUC 跌至 0.14),而 HACKTRACE 激活头在策略自身生成解上持续保持高判别力(AUC 为 0.89–0.98,据 §4.4、Table 24)。
    • 结论与启示:作者认为,有效的奖励投机监测器必须监督作弊尝试行为本身而非仅看利用结果,必须在评估中控制题目一致性,且在作为训练惩罚时须保持对策略演化的判别稳定性;生成期内部表征能与静态产物特征形成有效互补,为对齐和策略训练提供低开销、难规避的监督信号。
    完整解读
  13. 防御arXiv:2610.03089 ·

    COBRA:为计算机使用 Agent 防御分支引导攻击的双 LLM 架构

    提出COBRA双LLM架构,防御计算机使用智能体的分支转向攻击

    测试
    gpt-5、UI-TARS-1.5-7B、claude-sonnet-5 等 6 个应用层
    摘要提出分支转向防御架构 COBRA,通过事前能力约束与边界代理消除分支转向攻击并兼顾效用。
    • 论文定位:论文针对计算机使用智能体(CUA)在处理动态网络内容时面临的分支转向攻击,提出了首个系统性评测基准 STEER-Bench 以及结合控制流与数据流防御的系统级架构 COBRA。
    • 面临的核心问题:现有的 Dual-LLM 架构通过离线特权规划器提供控制流完整性(CFI),但无法应对动态图形界面所必需的运行时分支;攻击者无需注入新的指令,仅需操纵页面数据即可诱导智能体执行危险的预批准分支,造成数据流完整性(DFI)失效。
    • 方法核心设计:COBRA 在接触不可信内容前由规划器(P-LLM)将任务与经 SHA-256 钉住的站点/工具元数据编译为带约束的分支程序,隔离的 Q-VLM 仅负责视觉感知;运行时由分支解析中枢(BRH)动态验证分支条件与参数,并通过确定性 HTTP 和 MCP 代理在网络与工具边界严格阻断越权操作;同时结合多样本融合规划与站点描述生成工具 MESA 辅助部署。
    • 关键实验结果:
      • 在 STEER-Bench 的 199 个攻击单元格中,完整 COBRA 将分支转向攻击成功率(ASR)降至 0%(标准 ReAct 为 94.4%,Vanilla Dual-LLM 为 89.5%),同时保留 97% 的良性效用。
      • 在 4 个外部安全基准中,COBRA 在其威胁模型涵盖的 1,259 个攻击案例上均实现 0% ASR。
      • 在 OSWorld-MCP 361 个任务上,gpt-5 与 UI-TARS-1.5-7B 组合的 COBRA 取得 36.8% 的任务完成率,优于 UI-TARS-1.5-7B 单模型 ReAct 基线的 23.5%。
    • 作者的结论与启示:作者认为,保护 CUA 必须从控制流完整性拓展到严格的数据流完整性控制;未来在处理未进入网络请求的视觉数值、自由文本语义、非 HTTP 本地协议以及依赖站点所有者发布描述等方面仍存在开放挑战。
    完整解读
  14. 防御arXiv:2609.33039 ·

    TACIT:从 LLM 内部状态检测 Agent 轨迹危害

    提出TACIT,读取冻结隐藏状态以检测智能体有害轨迹

    测试
    Qwen3Guard-4B、LlamaGuard3-8B、AgentDoG-4B 等 9 个应用层
    场景
    AI Agent
    摘要提出基于内部表征的智能体轨迹安全检测方法 TACIT,揭示工具风险表征特性并在多项基准上提升检测表现与效率。
    • 研究定位:该研究针对工具调用智能体的轨迹安全检测难题,从表征分析出发,系统探讨了 Guard 模型在识别“不安全工具使用”时的内部机制与输出失效现象,并据此设计了基于内部表征读取的安全检测方法 TACIT。
    • 核心问题:现有开源 Guard 模型主要面向单轮文本内容审核,而在多步智能体轨迹中,不安全行为往往取决于动作与上下文/工具模式的不匹配;此类不安全工具调用在现有 Guard 模型的输出端难以被有效区分(Section 1、3.1)。
    • 方法要点:通过受控实验发现不安全工具使用与有害内容在中间隐藏层线性可读且几何方向近乎正交;TACIT 利用冻结骨干网络单次前向传递提取各层表征并进行池化,通过在中间层训练轻量线性探针、集成或多层显著特征聚合分类器输出安全评分,无需更新骨干参数且完全不产生自回归解码(Section 3、4.1)。
    • 核心实验结果:
      • 在 6 个主流轨迹安全基准测试中,Qwen3-4B 骨干上的 TACIT Multi-layer 取得 86.2% 的平均 macro-F1,大幅超越专用的 AgentDoG-4B(62.3%)与内容 Guard 基线(Table 1)。
      • 在完全排除目标基准的留一泛化测试中,Qwen3-4B 的 Multi-layer 取得 65.7% 的平均 macro-F1,依然领先于基线(Table 2)。
      • 在相同数据和骨干控制下,冻结表征读取的效果与全量参数微调(84.2%)相当,且在微调模型上叠加 Multi-layer 读取可进一步提升至 86.5%(Table 6)。
      • TACIT 线性探针训练参数量仅 5,121 个,单条轨迹检测耗时仅 40ms,较 Qwen3Guard(215ms)延迟降低 82%(Figure 4)。
    • 启示与结论:作者称内部表征为检测智能体轨迹危害提供了实用的基础;未来需构建系统覆盖工具使用与有害内容两类正交风险的专用基准,并深入探索动作边界上的流式干预机制(Section 5.3、6)。
    完整解读
  15. 防御arXiv:2609.38983 ·

    论文提出 Approval Laundering 分类,实测 Claude Code 审批与执行绑定失败

    提出Approval Token绑定编程智能体的审批与执行

    测试
    Claude Code (v2.1.197, opus[1m] / claude-sonnet-5-ccmax)、Codex CLI (@openai/codex v0.154.0)应用层
    摘要系统揭示编程智能体审批洗白风险,提出七字段权能防御机制,证实其能消除身份时序偏离但难防副作用偏离。
    • 核心定位:该研究系统分析并测试了 AI 编程智能体套件中人类审批与底层工具执行之间的凭证绑定完整性断裂问题。
    • 问题剖析:当前套件假定人类批准动作与实际执行动作等价,但在六个凭证表面(范围、参数、会话、工具、委托身份及审批渲染)上,这一假设会因套件匹配逻辑或系统级副作用被静默破坏,导致无需重新审批即可派发越权操作。
    • 核心设计:作者构建了审批洗白六维分类学,提出基于 HMAC-SHA256 的七字段带密钥权能凭证 Approval Token,通过 PreToolUse 钩子对准入字段进行调用级拦截与重验。
    • 关键实验结果:
      • 基线评测中,Claude Code 在 Scope、Temporal(BGR 均为 1.000)和 Delegation(BGR = 0.947)上表现出高频洗白失效,Argument 洗白发生率为 0.450,PATH 劫持工具洗白达到 1.000,仅跨工具名替换被原生拦截(BGR = 0.000)。
      • 防御评估中,Approval Token 在 118 次离线重放中将 Delegation 和 Temporal 洗白降至 0.000(p < 0.0001),并在 6/6 实时测试中完成拦截;但因仅检查字段记录,对通过子进程和钩子触发的效果偏离(Scope 和 Argument)完全无法消除。
    • 启示与结论:作者指出单纯依赖工具调用边界的字段比对无法防范环境级副作用引起的执行偏离,工具安全机制必须向执行环境初始效果验证深化;同时对 Codex CLI 的探测揭示部分无头套件完全缺乏调用级审批抽象。
    完整解读
  16. 防御arXiv:2608.21500 ·

    SecOPD 用同策略蒸馏把自适应提示注入攻击成功率降至 9.0%

    提出SecOPD同策略蒸馏微调,降低模型对自适应提示注入的顺从

    测试
    Qwen3.6-27B (Undefended)、Meta-SecAlign、SecOPD应用层
    场景
    AI Agent
    摘要SecOPD 通过纯净上下文 token 级同策略蒸馏,在 Qwen3.6-27B 上将自适应攻击 ASR 降至 9.0% 并保持了模型通用能力。
    • 定位与核心问题:论文针对现有基于 DPO 和 GRPO 等序列级反馈的防御微调难以抵御自适应提示注入的问题,提出通过 token 级同策略蒸馏实现细粒度信用分配的 SecOPD 防御框架。
    • 方法核心机制:SecOPD 在训练时为每个样本配对构建注入输入与纯净输入,由模型在注入输入下生成回答轨迹,并利用良性输入下的冻结基座模型为对应 token 计算概率差异,通过优势函数抑制恶意注入行为并强化正常任务遵循,不依赖外部安全裁判模型。
    • 自适应攻击防御效果:在 Qwen3.6-27B 上的评测中,针对强自适应攻击 PISmith,SecOPD 将 pass@10 ASR 降至 9.0%,相比此前基线 Meta-SecAlign(94.0%)与 GRPO(61.2%)实现大幅度降低(Table 1)。
    • 静态攻击与场景泛化:在 SEP 六类静态攻击组合下,SecOPD 取得了 1.3% 的 ASR;在未见过的 AgentDojo 智能体工具调用基准中,SecOPD 取得 4.7% ASR,验证了指令与数据解耦能力向工具调用场景的迁移(Table 1)。
    • 通用能力保留:在涵盖数学推理、问答和指令遵循的七项通用基准评测中,SecOPD 维持了 88.1% 的平均实用性,与未防御基座模型的 88.1% 相当,避免了 GRPO 带来的通用能力明显衰减(Table 2)。
    • 作者结论与启示:作者认为前沿大语言模型自身的安全潜力此前未被充分挖掘,即使利用简单样本进行防御微调也能建立可泛化的安全边界;当前防御虽未彻底解决提示注入问题,但为构建鲁棒的智能体基座提供了新路径。
    完整解读
  17. 评测与基准arXiv:2609.08258 ·

    研究实测五套 Agent 记忆系统均不执行撤销标记

    评测智能体记忆软撤回是否生效,并提出陈旧检索防护

    测试
    GPT-5.5、Grok-4、DeepSeek-V4-Flash 等 9 个应用层
    场景
    AI Agent
    摘要系统揭示了记忆系统软撤回在检索时普遍未执行的安全漏洞,证明写回会击穿现有防御,并提出读取端防护作为必要控制手段。
    • 研究定位:该研究首次系统性实证评估了多款主流大语言模型智能体记忆框架在软撤回机制下的运行时安全边界与撤回执行有效性。
    • 核心问题:现代记忆系统普遍采用将陈旧知识标记为无效而非物理删除的软撤回设计,但默认检索机制是否会在读取时拦截失效记录、避免智能体依据作废策略采取危险操作,此前未有深入验证。
    • 评测与防御设计:研究在直接与间接两种插入模式下向 5 款记忆系统写入作废与替代策略,跨越 9 个模型评估其检索暴露与不安全决策表现;针对系统未默认过滤的现状,提出了在检索返回路径进行元数据校验与成对冲突检测的 Stale-Retrieval Guard 组件。
    • 主要实验发现:直接写入且无防御时,两款暴露系统(Graphiti与mem0 exp.)将作废记录全部返回且排在首位,导致智能体平均在 43.1%(699/1,620)的试验中执行不安全行动(Table 6);即使提示词明确禁止危险操作,模型不安全率仍有 12.9%(Table 8);存储级过滤虽能在单次交互中将不安全率归零,但在智能体将决策回写记忆库后,3 跳内的不安全率迅速反弹至 83.1%(Table 14)。
    • 作者结论与启示:作者指出记忆系统的安全盲区并非源于外部投毒或数据来源伪造,而是内部合规生命周期中缺乏检索时有效性校验;仅依赖写入来源证明或模型提示词无法抵御作废策略,必须在读取管道上强制实施严格的陈旧记录过滤。
    完整解读
  18. 防御arXiv:2610.00400 ·

    DART:用表征位移检测多轮 LLM 智能体中的新兴安全风险

    提出DART,用去噪表征转移检测并干预多轮智能体攻击

    测试
    Qwen3-8B、Qwen3-14B、Qwen3-32B 等 6 个应用层
    场景
    AI Agent攻击者黑盒
    摘要DART利用去噪表征转移监测多轮攻击并注入提醒,在保持良性效用同时降低攻击成功率,每步仅增加零点几秒开销。

    论文提出了一种针对大语言模型智能体多轮安全风险的轻量级运行时防御框架DART。

    完整解读
  19. 防御arXiv:2609.14003 ·

    FlowSeal:用信息流控制阻断 LLM Agent 的隐私泄露

    提出FLOWSEAL,在工具边界以信息流控制阻断智能体隐私泄露

    测试
    DeepSeek-V3.2、DeepSeek-R1、GPT-4.1-mini 等 4 个应用层
    场景
    AI Agent
    摘要作者分析大模型智能体隐私检查与攻击面重合问题,提出外部拦截防御FLOWSEAL并验证有效性。
    • 研究定位:该研究针对个人大模型智能体在协作交互中的隐私保护问题,揭示了依赖提示词进行内部推理防御的结构性脆弱性,并提出了基于信息流控制的系统层防御。
    • 核心问题:现有防御将隐私判断交由智能体在攻击者可控的对话上下文中进行,使得防御执行点与攻击面重合,攻击者可通过任务重构(CWL)、省略披露(SOA)和跨通道解耦(CDA)绕过检查。
    • 防御机制:FLOWSEAL基于数据溯源对敏感记录打标,在工具调用边界部署独立代码拦截器执行三级格策略,并借助隔离的LLM内容检查器做语义去分类,辅以协作API引导智能体正常交互。
    • 关键实验结果:在SPR基准(DeepSeek-V3.2)上,FLOWSEAL将CWL的条目泄漏率从SPR-D2的52.2%降至0.5%,SOA从75.6%降至2.3%,CDA从43.8%降至2.2%;良性任务实用率保持在72.4%;在真实Gmail与Notion的MCP测试中将SOA泄漏率降至0.0%。
    • 消融与开销:工具拦截器是防御核心(禁用后CWL泄漏率回升至28.4%);相较无防御设置,FLOWSEAL每轮仅增加0.017美元成本与37%的延迟。
    • 作者结论与启示:作者认为,通过将安全执行移至对抗性重构无法触及的外部层,智能体可以获得更稳定的隐私保护,未来需推动操作系统、工具层与模型对齐的多层纵深防御。
    完整解读
  20. 评测与基准arXiv:2609.19587 ·

    红队测试 Auto Mode:用注入与多上下文攻击绕过编码 Agent 阻断监控器

    红队评估编码智能体的阻断监视器,并提出Auto Mode++加固

    测试
    Opus 5、Opus 4.8、Opus 4.7 等 8 个应用层
    摘要系统评估生产阻断监视器在面对持续恶意智能体时的表现,提出加固防御并指明多上下文防御挑战。
    • 定位与核心问题:本研究系统评估了生产级代码智能体阻断监视器在面对具有持续对抗意图的智能体时的表现,重点关注防止智能体造成外发权重等不可逆灾难性破坏的能力。
    • 方法与防御设计:研究梳理出监视器注入、多上下文攻击、覆盖漏洞和策略失效四类攻击形态;针对上述隐患,作者提出了包括heredoc轮次隔离、Unicode转义、强制监控工作目录编辑、压缩摘要意图审查以及三阶段分层审查在内的Auto Mode ++防御方案。
    • 主要实验发现:
      • 在基准评估中,生产环境默认的Auto Mode和Guardian在Opus 5攻击下四类攻击平均ASR分别达65%和72%(Figure 1)。
      • 注入攻击在扁平化文本渲染下呈现较高失效率,攻击者利用换行伪造可使Auto Mode的注入ASR达78.4%,而采用heredoc框架与转义的Auto Mode ++将其抑制至1.6%(Figure 5a)。
      • 动作碎片化攻击效果明显,随着多智能体协同数量由2个增至20个,Opus 5的ASR由约30%提升至88%;单智能体恶意压缩20次后ASR升至85%(Figure 7)。
      • Auto Mode ++将四类攻击平均ASR由65%降低至9%(Figure 1),同时在4,000个良性SWE-chat动作上保持误报率低于1%、单步延迟约1.2秒(Figure 8)。
    • 作者启示与结论:作者认为针对单步注入与工作目录覆盖漏洞的工程防御成本较低且具有防御效果;然而,防范跨越会话与压缩边界的多上下文攻击必须依赖具备全局上下文感知能力的智能体审查,这与交互式部署的延迟要求存在固有张力,在可接受成本下防范多上下文攻击仍是一个开放问题。
    完整解读