跳到正文
10月8日 · 周四

全部论文

精选论文 220 篇
  1. 防御arXiv:2610.09793 · 61

    用时序逻辑监控工具 Agent:MonPoly 标出 71.8% STAC 攻击链,但溯源检查被一行注入骗过 94%–99%

    在AgentDojo与STAC上离线重放时序验证,通用规约检出超70%攻击但良性触发率达29.3%,强化溯源可防历史投毒。

    • 70.1%AgentDojo上GPT-4o无防御成功攻击的通用规约检出率(Table 1)
    • 29.3%AgentDojo上GPT-4o良性运行的通用规约良性触发率(Table 1)
    • 71.8%STAC基准全部483条攻击链隐匿最终步的规约检出率(Section 4.1)
    6 问速览研究工具调用智能体多步安全策略的形式化时序验证及现有基准支撑能力。
    1. 这篇论文试图解决什么问题?

      研究工具调用智能体多步安全策略的形式化时序验证及现有基准支撑能力。

    2. 有哪些相关研究?

      梳理了智能体护栏、攻击评测基准与时序验证工具,强调本文立足离线重放。

    3. 论文如何解决这个问题?

      将轨迹映射为事件流并采用MFOTL与强化溯源机制进行离线验证。

    4. 论文做了哪些实验?

      通用规约检出超70%但误报近30%,参数化与强化溯源显著优化区分度。

    5. 有什么可以进一步探索的点?

      作者指出了离线重放与语义盲区局限,度量时序仅在合成日志验证。

    6. 总结一下论文的主要内容

      形式化验证可有效识别多步攻击,但其有效性高度依赖轨迹的可信历史记录。

    完整解读
  2. 防御arXiv:2609.11757 · 60

    研究者披露 AP2 支付协议的 Whisper 提示注入攻击并提出 A-VIP 防御

    作者对AP2开展Whisper决策攻击与A-VIP防御,事实操纵在gemini-3.1-flash-lite达73.3%。

    • 90%gemini-2.5-flash-lite上Vault Whisper成功率(Table 3)
    • 56%gemini-2.5-flash-lite上Branded Whisper成功率(Table 3)
    • 73.3%gemini-3.1-flash-lite上Selection Whisper成功率(Table 3)
    6 问速览协议层签名能验证交易未篡改,但无法约束做决策的推理过程,导致商户文本可操纵智能体行为。
    1. 这篇论文试图解决什么问题?

      协议层签名能验证交易未篡改,但无法约束做决策的推理过程,导致商户文本可操纵智能体行为。

    2. 有哪些相关研究?

      现有研究涵盖智能体支付安全、提示注入基准及模型输入输出防御,但缺乏意图与决策的协议层绑定。

    3. 论文如何解决这个问题?

      A-VIP将意图视为权能授权,通过会话令牌解耦凭据、结构化比对绑定购物车,并对未授权超支触发确认。

    4. 论文做了哪些实验?

      评测覆盖17个Google模型及跨厂商模型,实测记录到事实操纵普遍有效,A-VIP成功拦截结构篡改。

    5. 有什么可以进一步探索的点?

      作者指出同价替换无法拦截、确认依赖用户审查及扫描器误报等局限,未来可探索多轮社工与密码学证明。

    6. 总结一下论文的主要内容

      论文揭示了AP2协议决策层受操纵的风险,提出结构化与权能绑定防御A-VIP,并发布评测基准。

    完整解读
  3. 防御arXiv:2610.07359 · 54

    论文实测 Agent 工具调用门控栈的失败相关性

    论文在三套语料上实测规则与LLM裁判,发现裁判间错误相关且等效层数仅1.2–1.4,跨机制组合达1.86–2.09层(STRICT)。

    • 1.22 to 1.44STRICT定义下任意两LLM裁判组合的等效层数区间(Table IV)
    • 1.86 to 2.09STRICT定义下规则层加一个LLM裁判的等效层数区间(Table IV)
    • +0.430STRICT定义下6组裁判对间相关系数phi中位数(Table III)
    6 问速览论文检验动作门禁堆叠中各层错误相乘的独立性假设,并评估各层对整栈的实际贡献。
    1. 这篇论文试图解决什么问题?

      论文检验动作门禁堆叠中各层错误相乘的独立性假设,并评估各层对整栈的实际贡献。

    2. 有哪些相关研究?

      论文梳理了防御堆叠故障关联、大模型协同错误、冗余工程及运行时拦截架构等相关研究。

    3. 论文如何解决这个问题?

      论文提出乘积等效层数指标nmult,并在脱敏设定下对规则与多模型裁判构建堆叠评测框架。

    4. 论文做了哪些实验?

      论文在汇聚语料与分项实验中测试了等效层数、单层增益背离、混淆假说及复核规则影响。

    5. 有什么可以进一步探索的点?

      作者指出机制采样单一、全栈删失及无人工层等局限,实验仅覆盖至特定语料及静态门禁。

    6. 总结一下论文的主要内容

      论文实测发现大模型裁判间错误显著相关,作者主张按机制选型并在整栈层面度量防护增益。

    完整解读
  4. 防御arXiv:2610.06966 · 53

    APEX:在 LLM Agent 执行边界主动防御间接提示注入

    APEX在执行边界基于预编译授权契约与探针防御间接提示注入,在5个基准上取得0% ASR,在SkillInject上为0.56%。

    • 0.00%AgentDojo基准下DeepSeek-V4-Flash的ASR(Table 1)
    • 0.00%ASB-OPI基准下DeepSeek-V4-Flash的ASR(Table 1)
    • 0.00%MCPTox基准下DeepSeek-V4-Flash的ASR(Figure 3 / Table 3)
    6 问速览在LLM智能体执行边界拦截由异构能力单元和组合攻击引入的未经授权动作与未背书信息使用。
    1. 这篇论文试图解决什么问题?

      在LLM智能体执行边界拦截由异构能力单元和组合攻击引入的未经授权动作与未背书信息使用。

    2. 有哪些相关研究?

      梳理了内容过滤、任务对齐、策略控制、数据溯源及蜜罐防御,指出其缺乏执行边界统一判定。

    3. 论文如何解决这个问题?

      通过预编译DAG授权契约,在执行边界以WRAP验证参数证据、PLANT检测探针并实现安全恢复。

    4. 论文做了哪些实验?

      在6个基准上对比13种基线,5个基准达成0% ASR,自适应攻击下均保持0% ASR。

    5. 有什么可以进一步探索的点?

      局限在于契约保真度依赖、动态委托支持不足及长视距编译挑战;实验覆盖3种模型与6个基准。

    6. 总结一下论文的主要内容

      APEX在执行边界基于预编译授权契约实施证据门控与欺骗探针,在多基准上达成近零ASR。

    完整解读
  5. 防御arXiv:2605.17380 · 54

    Uber 提出 ADR 企业级 Agent 检测系统,在 7200 台主机部署十个月

    Uber 团队提出企业级智能体检测系统 ADR,在 ADR-Bench 上实现零误报与 0.800 F1,并在生产部署中拦截凭据泄漏。

    • 0.800ADR,ADR-Bench,F1-score(Table 2)
    • 1.000ADR,ADR-Bench,Precision(Table 2)
    • 0.667ADR,ADR-Bench,Recall,检出 28/42(Table 2)
    6 问速览解决企业 MCP 智能体缺乏语义遥测、规则难以泛化及大模型全量检测成本高的问题。
    1. 这篇论文试图解决什么问题?

      解决企业 MCP 智能体缺乏语义遥测、规则难以泛化及大模型全量检测成本高的问题。

    2. 有哪些相关研究?

      梳理了智能体安全基准、智能体防御系统及自动化红队研究,指出其在 MCP 覆盖与自适应上的不足。

    3. 论文如何解决这个问题?

      通过 Sensor 重建因果遥测,结合 Tier 1/2 分级检测与 Explorer 进化红队实现闭环防护。

    4. 论文做了哪些实验?

      在 ADR-Bench 上达 0 误报与 0.800 F1,在 AgentDojo 达 0.962 F1,并完成了生产环境部署验证。

    5. 有什么可以进一步探索的点?

      作者指出需拓展多智能体与网关防护,实验覆盖了两个基准、三类基线与企业端点部署。

    6. 总结一下论文的主要内容

      提出了端点因果遥测、两级在线分流与离线红队闭环的 ADR 系统,并在生产环境中验证了有效性。

    完整解读
  6. 防御arXiv:2610.05640 · 55

    研究揭示 CaMeL 防护在多智能体系统中失效并提出 multi-CaMeL

    论文提出 multi-CaMeL 防御,在 MultiAgentDojo 上将平均 ASR 从 12.9% 降至 0.0%。

    • 0.0%MultiAgentDojo 平均 ASR,multi-CaMeL(Table III)
    • 12.9%MultiAgentDojo 平均 ASR,No CaMeL(Table III)
    • 0.2%MultiAgentDojo 平均 ASR,单智能体 CaMeL(Table III)
    6 问速览单个智能体的控制流完整性无法在分层多智能体系统中直接组合,非可信数据跨边界会被下游智能体当作可信指令而劫持控制流。
    1. 这篇论文试图解决什么问题?

      单个智能体的控制流完整性无法在分层多智能体系统中直接组合,非可信数据跨边界会被下游智能体当作可信指令而劫持控制流。

    2. 有哪些相关研究?

      论文梳理了间接提示注入防御、多智能体协作与安全性、以及控制流完整性与信息流控制等方向的研究。

    3. 论文如何解决这个问题?

      提出 multi-CaMeL 协议,将智能体间调用拆分为可信指令与非可信变量两个通道,并由解释器在运行时保持溯源。

    4. 论文做了哪些实验?

      在 MultiAgentDojo 与 AssetOpsBench 上测试 5 款模型,multi-CaMeL 将 ASR 降至 0.0% 且效用代价较小。

    5. 有什么可以进一步探索的点?

      局限包括仅限树状拓扑、继承了 CaMeL 解释器的隐式依赖缺陷;未来可扩展至非树状架构并建立更强信息流保证。

    6. 总结一下论文的主要内容

      论文针对多智能体中单体防御不组合的边界清洗问题,提出 multi-CaMeL 协议彻底阻断了 MultiAgentDojo 上的注入攻击。

    完整解读
  7. 防御arXiv:2610.04504 · 53

    论文提出 VAL 框架:相同 ASR 的 LLM Agent 防御可能对应不同安全保证

    论文用VAL框架对比防御,在自建测试集上VAL栈获0.000 ASR且保持1.000良性效用,直觉栈良性效用为0。

    • 0.000DeepSeek自建集静态攻击VAL栈(V)的ASR(据表6)
    • 0.000DeepSeek自建集静态攻击直觉栈(N)良性成功率(据表6)
    • 0.5%DeepSeek在AgentDojo银行套件VAL栈ASR(据表6.5)
    6 问速览论文旨在解决智能体防御缺乏理论保证来源的问题,提出VAL框架以区分行为运气与结构约束。
    1. 这篇论文试图解决什么问题?

      论文旨在解决智能体防御缺乏理论保证来源的问题,提出VAL框架以区分行为运气与结构约束。

    2. 有哪些相关研究?

      论文梳理了验证自治等级、文本与工具级防御以及智能体评测基准,将本文定位为先验分类坐标轴。

    3. 论文如何解决这个问题?

      通过扩展VAL规则分级防御,并构建确认门与参数沙箱组合的结构栈,以平台记录和形式规范约束动作。

    4. 论文做了哪些实验?

      实验在自建集和AgentDojo等多基准上对比结构栈与直觉栈,揭示相同零值背后的效用鸿沟与稳定性差异。

    5. 有什么可以进一步探索的点?

      作者指出了受害者模型较少、评定者无人类参与等局限;实验覆盖了三个模型和多个基准测试套件。

    6. 总结一下论文的主要内容

      论文证明相同ASR不等于相同安全保证,VAL结构栈在保持效用的同时提供超越模型行为运气的防御。

    完整解读
  8. 防御arXiv:2610.05870 · 53

    MBZUAI 提出可校准的真实图像认证方法,20 个深伪检测器在对抗扰动下全部跌破 2% 准确率

    研究者提出基于生成器反演保真度与阈值校准的真实图像认证方法,在1% FPR下能防御 ϵ=8/255 的PGD扰动。

    • 1.75%D3在ϵ=8/255的PGD攻击下的后验准确率(Table I)
    • 0.00%OmniAID等12个基线在ϵ=8/255攻击下的后验准确率(Table I)
    • 0.0154SD3 Medium下100次采样加PGD优化后的最高A-index(第V-B节)
    6 问速览针对生成器演进导致检测准确率下降及对抗脆弱性,论文提出通过反演保真度与阈值校准对真实内容进行健全认证。
    1. 这篇论文试图解决什么问题?

      针对生成器演进导致检测准确率下降及对抗脆弱性,论文提出通过反演保真度与阈值校准对真实内容进行健全认证。

    2. 有哪些相关研究?

      论文讨论了主动水印与元数据、被动特征与重构检测器、视频时序检测以及扩散反演技术,并明确了本文与基线的区别。

    3. 论文如何解决这个问题?

      论文通过整流流动反演计算四维融合真实性指数,并依据生成样本及攻击样本离线校准安全与防御双阈值进行认证或弃权。

    4. 论文做了哪些实验?

      实验显示基线检测器在PGD攻击下准确率跌破2%,而校准阈值保持1% FPR;Reddit图像可认证比例随生成器演进下降超14倍。

    5. 有什么可以进一步探索的点?

      作者指出反演计算开销高、无法覆盖黑盒模型与私有微调、防御阈值仅限已知攻击类别,以及视频未建模时序动态等局限。

    6. 总结一下论文的主要内容

      论文提出基于反演保真度与阈值校准的健全认证框架,在对抗扰动下维持错误率界限,并指出真实内容可认证性随生成器演进而萎缩。

    完整解读
  9. 防御arXiv:2610.05163 · 59

    研究者在 Claude Code 和 Codex 上构造分段提示注入并发布边界动作审计基准

    作者针对长流程智能体构建分阶段注入基准,提出PAA方法在边界动作前实现86%召回与6-8%误阻率。

    • 86.1%Claude Code全基准fail-open,Claude Sonnet 5,PAA BLOCK召回率(Table 2)
    • 6.0%Claude Code全基准fail-open,Claude Sonnet 5,PAA FBR(Table 2)
    • 86.0%Codex全基准fail-open,Claude Sonnet 5,PAA BLOCK召回率(Table 2)
    6 问速览长流程智能体面临分阶段间接提示注入威胁,需在动作生效前进行边界动作审计。
    1. 这篇论文试图解决什么问题?

      长流程智能体面临分阶段间接提示注入威胁,需在动作生效前进行边界动作审计。

    2. 有哪些相关研究?

      梳理了自动化注入、智能体安全基准及运行时审计,指出前人缺乏动作级统一拦截评测。

    3. 论文如何解决这个问题?

      PAA将动作分解为要素并双重归因取值与决策来源,结合代码检验与模型裁决判定阻断。

    4. 论文做了哪些实验?

      PAA在两语料全基准上达86%召回率与6-8% FBR,显著优于基线。

    5. 有什么可以进一步探索的点?

      作者指出了离线重放、无自适应对抗等局限,实验覆盖了2个系统与8个场景。

    6. 总结一下论文的主要内容

      论文针对长流程注入提出边界动作审计与PAA,在保持低误阻的同时实现高拦截率。

    完整解读
  10. 防御arXiv:2609.12001 · 57

    Pheo 提出 OATS:用确定性解析器在运行时治理 Agent 技能动作

    研究发现ClawHub有705个全clean技能含违规指令,实测34.7%命令后果类文档未记载,OATS拦截了全部违规尝试。

    • 705ClawHub四项扫描全clean但指示禁止操作的技能数(Table 2)
    • 92.0%人工抽检100个违规检出技能的Precision(95% CI [84.8%, 96.5%],§4)
    • 34.7%Claude Sonnet 5实测中后果类未在文档出现的命令占比(Table 3)
    6 问速览发布时恶意检测无法替代运行时动作许可控制,且文档静态分析无法约束智能体动态重构生成的实际执行操作。
    1. 这篇论文试图解决什么问题?

      发布时恶意检测无法替代运行时动作许可控制,且文档静态分析无法约束智能体动态重构生成的实际执行操作。

    2. 有哪些相关研究?

      相关研究涵盖注册表扫描与供应链攻击、运行时LLM防护栏、系统引用监视器与轨迹保证,论文定位在动作级轻量拦截。

    3. 论文如何解决这个问题?

      设计确定性解析器映射命令后果类别,结合分车道信任账本与风险容忍度推导晋升阈值,在工具调用前无模型介入地判定操作。

    4. 论文做了哪些实验?

      在6.6万技能库及实机智能体中,测出705个clean技能含违规指令,智能体34.7%命令后果脱离文档,OATS拦截了全部违规动作。

    5. 有什么可以进一步探索的点?

      作者指出了非动作型危害盲区、单命令语法规避与依赖自审计等局限,实验也主要集中于单模型单日及单一注册表快照。

    6. 总结一下论文的主要内容

      论文论证了发布时恶意扫描无法替代运行时动作许可控制,提出了轻量确定性控制门OATS,展示了双层防御组合的必要性。

    完整解读
  11. 防御arXiv:2610.03502 · 53

    研究者提出可认证机制编辑:在连续输入区域上证明技能移除与保留

    论文形式化认证机理编辑:在Transformer的448维扰动下移除半径达0.0091,并证明黑盒测试无法保证移除。

    • 0.0091Softmax+LN Transformer在448维嵌入扰动下的移除认证半径
    • 0.0156门控Transformer在48维扰动下消除技能A的精确认证半径
    • 0.0125门控Transformer在消除技能A后保留技能B的认证半径
    6 问速览解决现有机理编辑仅靠测试集验证无法覆盖连续输入空间、且黑盒测试无法在理论上排除微小存活区间的问题。
    1. 这篇论文试图解决什么问题?

      解决现有机理编辑仅靠测试集验证无法覆盖连续输入空间、且黑盒测试无法在理论上排除微小存活区间的问题。

    2. 有哪些相关研究?

      涉及解释性形式化验证、模型编辑偏差界与统计遗忘、黑盒不可行性理论以及几何信息流控制等相关研究。

    3. 论文如何解决这个问题?

      通过SMT精确求解与CROWN边界传播,结合凸包松弛与双副本孪生编码,数学证明连续区域内的技能移除与非干涉。

    4. 论文做了哪些实验?

      在玩具MLP至Transformer上评测了认证半径、干预幻觉、手术与引导对比以及特征非干涉,反驳了黑盒测试的完备性。

    5. 有什么可以进一步探索的点?

      作者指出方法受限于可判定规则假设、模型规模瓶颈与证明器松弛,后续需向真实语言模型与离散提示词扩展。

    6. 总结一下论文的主要内容

      提出机理编辑形式化认证框架,证明编辑在连续区域生效且黑盒测试无法保证移除,为安全编辑提供数学证明。

    完整解读
  12. 防御arXiv:2610.02664 · 53

    论文提出 GHOST:长程智能体在良性对话中遗忘早期安全约束,GPT-5.5 发生率 11.5%

    研究智能体跨轮遗忘约束的 GHOST,GPT-5.5 在 SCARBench 达 11.5% GHOST 率,双层防御降至 0。

    • 11.5%GPT-5.5 在 SCARBench 上的严格 GHOST 率(Table 1)
    • 27.8%Qwen3.5-4B 在 SCARBench 上的严格 GHOST 率(Table 1)
    • 0.0%STAR-Guard 防御下 GPT-5.5 在 SCARBench 的 GHOST 率(Table 2)
    6 问速览研究长程智能体在良性多轮交互中恢复任务时遗忘早期安全约束的 GHOST 失效模式与治理危害。
    1. 这篇论文试图解决什么问题?

      研究长程智能体在良性多轮交互中恢复任务时遗忘早期安全约束的 GHOST 失效模式与治理危害。

    2. 有哪些相关研究?

      涵盖长上下文指令保持、智能体安全基准与防御、无限时界安全分析及通用记忆与自我修正基线。

    3. 论文如何解决这个问题?

      基于条件风险理论证明,提出耦合在线语义约束恢复与执行前确定性审计修复的双层防御框架。

    4. 论文做了哪些实验?

      在 7 个模型上评测 SCARBench,GPT-5.5 的 GHOST 率达 11.5%,STAR-Guard 消除违规。

    5. 有什么可以进一步探索的点?

      作者指出防御保证依赖前端正确性、干预影响完成度等局限,并指明机理与规则表达等后续方向。

    6. 总结一下论文的主要内容

      揭示 GHOST 跨轮约束遗忘风险,构建 SCARBench 基准并通过 STAR-Guard 双层防御消除违规。

    完整解读
  13. 防御arXiv:2610.03089 · 53

    COBRA:为计算机使用 Agent 防御分支引导攻击的双 LLM 架构

    COBRA 通过事前分支能力约束与代理拦截,在 STEER-Bench 上将攻击成功率降至 0% 并保留 97% 良性效用。

    • 0%STEER-Bench 全部 199 个攻击单元格,完整 COBRA 系统的 ASR
    • 97%STEER-Bench 138 个良性单元格,COBRA 相比 Dual-LLM 保留的良性效用
    • 89.5%STEER-Bench 74 个通用智能体单元格,Vanilla Dual-LLM 基线的 ASR
    6 问速览动态网页促使计划产生分支,导致攻击者可通过操控数据诱导智能体执行危险分支(分支转向攻击)。
    1. 这篇论文试图解决什么问题?

      动态网页促使计划产生分支,导致攻击者可通过操控数据诱导智能体执行危险分支(分支转向攻击)。

    2. 有哪些相关研究?

      梳理了 CUA 概率性防御、Dual-LLM 等系统级架构、MCP 安全及现有评测基准,指出 DFI 防御的缺失。

    3. 论文如何解决这个问题?

      提出 COBRA 架构,结合离线计划能力约束、运行时分支解析中枢及确定性 HTTP/MCP 代理拦截。

    4. 论文做了哪些实验?

      在 STEER-Bench 及 4 个外部基准中将 ASR 降至 0%,在 OSWorld-MCP 上保留实用任务完成能力。

    5. 有什么可以进一步探索的点?

      作者指出其在未体现在网络请求的视觉数值、自由文本语义、非 HTTP 接口及对站点描述的依赖等局限。

    6. 总结一下论文的主要内容

      提出分支转向防御架构 COBRA,通过事前能力约束与边界代理消除分支转向攻击并兼顾效用。

    完整解读
  14. 防御arXiv:2609.33039 · 54

    TACIT:从 LLM 内部状态检测 Agent 轨迹危害

    作者提出基于冻结内部表征读取的TACIT检测智能体轨迹;在6个基准上Qwen3-4B Multi-layer平均macro-F1达86.2%(Table 1)。

    • 86.2%Qwen3-4B下TACIT Multi-layer在6个基准上的平均macro-F1(Table 1)
    • 62.3%AgentDoG-4B在6个基准上的平均macro-F1(Table 1)
    • 65.7%Qwen3-4B下TACIT Multi-layer在留一基准评估中的平均macro-F1(Table 2)
    6 问速览解决开源 Guard 模型在智能体轨迹上难以有效检测不安全工具使用与多步交互风险的问题。
    1. 这篇论文试图解决什么问题?

      解决开源 Guard 模型在智能体轨迹上难以有效检测不安全工具使用与多步交互风险的问题。

    2. 有哪些相关研究?

      涉及智能体轨迹安全基准、安全 Guard 模型以及基于模型内部表征的安全检测与干预三类研究。

    3. 论文如何解决这个问题?

      提出 TACIT,从冻结骨干网络的中间层读取表征并通过线性探针、集成或多层聚合输出安全评分。

    4. 论文做了哪些实验?

      在 6 个基准上评测了检测性能、留一泛化能力、与 SFT 结合效果及训练与推理效率。

    5. 有什么可以进一步探索的点?

      作者指出流式检测需动作级评测与闭环校准,且需构建平衡两类风险的基准;实验覆盖 6 个离线基准与 2 类模型。

    6. 总结一下论文的主要内容

      提出基于内部表征的智能体轨迹安全检测方法 TACIT,揭示工具风险表征特性并在多项基准上提升检测表现与效率。

    完整解读
  15. 防御arXiv:2609.38983 · 58

    论文提出 Approval Laundering 分类,实测 Claude Code 审批与执行绑定失败

    在Claude Code上测试表明审批与执行动作存在六类解绑失效,基于HMAC的Approval Token可消除委托与时序洗白但无法防范效果偏离。

    • 1.000Claude Code在Scope场景下的基线BGR(Table 3)
    • 1.000Claude Code在Temporal场景下的基线BGR(Table 3)
    • 0.947Claude Code在Delegation场景下的基线BGR(Table 3)
    6 问速览研究编程智能体套件中人类审批与底层工具执行动作脱钩的审批洗白问题,分析六类凭证绑定失效模式。
    1. 这篇论文试图解决什么问题?

      研究编程智能体套件中人类审批与底层工具执行动作脱钩的审批洗白问题,分析六类凭证绑定失效模式。

    2. 有哪些相关研究?

      对比智能体授权机制、测量基准与混淆代理研究,指出现有工作均未覆盖全部六类凭证绑定失效。

    3. 论文如何解决这个问题?

      形式化准入与效果偏离条件,构建六维分类学,提出七字段 HMAC 权能凭证 Approval Token 进行预执行验证。

    4. 论文做了哪些实验?

      在 Claude Code 上实测六类场景基线 BGR,并通过 118 次离线重放和实时烟雾测试验证防御效果与局限。

    5. 有什么可以进一步探索的点?

      指出跨套件泛化、效果偏离拦截、真实感知评测与密钥保管等局限,列明实验覆盖范围。

    6. 总结一下论文的主要内容

      系统揭示编程智能体审批洗白风险,提出七字段权能防御机制,证实其能消除身份时序偏离但难防副作用偏离。

    完整解读
  16. 防御arXiv:2609.01091 · 54

    上海交大等提出 trait-direction drift 机制与探针空间走廊正则,抑制蒸馏中的潜隐特质迁移

    论文提出特征方向漂移机制解释潜意识学习,并设计探针空间走廊正则化在蒸馏微调中约束漂移以抑制隐蔽特征转移。

    • 6.4 ± 5.3%Qwen恶意响应任务走廊正则化转移率(Table 2,SFT为29.5±2.4%)
    • 1.7 ± 0.1%Qwen猫头鹰偏好走廊正则化转移率(Table 2,SFT为30.7±15.7%)
    • -0.01 ± 0.07Qwen猫头鹰偏好走廊正则化最终中心化漂移(Table 2,SFT为+7.39±1.11)
    6 问速览论文试图阐明潜意识学习在微调中的累积机制,并提供针对性的训练时控制方法。
    1. 这篇论文试图解决什么问题?

      论文试图阐明潜意识学习在微调中的累积机制,并提供针对性的训练时控制方法。

    2. 有哪些相关研究?

      论文梳理了潜意识学习载体、数据分布与样本选择、特征方向与微调安全控制四类相关工作。

    3. 论文如何解决这个问题?

      论文通过低秩几何形式化特征方向漂移,并提出探针空间走廊正则化约束微调时的特征漂移。

    4. 论文做了哪些实验?

      论文测试了局部与多步累积漂移,并评估了走廊正则化在两类任务上的控制效果。

    5. 有什么可以进一步探索的点?

      论文指出了单样本效应未确定等局限,其实验覆盖停留在特定模型与固定探针坐标。

    6. 总结一下论文的主要内容

      论文将潜意识学习归结为特征方向漂移的持续累积,并提出走廊正则化在微调中控制隐蔽特征转移。

    完整解读
  17. 防御arXiv:2608.06422 · 54

    CMU 研究:分片判断可避免 LLM 监督失效并抵御对抗利用

    分片机制将多项标准分配给独立调用,在相同总预算下改善评判模型与专家的一致性,并防御展示攻击。

    • 0.789PaperBench 116项标准,Opus 4.8分片评判kappa值(Table S19)
    • 0.598PaperBench 116项标准,Opus 4.8全预算单调用kappa值(Table S19)
    • 0.261PaperBench pinn模板,Opus 4.8在N=8攻击下的过接受率降幅(Table S20)
    6 问速览单次调用承担过多判定任务会导致注意力瓶颈和决策失据,产生可被展示变化操纵的脆弱性,分片机制旨在解决该过载问题。
    1. 这篇论文试图解决什么问题?

      单次调用承担过多判定任务会导致注意力瓶颈和决策失据,产生可被展示变化操纵的脆弱性,分片机制旨在解决该过载问题。

    2. 有哪些相关研究?

      论文围绕可扩展监督、大模型评判偏差、奖励过度优化与分解验证四类研究展开,并与全预算单调用等基线严格对照。

    3. 论文如何解决这个问题?

      论文将多项评估标准切分为不相交的分片子集独立评判,并在面对自适应攻击时在分片内加入对立辩护人提供平衡论据。

    4. 论文做了哪些实验?

      实验覆盖研究复现、法律、临床试验和代码等多个基准,证实分片能改善专家一致性并防御展示攻击,而辩论能抵御自适应攻击。

    5. 有什么可以进一步探索的点?

      论文指出分片在模型已有处理容量的场景下无额外收益,且自适应防御引入了假拒绝代价,实验评测集中在特定模型与任务中。

    6. 总结一下论文的主要内容

      论文揭示决策负载是大模型监督的独立瓶颈,提出分片与辩论机制有效分离注意力与平衡证据,在多项高难度基准上实现稳健评判。

    完整解读
  18. 防御arXiv:2608.17445 · 60

    论文:分解攻击可跨不可关联身份绕过 LLM 有状态防御

    形式化跨不关联身份分解攻击并评测10种策略,在1%对照拦截上限下实际防御单次ASR仍达97.64%且重试后升至100%。

    • 97.64%主评测划分上M5(唯一合规防御)单次尝试ASR(Table 2)
    • 100%未见任务簇高密度下合规防御2次尝试ASR(Figure 3)
    • 99.4%仅凭ALLOW/BLOCK反馈的汤普森采样ASR(Section 7.3)
    6 问速览探究跨不可关联身份分解攻击下状态化防御的安全与效用边界。
    1. 这篇论文试图解决什么问题?

      探究跨不可关联身份分解攻击下状态化防御的安全与效用边界。

    2. 有哪些相关研究?

      梳理了组合攻击、状态化监控及经典系统安全三类相关工作。

    3. 论文如何解决这个问题?

      形式化理论边界并构建平衡可执行协议,证明防守边界由分组决定。

    4. 论文做了哪些实验?

      实验验证了合规防御ASR普遍超97%,重试与反馈可使ASR达99%以上。

    5. 有什么可以进一步探索的点?

      作者指出了流量分布和任务类型局限,实验仅覆盖请求通道与离散画像。

    6. 总结一下论文的主要内容

      证明跨身份分解攻击突破状态化防御边界,合规下ASR仍超97%。

    完整解读
  19. 防御arXiv:2609.05797 · 58

    论文发现安全监控器主要拦截模型本就会拒答的请求

    作者评估发现安全监视器多拦截模型已拒答的请求;在Gemma-4-31B-IT回答的L1间接请求上,四种守卫召回率仅.04–.55。

    • 52.6%Gemma-4-31B-IT在647个请求L1间接表达下的回答率(第4节)
    • .04Llama Guard 3在1% FPR下对模型L1回答请求的召回率(Table 1)
    • 6.4Llama Guard 3在L1对模型拒答与回答请求的召回率比值(Table 1)
    6 问速览现有安全监视器评测未区分模型是否答复,导致监视器大多只拦截模型已拒答请求,在模型答复的弱明确度请求上召回率大幅走低。
    1. 这篇论文试图解决什么问题?

      现有安全监视器评测未区分模型是否答复,导致监视器大多只拦截模型已拒答请求,在模型答复的弱明确度请求上召回率大幅走低。

    2. 有哪些相关研究?

      相关工作涵盖安全监视器评测、重述对拒答的影响、守卫鲁棒性与内部表征,作者强调此前工作仅单独研究模型而未联合评估监视器。

    3. 论文如何解决这个问题?

      作者构建三级明确度梯级与回答条件化评估协议,测试表征导向,并提出包含双侧梯级与无害蒸馏的守卫微调方案。

    4. 论文做了哪些实验?

      实验覆盖四种文本守卫与三种内部探测器,在两款目标模型上均显示监视器在被回答请求上的召回率低于拒答请求。

    5. 有什么可以进一步探索的点?

      作者指出了目标模型与守卫种类单一、依赖合成梯级等局限,实验也仅覆盖特定规模的英文单轮请求与固定微调超参。

    6. 总结一下论文的主要内容

      论文发现安全监视器大多拦截模型已拒答请求,指出明确度偏差是共性原因,并通过双侧梯级微调提升回答请求的召回表现。

    完整解读
  20. 防御arXiv:2610.01535 · 53

    论文:安全路由评测在分布偏移下失效,基线选取偏差被低估

    在分布偏移下,事后最佳单模型基线产生 0.045 至 0.113 的选择代价,诚实评分下安全路由在多数池单元退化为固定模型选择。

    • 0.045至0.113HELM Safety类别留出下,k=2至44的基线选择代价(Table II)
    • -0.0308HELM Safety类别留出下,k=44时路由器相对于诚实基准的危害差(Table II)
    • 0.0000HELM类别留出下,各池规模路由器相对于诚实基准的危害差中位数(Section IV)
    6 问速览测试集后验基准在分布偏移下夸大固定模型表现,使安全路由评估产生虚假下限。
    1. 这篇论文试图解决什么问题?

      测试集后验基准在分布偏移下夸大固定模型表现,使安全路由评估产生虚假下限。

    2. 有哪些相关研究?

      现有研究揭示了路由同样本评估偏倚与退化现象,本文系统量化安全分布偏移下的代价与防御脆弱性。

    3. 论文如何解决这个问题?

      建立诚实留出评估协议,推导超额危害分解恒等式,并评估门槛表面与动作防御。

    4. 论文做了哪些实验?

      分布偏移下后验基准产生大额偏差,诚实评估下路由收益微弱且识别信号易被操纵。

    5. 有什么可以进一步探索的点?

      作者指出了语料范围、评测器偏差与离线假设等局限,实际实验覆盖至 7 个公开语料。

    6. 总结一下论文的主要内容

      论文揭示安全路由评估在分布偏移下的虚假下限,指出防御重心应转向外部动作级强制。

    完整解读