跳到正文
10月10日 · 周六

全部论文

找到 92 篇

另有 350 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2610.10612

    PyCache Trap 利用 Python 缓存替换绕过七款 Agent Skill 扫描器

    提出 PyCache Trap,用字节码缓存替换绕过 Agent 技能扫描器

    发表
    被测模型
    CISCO、HSS、AUDITOR 等 8 个
    摘要论文剖析智能体技能审查与执行脱节盲区,提出 PyCache Trap 攻击并构建基于可信复现的 EAV 防御。

    这篇论文研究了智能体技能(Agent Skills)安全扫描中的“审查–执行脱节”问题,并提出了对应的攻击验证与防御方案。

    深度解读完整解读
  2. 防御arXiv 2610.09469

    Secure-CUA:约束计算机使用智能体中不可信内容的影响

    提出 Secure-CUA,用动作事务约束计算机使用智能体的不可信影响

    发表
    场景
    web agent
    被测模型
    Claude Opus 5、Gemini 3.8 Flash、GPT-5.6-Sol
    摘要Secure-CUA 用每步事务约束不可信影响,良性 TSR 接近 Vanilla-CUA。

    Secure-CUA 要限制图形界面里不可信内容对 CUA 决策和 GUI 执行的影响,同时保留合法任务所需的不可信信息。

    深度解读完整解读
  3. 防御arXiv 2610.08082

    POLAR:面向小型工具调用智能体的可逆性护栏框架

    提出 POLAR 本体门控,在执行前否决不可逆工具调用

    发表
    场景
    AI Agent
    被测模型
    qwen/qwen3-8b、meta-llama/llama-3.1-8b-instruct、nvidia/nemotron-nano-9b-v2 等 6 个
    摘要训练无关的事前可逆性门控,弱 airline 模型有收益,强模型与 retail 常回落。

    POLAR 是训练无关的事前门控,用类型化本体在工具调用执行前检查能否组成候选逆序列。

    深度解读完整解读
  4. 防御arXiv 2610.07657

    DEFER1 多智能体防御研究报告受控测试中的攻击成功率下降

    实现 DEFER,以确定性检查优先拦截多智能体流水线的内容攻击

    发表
    被测模型
    Qwen3-235B-A22B-Instruct-2507、gpt-oss-120b、Llama-4-Scout-17B-16E-Instruct 等 5 个
    摘要DEFER 把确定性检查放在 judge 之前。

    DEFER 用来测量多智能体授权流水线里,确定性规则在何处结束、LLM judge 从何处开始。

    深度解读完整解读
  5. 分析与理论arXiv 2610.06001

    AgentSpy:在系统调用层观测 AI Agent 行为并检测技能注入攻击

    提出 AgentSpy,在系统调用层观测 Agent 行为并检测技能注入

    发表
    被测模型
    gpt-5.6-terra、deepseek-v4-flash、glm-5.3-flash 等 4 个
    摘要提出了系统级智能体监控框架 AgentSpy,揭示出通过测试背后的非预期行为与注入风险。

    本研究提出了面向 AI 智能体的系统级外部监控与行为分析框架 AgentSpy。

    深度解读完整解读
  6. 防御arXiv 2610.05640

    研究揭示 CaMeL 防护在多智能体系统中失效并提出 multi-CaMeL

    提出 multi-CaMeL,在智能体调用边界隔离可信指令与非可信数据

    发表
    被测模型
    Claude Fable 5、GPT-5.5、GPT-4.1 等 6 个

    摘要论文针对多智能体中单体防御不组合的边界清洗问题,提出 multi-CaMeL 协议彻底阻断了 MultiAgentDojo 上的注入攻击。

    深度解读完整解读
  7. 分析与理论arXiv 2610.06191

    研究:工具型智能体判断结果无用却仍继续检索,强制整合步骤可纠正

    揭示工具型智能体判定无用后仍不停止检索,并检验强制整合纠正效果

    发表
    场景
    AI Agent
    被测模型
    Qwen2.5-7B、Llama-3.1-8B、Qwen3-8B 等 7 个
    摘要论文揭示智能体判定工具失效却无法转化为停止行动,证实通过框架规则强制整合判定可提升表现。

    本文针对智能体在工具静默失效时过度检索的问题,系统分析了判定、信念与停止行动之间的解耦现象,并提出了外部规则整合方案。

    深度解读完整解读
  8. 防御arXiv 2610.05162

    MemAdapter:用反事实适配缓解记忆诱发的谄媚

    提出 MemAdapter,在检索后约束记忆对智能体推理的影响

    发表
    场景
    AI Agent
    被测模型
    DeepSeek-V4-Flash、GPT-5.6-sol、Qwen3-8B
    摘要检索后三阶段调节记忆角色。

    MemAdapter 是给长期记忆智能体用的检索后调节框架,用来处理记忆诱发谄媚。

    深度解读完整解读
  9. 防御arXiv 2610.04975

    论文提出长程智能体自生子目标的运行时授权机制

    提出长程工具智能体自生子目标的运行时授权机制

    发表
    场景
    AI Agent
    摘要用版本化目标图授权保住重规划,并挡住自生成子目标变成新权威。

    长时程工具使用把目标演化变成授权状态的一部分。本文在单 principal、单根、有限结构化域中,把自生成子目标的创建、替换、同根委托和同根 join 做成可检查转移,并在提交边界重查受保护效应。

    深度解读完整解读
  10. 防御arXiv 2610.04412

    论文研究 LLM 数字孪生参与增强民主时的提示注入脆弱性

    提出检测、结构化与 GSPO 流程,降低共识生成的提示注入错位

    发表
    被测模型
    LLaMA-2 7B、LLaMA-3 8B、GPT 3.5 Turbo 等 14 个
    摘要三章依次做个体偏好预测、政党知识图谱审议,以及共识生成对提示注入的脆弱性与一条防御流程。

    这是一篇把 LLM 数字孪生放进增强民主的博士论文,分个体表示、政党聚合和共识生成的提示注入三章。

    深度解读完整解读
  11. 分析与理论arXiv 2610.04375

    论文揭示 LLM Agent 工具调用在执行路径中被改写,并提出 IntAct 修复方案

    提出 IEC 与 IntAct,测量并修复 Agent 工具调用的路径篡改

    发表
    被测模型
    qwen3-coder-plus、Qwen2.5-Coder-32B、Qwen2.5-72B 等 4 个

    摘要论文界定工具调用在执行路径中的意图偏离问题,提出无执行归因协议与跳级修复,为智能体工程提供评测与设计准则。

    深度解读完整解读
  12. 防御arXiv 2610.04699

    CoVer:用干预检验为 Agent 构造可判定规则边界

    提出 COVER,用干预门判定 Agent 规则谓词能否自动执行

    发表
    场景
    AI Agent
    被测模型
    Claude Sonnet、Claude Opus、GPT-4o 等 5 个
    摘要自可判定不能向模型索取。

    这篇工作测的是智能体验证器在检查之前的分流:外部规则里的哪条谓词能用固定过程解决,哪条必须交给评审。

    深度解读完整解读
  13. 防御arXiv 2610.03434

    Persona Guardrail:面向智能体系统的生产级防御框架

    提出 Persona Guardrail,强制客服智能体守住功能边界

    发表
    场景
    AI Agent
    攻击者
    黑盒
    被测模型
    Qwen3-30B-A3B、Qwen3-VL-30B、Qwen3-8B 等 5 个
    摘要Persona Guardrail 用功能边界做同步输入输出校验,并在 PAGE 与生产延迟预算下给出评测。

    Persona Guardrail 是客服向智能体的同步运行时防御:先写明功能边界,再决定放行或拦截,而不是只检测某一攻击类。

    深度解读完整解读
  14. 防御arXiv 2610.02861

    论文提出在 Kubernetes 上保护 AI Agent 的七层纵深防御框架与参考架构

    提出 Kubernetes 运维智能体的七层纵深防御框架与参考架构

    发表
    场景
    AI Agent
    摘要把运维智能体当不可信租户,用七层控制在完全攻破假设下约束行动。

    把 Kubernetes 上的运维智能体当作不可信租户,在假定提示注入已完全控制其工具选择的前提下,用基础设施重建数据面与控制面的边界。要解决的是:智能体读日志、注解、工单或 MCP 工具描述时,这些内容可以变成它带着自身凭据执行的命令。模型对齐和分类器只降低概率。

    深度解读完整解读