跳到正文
10月10日 · 周六

全部论文

找到 30 篇

另有 404 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2610.07089

    研究者提出统一滥用监控基准,覆盖分解攻击与提示注入约 6200 条轨迹

    提出危害窗口与区间指标,统一评测分解攻击和提示注入下的智能体滥用监视

    发表
    场景
    AI Agent
    被测模型
    Gemma 4 26B-A4B、Qwen3.6 27B、Qwen3.5 27B 等 12 个

    摘要统一智能体滥用监视框架,动作视角兼顾两类威胁但危害定位仍存瓶颈。

    深度解读完整解读
  2. 攻击arXiv 2610.05943

    CRIME 框架利用良性 Agent 技能组合诱发恶意行为

    提出 CRIME 框架,组合良性 Agent 技能诱发恶意行为

    发表
    场景
    AI Agent
    被测模型
    DeepSeek-V4-Flash、GPT-4o-mini、GPT-4o 等 6 个
    摘要良性技能经 DCA 或 ACA 组合后可产生恶意环境后果,单独审查对不上。

    CRIME 把公共技能库中各自通过审查的技能配成两两组合,看联合执行能否实现指定恶意任务。。

    深度解读完整解读
  3. 防御arXiv 2610.03434

    Persona Guardrail:面向智能体系统的生产级防御框架

    提出 Persona Guardrail,强制客服智能体守住功能边界

    发表
    场景
    AI Agent
    攻击者
    黑盒
    被测模型
    Qwen3-30B-A3B、Qwen3-VL-30B、Qwen3-8B 等 5 个
    摘要Persona Guardrail 用功能边界做同步输入输出校验,并在 PAGE 与生产延迟预算下给出评测。

    Persona Guardrail 是客服向智能体的同步运行时防御:先写明功能边界,再决定放行或拦截,而不是只检测某一攻击类。

    深度解读完整解读
  4. 可解释性arXiv 2609.34686

    研究揭示工具智能体中越狱上下文残留导致的安全路由分化

    用配对续写与激活修补分析工具智能体越狱后的安全路由

    发表
    场景
    AI Agent
    被测模型
    Qwen3-14B、Qwen3.5-9B、Qwen3.5-27B 等 8 个
    摘要越狱后的同一安全反馈在八个工具智能体上分成三条路由,因果集中在最后几层并可作预测基线。

    这篇工作把越狱上下文残留之后的运行时安全反馈,做成工具智能体上的三路路由问题,并用激活修补给这个路由一个晚层的因果位点。作者认为,反馈可能恢复合法执行、留下未授权动作,或误伤良性流程,而现有攻击、基准和静态护栏没有在固定历史上把这三种结局分开。配对续写因此从同一冻结检查点分别接中性提醒 N 和安全反馈 S,并交叉保留越狱 J+ 与中和越狱 J0。

    深度解读完整解读
  5. 防御arXiv 2609.34518

    SEAD 论文提出工具型 Agent 的状态视角攻击与防御方法 DART 与 SAGE

    提出工具型 Agent 的自适应攻击 DART 与预执行防御 SAGE

    发表
    场景
    AI Agent
    被测模型
    GPT-5.6 Luna、GPT-5.6 Terra、Gemini 3.8 Flash 等 5 个

    摘要论文提出状态控制框架 SEAD、攻击 DART 与防御 SAGE,实验显示执行反馈与环境探测在攻防交互中具有关键作用。

    深度解读完整解读
  6. 防御arXiv 2609.28693

    skilder:以角色化技能包为工具型 LLM 智能体做访问控制

    提出 Skilder,按角色渐进下发企业工具并确定性拦截越权调用

    发表
    场景
    AI Agent
    被测模型
    Claude Haiku 4.5、Qwen 3.5 122B、Gemma 4 31B 等 6 个
    摘要Skilder 用单 MCP 服务器按角色交付工具并硬拦截。

    Skilder 把企业工具型智能体的能力按角色打包,经一个 MCP 服务器做渐进发现,使工具范围由服务器而不是提示词来执行。

    深度解读完整解读
  7. 评测与基准arXiv 2609.27336

    CART:面向大语言模型的闭环自适应红队框架

    提出闭环自适应红队框架 CART,评测模型与 Agent 的安全失败

    发表
    场景
    AI Agent
    被测模型
    Claude Opus 4.8、GPT-5.5、Grok 4.3 等 7 个
    摘要CART 把红队做成可审计的闭环搜索,在三类评测上比静态回放发现更多失败与更高平均风险。

    CART 把自动红队从一次清单式打分,改成带预算、可追溯的闭环搜索。

    深度解读完整解读
  8. 攻击arXiv 2609.15383

    微软团队提出 capability laundering 攻击:弱模型拆分任务向对齐前沿模型套取能力

    提出能力洗钱攻击,拆分任务向对齐模型套取能力

    发表
    场景
    AI Agent
    攻击者
    黑盒
    被测模型
    GPT-5.5、Claude Opus 4.8、Grok-4.3 等 7 个

    摘要作者提出了能力洗钱攻击,发现未对齐编排器分解咨询对齐模型可恢复能力差距,指出需建立跨会话防御。

    深度解读完整解读
  9. 其他arXiv 2609.12413

    SoK 综述:智能体 AI 时代的越狱攻击、防御与实践考量

    系统梳理智能体执行链路中的越狱攻击与防御并比较推理时防御

    发表
    场景
    AI Agent
    被测模型
    Qwen3.5-4B、Llama-3.1-8B-Instruct
    摘要SoK 将越狱重放到智能体流水线,并用两种模型检验回复层防御的边际与代价。

    Mia 等人把越狱安全从单轮回复扩展到智能体的规划、记忆、工具和智能体间通信,并问既有结论在更强原生对齐下是否还成立。

    深度解读完整解读
  10. 攻击arXiv 2609.09865

    CGMIA:用成员推理攻击检测代码生成基准的数据泄漏

    提出 CGMIA,检测代码生成基准样本是否泄漏进训练集

    发表
    攻击者
    灰盒
    被测模型
    Qwen2.5-Coder (3B)、CodeGemma (2B)、DeepSeek-Coder (1.3B) 等 5 个
    摘要CGMIA 融合相似度、通过率、困惑度与 CodeBERT,在模拟泄漏上优于八个 MIA 基线。

    CGMIA 用成员推断检测代码生成基准是否泄入 LLM 训练集,使评测不依赖对训练语料的直接访问。

    深度解读完整解读
  11. 防御arXiv 2609.02786

    SafeEvolve:基于智能体经验的 Harness-Policy 协同演化安全对齐框架

    提出 SafeEvolve,用轨迹证据协同演化安全 harness 与策略

    发表
    场景
    AI Agent
    被测模型
    Qwen3.5-4B、Qwen3-4B-Instruct-2507、Qwen3.5-1.7B 等 4 个
    摘要SafeEvolve 用轨迹证据协同更新安全 harness 和策略,在两个 4B 模型的智能体安全基准上改变安全与效用。

    SafeEvolve 把已完成的 on-policy 轨迹变成安全 harness 的有界更新,并用两阶段 SFT-RL 把这些更新内化进工具使用策略。

    深度解读完整解读
  12. 防御arXiv 2609.01677

    Skill-as-API:面向智能体软件工程的机密多智能体协作协议

    提出 Skill-as-API,隔离多智能体协作中的 skill 正文与系统提示词

    发表
    摘要协议把 skill 正文留在所有者侧,四层限制发现内容、权限期限和注入拼接。

    Skill-as-API 是面向智能体软件工程的协调协议,用来在跨组织调用时把 skill 的代码和系统提示词留在所有者进程。作者针对三条威胁:经通道或命名空间抽取专有方法,用注入让被调用模型输出系统提示词,以及协作结束后权限继续保留。

    深度解读完整解读
  13. 攻击arXiv 2608.04192

    研究者提出 SkillClone,仅凭正常提问即可克隆 LLM Agent 隐藏技能功能

    提出 SkillClone,仅凭良性任务交互重构闭源 Agent 技能

    发表
    场景
    AI Agent
    攻击者
    黑盒
    被测模型
    DeepSeek-Flash、DeepSeek-Pro、GLM-5.1 等 5 个
    摘要论文揭示了仅靠良性任务交互即可重构闭源智能体技能隐藏功能的风险,表明功能保密需要限制累积信息泄露。

    论文从功能保密视角系统研究了大语言模型智能体技能的行为重构威胁。

    深度解读完整解读
  14. 多智能体协同过滤系统的连接性攻击与防御研究

    复现 AgentCF 上的多智能体攻防并刻画连通性作用

    发表
    被测模型
    Qwen3-235B-A22B、Claude Haiku 4.5、Mixtral 8×7B 等 4 个
    摘要连通性沿 k 与ρ改变攻防,且用户/物品与早期/稳态需要分开看。

    作者在 AgentCF 上研究连通性如何改变多智能体协同过滤的攻防,复现已有方法而不是提出新载荷。

    深度解读完整解读