跳到正文
10月9日 · 周五

全部论文

找到 21 篇

另有 584 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2608.16246

    CompoSkill 框架利用逐个通过扫描的 Agent 技能组合发起攻击

    提出 CompoSkill,诱导 Agent 将过审技能组合成攻击链

    发表
    场景
    AI Agent
    测试
    GPT-5.4、Gemini-3.1-flash、DeepSeek-V4 等 4 个

    摘要论文分析了智能体技能组合风险,指出单包安全认证状态不具备可组合性,需转向路径级防护。

    深度解读完整解读
  2. 攻击arXiv 2610.04589

    StegoMemory 红队测试:智能体持久记忆可被用作跨会话隐蔽信道

    用 StegoMemory 测试智能体持久记忆作为跨会话隐写信道的可行性

    发表
    场景
    AI Agent
    测试
    Llama 3.1 405B、Claude 3.5 Sonnet、GPT-4o 等 13 个

    摘要研究揭示智能体持久记忆可作为隐蔽信道跨会话传输机密,写入持久化是主要防御瓶颈,呼吁建立记忆完整性防御。

    深度解读完整解读
  3. 防御arXiv 2609.33039

    TACIT:从 LLM 内部状态检测 Agent 轨迹危害

    提出 TACIT,从冻结内部表征检测智能体有害轨迹

    发表
    场景
    AI Agent
    测试
    Qwen3Guard-4B、LlamaGuard3-8B、AgentDoG-4B 等 9 个

    摘要提出基于内部表征的智能体轨迹安全检测方法 TACIT,揭示工具风险表征特性并在多项基准上提升检测表现与效率。

    深度解读完整解读
  4. 防御arXiv 2608.06422

    CMU 研究:分片判断可避免 LLM 监督失效并抵御对抗利用

    提出分片监督,将评判标准分配给独立调用以抵御展示攻击

    发表
    攻击者
    黑盒
    测试
    Claude Opus 4.8、Claude Sonnet 4.6、Claude Opus 4.6 等 5 个
    摘要论文揭示决策负载是大模型监督的独立瓶颈,提出分片与辩论机制有效分离注意力与平衡证据,在多项高难度基准上实现稳健评判。

    本文系统研究了大语言模型在执行多标准监督与评判时的决策负载瓶颈及其安全风险。

    深度解读完整解读
  5. 评测与基准arXiv 2609.22818

    研究测量 LLM Agent 记忆投毒防御的良性场景开销

    测量 LLM Agent 记忆投毒防御的良性效用与 token 开销

    发表
    场景
    AI Agent
    测试
    gemini-3.1-flash-lite、text-embedding-3-small、claude-haiku-4-5-20251001
    摘要写时代价落在噪声内。

    在没有攻击的对话上,给记忆投毒防御计价,而不是再测一轮攻击是否被挡住。

    深度解读完整解读
  6. 防御arXiv 2609.29647

    AgentKernel:面向 Agent 的可信原生操作系统内核

    提出 AgentKernel,强制中介 Agent 的身份、感知、认知与执行

    发表
    场景
    AI Agent
    摘要AgentKernel 是四支柱智能体 OS 设计,安全论证未附带实测数字。

    AgentKernel 是把安全做成组织原则的智能体 OS 架构,不是带跑分的攻防评测。

    深度解读完整解读
  7. 评测与基准arXiv 2607.14611

    论文评测 Claude Code 与 Codex 记忆文件中的提示注入风险

    评测编码智能体记忆文件中的提示注入及其跨会话持久性

    发表
    测试
    Claude Haiku 4.5、Claude Opus 4.7、GPT-5.2 等 4 个
    摘要已植入记忆文件的载荷可以跨会话影响 Claude Code 与 Codex,攻击成功与载荷是否留下是两种不同的失败。

    Bad Memory 在沙箱合成工作区里评测文件型持久记忆上的提示注入,比较载荷能否改变当前会话,以及能否在后续会话中留下或叠加。

    深度解读完整解读
  8. 防御arXiv 2601.10156

    ToolSafe 提出步骤级护栏 TS-Guard 与 TS-Flow,降低 Agent 有害工具调用

    提出 TS-Guard 与 TS-Flow,执行前检测并修正智能体有害工具调用

    发表
    场景
    AI Agent
    测试
    GPT-4o、Qwen3-8B、Qwen2.5-7B-Instruct 等 10 个
    摘要TS-Bench 标步骤级风险,TS-Guard 用多任务 RL 做执行前判定,TS-Flow 用反馈代替直接中止。

    ToolSafe 研究 LLM 智能体在工具执行前的步骤级安全:基准 TS-Bench、护栏 TS-Guard,以及反馈驱动框架 TS-Flow。

    深度解读完整解读
  9. CS-Guard:首个面向代码生成安全的 LLM 护栏评测基准

    提出 CS-Guard 基准与虚构场景攻击,评测代码生成护栏

    发表
    攻击者
    黑盒
    测试
    CodeLlama-13B-Instruct、DeepSeekCoder-V2-Lite-16B、GPT-OSS-20B 等 7 个

    摘要论文提出了代码安全护栏基准 CS-Guard,评估发现现有护栏对虚构场景攻击和代码级恶意请求防御较弱。

    深度解读完整解读
  10. 其他arXiv 2609.12413

    SoK 综述:智能体 AI 时代的越狱攻击、防御与实践考量

    综述智能体执行链路中的越狱攻击、防御与实践权衡

    发表
    场景
    AI Agent
    测试
    Qwen3.5-4B、Llama-3.1-8B-Instruct
    摘要SoK 将越狱重放到智能体流水线,并用两种模型检验回复层防御的边际与代价。

    Mia 等人把越狱安全从单轮回复扩展到智能体的规划、记忆、工具和智能体间通信,并问既有结论在更强原生对齐下是否还成立。

    深度解读完整解读
  11. 评测与基准arXiv 2609.15017

    PIDS-Bench:在过度防御、混淆与分布偏移下评测提示注入检测器

    提出 PIDS-Bench,评测提示注入检测器在过度防御与分布偏移下的表现

    发表
    测试
    TF-IDF + logistic regression、DistilBERT、DeBERTa-v3-FT 等 8 个
    摘要PIDS-Bench 显示高分布内 F1 仍会过度拦截外部来源的安全相关良性输入。

    PIDS-Bench 是一个冻结的检测器级基准,用来在固定阈值下同时看提示注入检测和良性误报。

    深度解读完整解读
  12. 防御arXiv 2608.12361

    基于搜索增强 LLM 的中文新词毒性共识检测框架 SeTox

    提出 SeTox 检索增强框架,检测中文新词的隐性毒性

    发表
    测试
    Perspective-API、Baidu-API、Tencent-API 等 14 个
    摘要SeTox 用检索把公共共识接入静态 LLM,以检测中文毒性新词。

    SeTox 研究中文新词上的隐性毒性检测:词表加检索增强,使静态 LLM 在不重训练的情况下利用公开网页上下文。

    深度解读完整解读
  13. 攻击arXiv 2609.22510

    特拉维夫大学提出爆炸性提示词:条件触发的间接提示注入可绕过九款生产 Agent

    提出条件触发的爆炸提示词,延迟激活 Agent 的间接提示注入

    发表
    场景
    AI Agent
    测试
    Llama-3.1-8B-Instruct、Llama-3.1-70B-Instruct、Qwen2.5-32B-Instruct 等 14 个
    摘要论文揭示了条件触发使提示注入绕过防御并在触发时执行工具,提出轻量检测器并在摄入期有效防范。

    论文针对大语言模型智能体面临的间接提示注入威胁,研究了利用条件句式实现时间分离的爆炸提示词。

    深度解读完整解读