跳到正文
10月8日 · 周四

Agent 安全 · 论文

找到 14 篇

另有 275 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2609.33039

    TACIT:从 LLM 内部状态检测 Agent 轨迹危害

    提出 TACIT,读取冻结隐藏状态以检测智能体有害轨迹

    发表
    场景
    AI Agent
    测试
    Qwen3Guard-4B、LlamaGuard3-8B、AgentDoG-4B 等 9 个

    摘要提出基于内部表征的智能体轨迹安全检测方法 TACIT,揭示工具风险表征特性并在多项基准上提升检测表现与效率。

    深度解读完整解读
  2. 研究实测五套 Agent 记忆系统均不执行撤销标记

    评测智能体记忆软撤回是否生效,并提出陈旧检索防护

    发表
    场景
    AI Agent
    测试
    GPT-5.5、Grok-4、DeepSeek-V4-Flash 等 9 个

    摘要系统揭示了记忆系统软撤回在检索时普遍未执行的安全漏洞,证明写回会击穿现有防御,并提出读取端防护作为必要控制手段。

    深度解读完整解读
  3. 防御arXiv 2601.10156

    ToolSafe 提出步骤级护栏 TS-Guard 与 TS-Flow,降低 Agent 有害工具调用

    提出 TS-Guard 与 TS-Flow,执行前检测并修正智能体有害工具调用

    发表
    场景
    AI Agent
    测试
    GPT-4o、Qwen3-8B、Qwen2.5-7B-Instruct 等 10 个
    摘要TS-Bench 标步骤级风险,TS-Guard 用多任务 RL 做执行前判定,TS-Flow 用反馈代替直接中止。

    ToolSafe 研究 LLM 智能体在工具执行前的步骤级安全:基准 TS-Bench、护栏 TS-Guard,以及反馈驱动框架 TS-Flow。

    深度解读完整解读
  4. 防御arXiv 2609.13601

    Mind the Gap:检测 DAO 治理中的描述-执行不匹配攻击

    提出 DEMI 检测框架,在执行前识别 DAO 提案描述与执行载荷的不匹配

    发表
    测试
    GPT-4o、Claude 4.5 Sonnet、Gemini 2.5 Pro 等 8 个
    摘要用公开链上数据仿真治理全流程,再以逐动作证据映射在执行前发现描述与执行不一致。

    Mind the Gap 把 DAO 提案的描述–执行不一致(DEMI)做成可在投票窗口内运行的检测问题。。

    深度解读完整解读
  5. 风险行为arXiv 2606.20023

    ToolPrivBench:LLM Agent 在低权限工具足够时仍倾向选择高权限工具

    构建 TOOLPRIVBENCH 评测 Agent 的过度特权选择并提出特权感知后训练

    发表
    场景
    AI Agent
    测试
    Qwen3-8B、LLaMA-3.1-8B、MiniMax-M2.7 等 15 个
    摘要TOOLPRIVBENCH 显示过度特权选工具普遍,常规对齐迁移有限,特权感知后训练可降低 OPUR。

    作者研究 LLM 智能体的 over-privileged tool selection:低权限工具已经足够时,仍选择或在短暂失败后升级到高权限工具。

    深度解读完整解读
  6. 攻击arXiv 2609.22510

    特拉维夫大学提出爆炸性提示词:条件触发的间接提示注入可绕过九款生产 Agent

    提出爆炸提示词,用条件触发的间接注入延迟诱发恶意工具调用

    发表
    场景
    AI Agent
    测试
    Llama-3.1-8B-Instruct、Llama-3.1-70B-Instruct、Qwen2.5-32B-Instruct 等 14 个
    摘要论文揭示了条件触发使提示注入绕过防御并在触发时执行工具,提出轻量检测器并在摄入期有效防范。

    论文针对大语言模型智能体面临的间接提示注入威胁,研究了利用条件句式实现时间分离的爆炸提示词。

    深度解读完整解读
  7. 防御arXiv 2609.36879

    SKILLLITE:用小模型做证据引导的恶意 Agent Skill 审计

    提出 SKILLLITE,以证据引导的紧凑 LLM 在部署前审计恶意 Agent Skill

    发表
    场景
    AI Agent
    测试
    Gemma4:e4b、Qwen3.5:9B、DeepSeek-R1:8B 等 5 个
    摘要SKILLLITE 把证据抽取外置,让紧凑 LLM 只做意图条件下的风险裁决,三个基准上 F1 高于所列基线。

    SKILLLITE是面向紧凑、可本地部署 LLM 的恶意 Agent Skill 预执行审计框架,作者单位为南洋理工大学。

    深度解读完整解读
  8. 防御arXiv 2609.36820

    CorrGRPO:面向多奖励学习的相关性归一化 GRPO

    提出 CorrGRPO,用组内 Pearson 相关归一化多奖励 GRPO

    发表
    场景
    AI Agent
    测试
    Qwen2.5-Coder-0.5B-Instruct、Qwen2.5-Coder-1.5B-Instruct、Qwen2.5-Coder-3B-Instruct 等 8 个
    摘要CorrGRPO 用 Pearson 相关归一化多奖励 GRPO 优势,并在三个域报告改进。

    CorrGRPO 是 GRPO 的多奖励变体:组内优势的分子仍是中心化总奖励,分母改为 Pearson 相关之和,避免大尺度奖励主导归一化。

    深度解读完整解读
已经到底了