跳到正文
10月8日 · 周四

Agent 安全 · 论文

找到 13 篇

另有 275 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2608.04192

    研究者提出 SkillClone,仅凭正常提问即可克隆 LLM Agent 隐藏技能功能

    提出 SKILLCLONE,仅凭良性任务交互重构 Agent 隐藏技能功能

    发表
    场景
    AI Agent
    攻击者
    黑盒
    测试
    GLM-5.1、DeepSeek-Flash、DeepSeek-Pro 等 6 个
    摘要论文揭示了仅靠良性任务交互即可重构闭源智能体技能隐藏功能的风险,表明功能保密需要限制累积信息泄露。

    论文从功能保密视角系统研究了大语言模型智能体技能的行为重构威胁。

    深度解读完整解读
  2. 评测与基准arXiv 2610.05586

    AgentDoxx:联网搜索 Agent 对匿名访谈文本的再识别评测

    构建 AGENTDOXX 评测联网搜索智能体对匿名访谈的再识别能力

    发表
    场景
    AI Agent
    测试
    GLM-5.3 Flash、GPT-5.6 Terra、GPT-5 Mini 等 10 个

    摘要论文提出了已知身份的重识别基准 AGENTDOXX,揭示搜索与记忆双重风险及现有防御在检索轨迹中的泄露漏洞。

    深度解读完整解读
  3. AgentHazard:评估计算机使用智能体有害行为的基准

    提出 AgentHazard 基准,评测计算机使用智能体的执行层有害行为

    发表
    测试
    GLM-4.6、Qwen2.5-72B-Instruct、Qwen2.5-Coder-32B-Instruct 等 12 个
    摘要AgentHazard 评估了计算机使用智能体的执行安全,作者认为模型层对齐无法可靠保障智能体层面的安全性。

    AgentHazard 是针对计算机使用智能体执行层安全构建的评估基准,重点探究多步工具调用下局部合理动作累积引发的危害。

    深度解读完整解读
  4. 攻击arXiv 2607.25560

    SigLeak 可从执行轨迹推断专有 Agent 技能

    提出 SigLeak,从执行轨迹比对中推断专有智能体技能

    发表
    攻击者
    黑盒
    测试
    GLM-5.2、GPT-5.4-mini、GPT-5.5 等 4 个

    摘要提出了通过良性查询和对照轨迹推断黑盒专有技能的 SigLeak 框架,揭示了智能体执行可见性带来的行为侧信道泄露风险。

    深度解读完整解读
  5. 攻击arXiv 2609.02774

    CodePoisonRAG:针对检索增强代码生成的知识投毒攻击

    提出 CodePoisonRAG,对检索增强代码生成的知识库投毒以植入漏洞

    发表
    测试
    GLM-5.1、Qwen 3.5 9B、Code Llama 13B 等 4 个

    摘要CodePoisonRAG 展示了 RACG 外部知识库的新攻击面,在较低投毒率下可定向诱发指定漏洞并部分抵御防御。

    深度解读完整解读
  6. 评测与基准arXiv 2609.27336

    CART:面向大语言模型的闭环自适应红队框架

    提出闭环自适应红队框架 CART,评测模型与工具 Agent 的风险面

    发表
    场景
    AI Agent
    测试
    GLM-5.2、Claude Opus 4.8、GPT-5.5 等 7 个
    摘要CART 把红队做成可审计的闭环搜索,在三类评测上比静态回放发现更多失败与更高平均风险。

    CART 把自动红队从一次清单式打分,改成带预算、可追溯的闭环搜索。

    深度解读完整解读
  7. 评测与基准arXiv 2609.32616

    Cave-Bench:虚假指控下 LLM 智能体最高 60.06% 的运行会破坏正确工作

    提出 CAVE-BENCH,评测智能体遭虚假指责后是否破坏已正确的工作

    发表
    测试
    GLM-5.2、Claude-Sonnet-5、Claude-Opus-5 等 14 个

    摘要论文提出了评估智能体在虚假指责下破坏已有正确成果的 CAVE-BENCH,发现强模型易推翻已知证据,提出了门控缓解方案。

    深度解读完整解读
  8. 评测与基准arXiv 2609.24662

    DUMA-Bench:评估 LLM Agent 安全的双控多智能体基准

    提出双控多智能体基准 DUMA-Bench,评测 Agent 策略违反

    发表
    测试
    GLM-4.7、GPT-5、GPT-5-mini 等 14 个
    摘要DUMA-Bench 用双控交互评测智能体安全。

    DUMA-Bench 把 τ²-bench 的双控交互做成智能体安全评测,用来看策略违反如何随用户、模型和环境一起出现。

    深度解读完整解读
  9. 评测与基准arXiv 2609.33401

    论文评估 System One 模型在 Agent 安全决策中的可靠性、校准与选择性自动化

    评测 System One 模型对 Agent 安全输入的分类可靠性与校准

    发表
    测试
    GLM-5.3-Flash、GLM-5.3、Jev 1.13 等 14 个
    摘要离线评测表明,安全判定的总体分数和校准不能代替分组误差和带预算的自动决策检查。

    Liu 离线评测 System One 模型能否为智能体安全输入给出可自动化的概率决策。问题是分类是否可靠,以及概率能否在指定漏检和误拦上限内支持放行、拦截或复核。

    深度解读完整解读
已经到底了