跳到正文
10月10日 · 周六

全部论文

找到 19 篇

另有 232 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2610.11773

    研究提出 Agent 安全新维度:识别未履行的安全义务

    提出义务识别基准 ObligationBench,并训练护栏识别 Agent 未履行的安全义务

    发表
    被测模型
    ObligationGuard、Claude-Opus-4.8、GPT-5.6-Sol 等 17 个
    摘要义务是护栏缺口。

    作者认为编码智能体的安全不能只靠拦截禁止动作,还要找出终止时仍未做的安全关键动作,并将其称为义务。

    深度解读完整解读
  2. 评测与基准arXiv 2610.07359

    论文实测 Agent 工具调用门控栈的失败相关性

    提出 nmult 并评测 Agent 动作门禁堆叠的错误相关性

    发表
    场景
    AI Agent
    被测模型
    AgentTrust runtime (174 rules)、GPT-5.5 (gpt55)、claude-haiku-4-5-20251001 等 7 个
    摘要论文实测发现大模型裁判间错误显著相关,作者主张按机制选型并在整栈层面度量防护增益。

    论文是一项针对智能体动作拦截防御堆叠故障关联性与实际组合价值的实证测量研究。

    深度解读完整解读
  3. 评测与基准arXiv 2610.05586

    AgentDoxx:联网搜索 Agent 对匿名访谈文本的再识别评测

    构建 AGENTDOXX 基准,评测联网搜索 Agent 对匿名访谈的再识别

    发表
    场景
    web agent
    被测模型
    GPT-5.6 Terra、GPT-5 Mini、GPT-4.1 Mini 等 10 个

    摘要论文提出了已知身份的重识别基准 AGENTDOXX,揭示搜索与记忆双重风险及现有防御在检索轨迹中的泄露漏洞。

    深度解读完整解读
  4. 评测与基准arXiv 2610.03434

    Persona Guardrail:面向智能体系统的生产级防御框架

    提出 Persona Guardrail,强制客服智能体守住功能边界

    发表
    场景
    AI Agent
    攻击者
    黑盒
    被测模型
    Qwen3-30B-A3B、Qwen3-VL-30B、Qwen3-8B 等 5 个
    摘要Persona Guardrail 用功能边界做同步输入输出校验,并在 PAGE 与生产延迟预算下给出评测。

    Persona Guardrail 是客服向智能体的同步运行时防御:先写明功能边界,再决定放行或拦截,而不是只检测某一攻击类。

    深度解读完整解读
  5. 评测与基准arXiv 2610.03448

    研究重测 15 个提示注入检测器:基准分数难以预测 Agent 部署表现

    重测提示注入检测器在 Agent 工具输出上的检出与任务阻断

    发表
    场景
    AI Agent
    被测模型
    Horizon-Labs、Wolf Defender、Prismor-1.5B 等 15 个

    摘要论文揭示公开基准无法反映智能体检测器表现,检测能力源于输入格式相似而非通用防御,建议基于工具输出与低误报评测。

    深度解读完整解读
  6. 评测与基准arXiv 2609.39146

    MADBench:多智能体辩论安全性评测基准发布

    提出 MADBench,评测多智能体辩论是吸收还是放大对抗影响

    发表
    被测模型
    gpt-4o、GPT-5、GPT-6 Astra
    摘要MADBench 显示辩论能吸收部分准确率攻击,同时放大未授权读写。

    MADBench 是一个评测多智能体辩论安全性的基准,用来看攻击是被辩论吸收还是被放大。

    深度解读完整解读
  7. 评测与基准arXiv 2609.34862

    JEV 作为智能体轨迹安全评判器:与生成式 LLM 评判器的实证对比

    对比类型化评审与生成式评审对智能体轨迹的安全判定

    发表
    场景
    AI Agent
    被测模型
    JEV、GLM-5.2-Tencent、DeepSeek-V4-Flash 等 5 个
    摘要JEV 的四基准平均正类 F1 最高,延迟和估计费用更低,但分数据集与精确率有取舍。

    在已保存的工具使用智能体轨迹上,比较类型化评审 JEV 与四种生成式评审的回溯安全分类。

    深度解读完整解读
  8. 评测与基准arXiv 2609.34262

    论文提出基准完整性维护框架,审计 Agent 通过轨迹中的非应得通过

    审计 Agent 基准通过轨迹,区分无根据通过与奖励黑客并封堵复测

    发表
    场景
    AI Agent
    被测模型
    Opus 4.7、Opus 4.8、Opus 5 等 11 个
    摘要审计通过轨迹、分开奖励黑客与验证器弱点,并用重放加现场重测验收修复。

    Scale AI 的这篇工作把 agentic benchmark 的有效性写成持续维护问题:验证器给满分,并不等于智能体展示了任务所要的能力。

    深度解读完整解读
  9. 评测与基准arXiv 2609.30383

    研究者提出技能级联攻击

    提出技能级联攻击,把有害目标拆散到多个技能里绕过单技能扫描

    发表
    场景
    AI Agent
    被测模型
    GPT-5.4、GPT-5.4 Mini、Claude Opus 4.6 等 11 个

    摘要论文探讨了多技能智能体系统面临的技能级联攻击风险,提出自动化红队框架与基准集,指出跨技能交互存在安全防护盲区。

    深度解读完整解读
  10. CS-Guard:首个面向代码生成安全的 LLM 护栏评测基准

    提出 CS-Guard 基准,评测代码生成护栏对虚构场景攻击的防御

    发表
    攻击者
    黑盒
    被测模型
    CodeLlama-13B-Instruct、DeepSeekCoder-V2-Lite-16B、GPT-OSS-20B 等 7 个

    摘要论文提出了代码安全护栏基准 CS-Guard,评估发现现有护栏对虚构场景攻击和代码级恶意请求防御较弱。

    深度解读完整解读
  11. 评测与基准arXiv 2608.16246

    CompoSkill 框架利用逐个通过扫描的 Agent 技能组合发起攻击

    提出 CompoSkill,将逐个通过扫描的技能编排为攻击链

    发表
    场景
    AI Agent
    被测模型
    GPT-5.4、Gemini-3.1-flash、DeepSeek-V4 等 4 个

    摘要论文分析了智能体技能组合风险,指出单包安全认证状态不具备可组合性,需转向路径级防护。

    深度解读完整解读
  12. BioSecBench-Refusal:面向智能体生物安全风险评估的配对基准

    提出 BioSecBench-Refusal,评测智能体生物研发拒答与隐蔽危害识别

    发表
    被测模型
    Opus 4.8、Opus 4.7、Opus 4.6 等 10 个
    摘要配对基准显示拒绝多由 API 触发,合法任务常被拒得不少于隐蔽危害。

    BioSecBench-Refusal 把生物研发智能体的谨慎程度和识别隐蔽危害的能力放在同一套任务上测量。

    深度解读完整解读
  13. TraceSafe-Bench:评估 LLM 护栏在多步工具调用轨迹上的表现

    提出 TRACE SAFE-BENCH,静态评测多步工具调用轨迹上的护栏

    发表
    场景
    AI Agent
    被测模型
    GPT-5 mini、GPT-5.4 mini、Gemini3-Flash 等 15 个
    摘要TRACE SAFE-BENCH 用可控变异评轨迹护栏,结构能力比规模和越狱鲁棒性更相关。

    TRACE SAFE-BENCH 用固定的多步工具轨迹评护栏,问的是不安全动作到达环境之前能否被拦住,而不是智能体自己会不会拒绝。

    深度解读完整解读
  14. 研究者开源 Universal Verifier 与 CUAVerifierBench,用于验证计算机使用 Agent 轨迹

    构建 Universal Verifier 核验计算机使用 Agent 轨迹

    发表
    场景
    web agent
    被测模型
    GPT-5.2、GPT-4o、o4-mini 等 8 个
    摘要四条设计原则叠成 Universal Verifier,作者称其与人类一致程度相当且假阳性近零。

    Universal Verifier 给计算机使用轨迹打过程分和结果分,并定位失败。CUAVerifierBench 用人工标签衡量这种验证器。

    深度解读完整解读
  15. 评测与基准arXiv 2601.10156

    ToolSafe 提出步骤级护栏 TS-Guard 与 TS-Flow,降低 Agent 有害工具调用

    提出 TS-Guard 与 TS-Flow,在执行前检测并引导 Agent 修正有害工具调用

    发表
    场景
    AI Agent
    被测模型
    GPT-4o、TS-Guard、Qwen2.5-14B-Instruct
    摘要TS-Bench 标步骤级风险,TS-Guard 用多任务 RL 做执行前判定,TS-Flow 用反馈代替直接中止。

    ToolSafe 研究 LLM 智能体在工具执行前的步骤级安全:基准 TS-Bench、护栏 TS-Guard,以及反馈驱动框架 TS-Flow。

    深度解读完整解读
已经到底了