跳到正文
10月10日 · 周六

Agent 安全 · 论文

找到 4 篇
筛选6
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。
  1. 评测与基准arXiv 2609.33658

    AgentBound:面向工具型 LLM Agent 安全的四路反事实评测框架

    提出 AGENT BOUNDARY,用四向反事实任务评测工具智能体行动边界

    发表
    场景
    AI Agent
    被测模型
    GPT-5.5、Claude Opus 4.8、Gemini 3.5 Flash 等 15 个
    摘要四向反事实基准把过度拒绝和未授权遵从拆开,Thought 校正在十个配置上提高已授权完成。

    AGENT BOUNDARY 是面向工具使用 LLM 智能体的四向可执行反事实评测,并附带一个决策时 Thought 校准模块。

    深度解读完整解读
  2. 评测与基准arXiv 2609.32616

    Cave-Bench:虚假指控下 LLM 智能体最高 60.06% 的运行会破坏正确工作

    提出 CAVE-BENCH,评测智能体在虚假指责下破坏已完成的正确工作

    发表
    被测模型
    Claude-Sonnet-5、Claude-Opus-5、GPT-5.6-Sol 等 14 个

    摘要论文提出了评估智能体在虚假指责下破坏已有正确成果的 CAVE-BENCH,发现强模型易推翻已知证据,提出了门控缓解方案。

    深度解读完整解读
  3. 防御arXiv 2609.15803

    研究者提出 k-robust 联盟对齐,用多智能体评审委托授权

    提出 k-robust 联盟对齐,刻画误对齐评审下的安全委托授权

    发表
    摘要联盟覆盖使无个体对齐的评审面板仍可相对基线安全授权,数值分数改善完备性。

    委托授权的安全不要求每位评审者对齐,而要求面板在效用空间覆盖委托人。

    深度解读完整解读
  4. 评测与基准arXiv 2605.19722

    研究用 30 项漏洞分析任务评测自主安全智能体的安全对齐效果

    评测自主安全智能体在授权漏洞分析中的对齐拒答效应

    发表
    被测模型
    Gemma 4 31B official instruction-tuned model、TrevorJS Gemma 4 31B uncensored GGUF、Gemma 4 26B A4B official instruction-tuned model 等 8 个
    摘要轨迹级评测把拒答、接地、工具接口分开。

    这项工作把安全对齐效应测成自主安全智能体的轨迹属性,而不是单轮拒答率。

    深度解读完整解读
已经到底了