跳到正文
10月10日 · 周六

全部论文

找到 6 篇
筛选5
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 196 篇还没打标签,不在筛选结果里。

另有 196 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2610.07089

    研究者提出统一滥用监控基准,覆盖分解攻击与提示注入约 6200 条轨迹

    提出危害窗口与区间指标,统一评测分解攻击和提示注入下的智能体滥用监视

    发表
    场景
    AI Agent
    被测模型
    Gemma 4 26B-A4B、Qwen3.6 27B、Qwen3.5 27B 等 12 个

    摘要统一智能体滥用监视框架,动作视角兼顾两类威胁但危害定位仍存瓶颈。

    深度解读完整解读
  2. 评测与基准arXiv 2609.27336

    CART:面向大语言模型的闭环自适应红队框架

    提出闭环自适应红队框架 CART,评测模型与 Agent 的安全失败

    发表
    场景
    AI Agent
    被测模型
    Claude Opus 4.8、GPT-5.5、Grok 4.3 等 7 个
    摘要CART 把红队做成可审计的闭环搜索,在三类评测上比静态回放发现更多失败与更高平均风险。

    CART 把自动红队从一次清单式打分,改成带预算、可追溯的闭环搜索。

    深度解读完整解读
  3. 其他arXiv 2609.12413

    SoK 综述:智能体 AI 时代的越狱攻击、防御与实践考量

    系统梳理智能体执行链路中的越狱攻击与防御并比较推理时防御

    发表
    场景
    AI Agent
    被测模型
    Qwen3.5-4B、Llama-3.1-8B-Instruct
    摘要SoK 将越狱重放到智能体流水线,并用两种模型检验回复层防御的边际与代价。

    Mia 等人把越狱安全从单轮回复扩展到智能体的规划、记忆、工具和智能体间通信,并问既有结论在更强原生对齐下是否还成立。

    深度解读完整解读
已经到底了