跳到正文
10月8日 · 周四

Agent 安全 · 论文

找到 1 篇
筛选2
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 289 篇还没打标签,不在筛选结果里。

另有 289 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2610.07089

    研究者提出统一滥用监控基准,覆盖分解攻击与提示注入约 6200 条轨迹

    构建统一滥用监视基准,用危害窗口评测跨威胁动作监控

    发表
    场景
    AI Agent
    测试
    Mistral Small 3.2 24B、Gemma 4 26B-A4B、Qwen3.6 27B 等 12 个

    摘要统一智能体滥用监视框架,动作视角兼顾两类威胁但危害定位仍存瓶颈。

    深度解读完整解读
已经到底了