跳到正文
10月9日 · 周五

红队 · 论文

找到 2 篇

另有 64 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2608.09476

    ActBench:面向协作智能体行为安全的自演化基准

    提出自演化基准 ActBench,评测协作智能体的操作级行为安全

    发表
    场景
    AI Agent
    测试
    Claude-Opus-4.8、Claude-Sonnet-4.6、GPT-5.5 等 15 个

    摘要ActBench 通过自演化搜索与双证据重构评测轨迹行为安全,揭示基础模型决策差异主导了协同智能体的操作风险。

    深度解读完整解读
  2. 评测与基准arXiv 2609.35912

    MMSkillRisk:多模态技能图像中的隐藏指令可诱导 Agent 执行未授权操作

    提出 MMSkillRisk 与 NCVA,评测技能图像隐藏指令诱导的未授权操作

    发表
    测试
    GPT-5.6-sol、Kimi-K2.6、Kimi-K3 等 6 个

    摘要论文提出 MMSkillRisk 基准与 NCVA 攻击,揭示多模态技能中教学图像潜藏指令可引发未授权操作并与良性任务共存。

    深度解读完整解读
已经到底了