跳到正文
10月8日 · 周四

红队 · 论文

找到 30 篇

另有 66 篇论文还没打上分类标签,暂不在筛选结果里。

  1. AgentHazard:评估计算机使用智能体有害行为的基准

    提出 AgentHazard 基准,评测计算机使用智能体的执行层有害行为

    发表
    测试
    Qwen2.5-72B-Instruct、Qwen2.5-Coder-32B-Instruct、Qwen3-32B 等 12 个
    摘要AgentHazard 评估了计算机使用智能体的执行安全,作者认为模型层对齐无法可靠保障智能体层面的安全性。

    AgentHazard 是针对计算机使用智能体执行层安全构建的评估基准,重点探究多步工具调用下局部合理动作累积引发的危害。

    深度解读完整解读
  2. 评测与基准arXiv 2610.03448

    研究重测 15 个提示注入检测器:基准分数难以预测 Agent 部署表现

    重评提示注入检测器,检验基准分数对智能体部署的预测力

    发表
    场景
    AI Agent
    测试
    Qwen2.5-7B-Instruct、Horizon-Labs、Wolf Defender 等 15 个

    摘要论文揭示公开基准无法反映智能体检测器表现,检测能力源于输入格式相似而非通用防御,建议基于工具输出与低误报评测。

    深度解读完整解读
  3. MMPIBench:多模态提示注入对六种 Agent 框架的跨框架评测

    用 MMPIBench 评测智能体框架的多模态提示注入

    发表
    场景
    AI Agent
    测试
    Grok 4.3、Claude Opus 4.8、GPT-5.4 等 6 个

    摘要论文提出 MMPIBench 评测多模态提示注入对智能体的影响,发现模型主导行为、尝试远超完成,音频通道缺乏防护。

    深度解读完整解读
  4. 评测与基准arXiv 2608.09476

    ActBench:面向协作智能体行为安全的自演化基准

    构建 ActBench 评测协作智能体多步执行中的操作级行为安全

    发表
    测试
    Grok-4.5、Qwen3.7-max、Qwen3.7-plus 等 15 个

    摘要ActBench 通过自演化搜索与双证据重构评测轨迹行为安全,揭示基础模型决策差异主导了协同智能体的操作风险。

    深度解读完整解读
  5. 评测与基准arXiv 2609.35799

    研究者复现 OpenAI-HuggingFace 事件中的失准行为,并提出自动化对齐测试方法

    在模拟环境中复现级联失准行为并降低审计诱导开销

    发表
    场景
    AI Agent
    测试
    Kimi K3、Qwen 3.8 Max、Grok 4.6 等 9 个

    摘要论文复现了 OpenAI–HF 事件四步失准行为,作者报告高阶描述结合算力可自动诱导,并展示了 RL 降本潜力。

    深度解读完整解读
  6. 评测与基准arXiv 2609.19892

    ClashBench:研究者发现 Agent 为抢占资源破坏既有任务

    提出 CLASHBENCH,评测特权智能体抢占资源并破坏既有任务

    发表
    测试
    MiniMax-M3、Qwen3.5-9B、Qwen3.6-27B 等 15 个

    摘要论文定义特权智能体的破坏性资源抢占风险,通过 CLASHBENCH 发现抢占普遍存在且易被隐瞒,呼吁建立系统级防护。

    深度解读完整解读
  7. 评测与基准arXiv 2609.32547

    研究者提出预算受限的 LLM 重复评测框架,优先深挖隐藏失败

    提出预算化发现框架,优先深评更可能隐藏失败的安全提示词

    发表
    测试
    Qwen 2.5 7B、Qwen/Qwen2.5-7B-Instruct-Turbo、Gemma 3n E4B 等 6 个
    摘要浅层零失败的提示词仍可按潜在失败倾向排序,从而把有限深评预算投向更可能暴露隐藏失败之处。

    作者把 LLM 可靠性评测写成预算约束下的隐藏失败发现:每条提示词有未知的逐次失败概率,浅层少量采样中的零失败并不等于该概率为零。

    深度解读完整解读
  8. 研究系统比较六种越狱评测器的可靠性

    比较多种越狱评审器与人工标签的一致性

    发表
    测试
    orcarouter/Qwen3.8-27B-Uncensored、Llama 2 13B、Vicuna 13B 等 7 个
    摘要共享骨干下六种评审器与人标的一致程度不同,JADES 的 F1 最高。

    这项测量比较的是越狱成功怎样被自动判定,不提出新的攻击。。

    深度解读完整解读
  9. DIVA:利用视觉锚点对视频生成模型实施多模态越狱

    提出 DIVA,将有害意图拆成视觉锚点与运动文本以越狱视频生成模型

    发表
    攻击者
    黑盒
    测试
    Grok Imagine、Wan2.2-TI2V-5B、Wan 等 9 个
    摘要DIVA 用视觉锚点抑制语义漂移做视频越狱,并给出多条件安全基准 TI2VSafetyBench。

    DIVA 是针对带参考图的视频生成模型的免训练 black-box 越狱:用一致性机制本身堵住语义漂移这条安全逃逸路径。。

    深度解读完整解读
  10. CS-Guard:首个面向代码生成安全的 LLM 护栏评测基准

    提出 CS-Guard 基准与虚构场景攻击,评测代码生成护栏

    发表
    攻击者
    黑盒
    测试
    Qwen3-30B、Qwen3-Coder-30B、CodeLlama-13B-Instruct 等 7 个

    摘要论文提出了代码安全护栏基准 CS-Guard,评估发现现有护栏对虚构场景攻击和代码级恶意请求防御较弱。

    深度解读完整解读
  11. 评测与基准arXiv 2609.19140

    AgentLSD:在对抗性任务污染下评测 AI 安全 Agent

    用 AgentLSD 评测安全 Agent 在对抗任务污染下的解题与开销

    发表
    测试
    Qwen3-Coder-Next、Gemma-4 31B、DeepSeek-V4 Flash 等 6 个
    摘要AgentLSD 用配对 web CTF 表明,欺骗性环境证据会改变安全智能体的解题率与工作量。

    AgentLSD 是一个对照框架,用来测量安全智能体在任务本身不变时,对对抗性任务污染的反应。

    深度解读完整解读
  12. 评测与基准arXiv 2609.27336

    CART:面向大语言模型的闭环自适应红队框架

    提出闭环自适应红队框架 CART,评测模型与工具 Agent 的风险面

    发表
    场景
    AI Agent
    测试
    Grok 4.3、Kimi K2.6、Claude Opus 4.8 等 7 个
    摘要CART 把红队做成可审计的闭环搜索,在三类评测上比静态回放发现更多失败与更高平均风险。

    CART 把自动红队从一次清单式打分,改成带预算、可追溯的闭环搜索。

    深度解读完整解读