跳到正文
10月9日 · 周五

红队 · 论文

找到 13 篇

另有 59 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2610.03448

    研究重测 15 个提示注入检测器:基准分数难以预测 Agent 部署表现

    重评 Agent 提示注入检测器,检验基准分数能否预测部署表现

    发表
    场景
    AI Agent
    测试
    Horizon-Labs、Wolf Defender、Prismor-1.5B 等 15 个

    摘要论文揭示公开基准无法反映智能体检测器表现,检测能力源于输入格式相似而非通用防御,建议基于工具输出与低误报评测。

    深度解读完整解读
  2. 攻击arXiv 2609.39607

    Pretext 攻击绕过 NVIDIA SkillSpector 等 Agent 技能扫描器

    提出 PRETEXT 白盒攻击,迭代改写技能文本以绕过 Agent 技能扫描器

    发表
    场景
    AI Agent
    攻击者
    白盒
    测试
    glm (z-ai/glm-5.1)、qwen3t (qwen/qwen3-235b-a22b-thinking-2507)、gpt-oss (openai/gpt-oss-120b) 等 4 个
    摘要论文提出了针对多阶段技能检测器的白盒攻击,揭示了单纯依赖大模型自适应检测的局限。

    PRETEXT 是一项针对基于“静态规则加语义大模型”的智能体技能安全检测框架的白盒攻击与协同进化评估研究。

    深度解读完整解读
  3. 评测与基准arXiv 2608.09476

    ActBench:面向协作智能体行为安全的自演化基准

    提出自演化基准 ActBench,评测协作智能体的操作级行为安全

    发表
    场景
    AI Agent
    测试
    Claude-Opus-4.8、Claude-Sonnet-4.6、GPT-5.5 等 15 个

    摘要ActBench 通过自演化搜索与双证据重构评测轨迹行为安全,揭示基础模型决策差异主导了协同智能体的操作风险。

    深度解读完整解读
  4. 其他arXiv 2609.16694

    面向安全 AI 渗透测试智能体:安全威胁、护栏与架构视角

    综述自主渗透智能体的继承攻击、架构攻击及护栏覆盖缺口

    发表
    场景
    AI Agent
    测试
    GPT-4、GPT-4o、Llama-3 等 6 个
    摘要用双轴分类连接渗透智能体的架构、攻击与护栏,并认为现有防御仍按组件分开。

    这是一篇关于自主 AI 渗透测试智能体的安全综述:用架构和生命周期两轴整理威胁与护栏,不做新的攻击实验。

    深度解读完整解读
  5. CS-Guard:首个面向代码生成安全的 LLM 护栏评测基准

    提出 CS-Guard 基准与虚构场景攻击,评测代码生成护栏

    发表
    攻击者
    黑盒
    测试
    CodeLlama-13B-Instruct、DeepSeekCoder-V2-Lite-16B、GPT-OSS-20B 等 7 个

    摘要论文提出了代码安全护栏基准 CS-Guard,评估发现现有护栏对虚构场景攻击和代码级恶意请求防御较弱。

    深度解读完整解读
  6. 其他arXiv 2609.12413

    SoK 综述:智能体 AI 时代的越狱攻击、防御与实践考量

    综述智能体执行链路中的越狱攻击、防御与实践权衡

    发表
    场景
    AI Agent
    测试
    Qwen3.5-4B、Llama-3.1-8B-Instruct
    摘要SoK 将越狱重放到智能体流水线,并用两种模型检验回复层防御的边际与代价。

    Mia 等人把越狱安全从单轮回复扩展到智能体的规划、记忆、工具和智能体间通信,并问既有结论在更强原生对齐下是否还成立。

    深度解读完整解读
  7. 攻击arXiv 2609.22510

    特拉维夫大学提出爆炸性提示词:条件触发的间接提示注入可绕过九款生产 Agent

    提出条件触发的爆炸提示词,延迟激活 Agent 的间接提示注入

    发表
    场景
    AI Agent
    测试
    Llama-3.1-8B-Instruct、Llama-3.1-70B-Instruct、Qwen2.5-32B-Instruct 等 14 个
    摘要论文揭示了条件触发使提示注入绕过防御并在触发时执行工具,提出轻量检测器并在摄入期有效防范。

    论文针对大语言模型智能体面临的间接提示注入威胁,研究了利用条件句式实现时间分离的爆炸提示词。

    深度解读完整解读
  8. 攻击arXiv 2609.30383

    研究者提出技能级联攻击

    提出技能级联攻击,将恶意目标分散于多个技能以绕过单技能检测

    发表
    场景
    AI Agent
    测试
    GPT-5.4、GPT-5.4 Mini、Claude Opus 4.6 等 10 个

    摘要论文探讨了多技能智能体系统面临的技能级联攻击风险,提出自动化红队框架与基准集,指出跨技能交互存在安全防护盲区。

    深度解读完整解读
已经到底了