跳到正文
10月8日 · 周四

红队 · 论文

找到 8 篇

另有 66 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2609.18217

    研究:跨通道碎片化攻击可绕过 MCP 单通道防御

    提出跨通道分段攻击,借 MCP 多通道隐式信任外发敏感数据

    发表
    测试
    Gemini 2.5 Flash、GPT-4o、GPT-4o-mini 等 15 个

    摘要论文揭示了 MCP 多通道隐式信任层级,通过跨通道分段与协议级利用突破现有防御,展示了严重的凭证外发风险。

    深度解读完整解读
  2. MMPIBench:多模态提示注入对六种 Agent 框架的跨框架评测

    用 MMPIBench 评测智能体框架的多模态提示注入

    发表
    场景
    AI Agent
    测试
    Gemini 3.1 Pro、Claude Opus 4.8、GPT-5.4 等 6 个

    摘要论文提出 MMPIBench 评测多模态提示注入对智能体的影响,发现模型主导行为、尝试远超完成,音频通道缺乏防护。

    深度解读完整解读
  3. 风险行为arXiv 2609.38971

    研究测量并预测具身 VLM 规划器中任务的拒答可变性

    测量并预测具身 VLM 规划器在日常物体插入后的拒答可塑性

    发表
    测试
    gemini-robotics-er-2-preview、gemini-robotics-er-1.6-preview、Qwen3-VL-30B-A3B-Thinking
    摘要日常物体能翻转一部分已给出的拒答,可翻转程度取决于任务且可被本地代理预测。

    作者测量 constitution 守护的具身 VLM 规划器:一次拒答在只往场景里放一个日常物体之后还保不保持得住,并把这种易翻转程度称为任务的 malleability。

    深度解读完整解读
  4. 攻击arXiv 2609.30383

    研究者提出技能级联攻击

    提出技能级联攻击,把恶意目标拆进多个技能以绕过单技能检测

    发表
    测试
    Gemini 2.5 Pro、Gemini 2.5 Flash、GPT-5.4 等 10 个

    摘要论文探讨了多技能智能体系统面临的技能级联攻击风险,提出自动化红队框架与基准集,指出跨技能交互存在安全防护盲区。

    深度解读完整解读
已经到底了