跳到正文
10月8日 · 周四

红队 · 论文

找到 2 篇
  1. 评测与基准arXiv:2610.08871 ·

    CredLeak-Bench:七个模型在钓鱼场景下凭证泄露率 31%–76%,恢复率最高仅 24.2%

    提出CredLeak-Bench,评测智能体在钓鱼场景下的凭据泄露

    测试
    Claude Sonnet 5、Claude Opus 4.8、Gemini 3.6 Flash 等 7 个应用层
    摘要提出评测智能体凭据泄露与恢复的 CREDLEAK-BENCH,发现全模型均存在泄露且恢复率仅 0%–24.2%,揭示安全与效用权衡。

    CREDLEAK-BENCH 评估了 LLM 智能体在处理邮件工作流时的凭据泄露与受信恢复能力,揭示了当前模型在安全防护与合法效用之间的权衡。

    完整解读
  2. 评测与基准arXiv:2609.09404 ·

    MMPIBench:多模态提示注入对六种 Agent 框架的跨框架评测

    用MMPIBench评测智能体框架的多模态提示注入

    测试
    Claude Opus 4.8、GPT-5.4、Gemini 3.1 Pro 等 6 个应用层
    场景
    AI Agent
    摘要论文提出MMPIBench评测多模态提示注入对智能体的影响,发现模型主导行为、尝试远超完成,音频通道缺乏防护。
    • 论文定位:论文提出了可复现基准 MMPIBench,系统评估多模态间接提示注入在6个主流智能体框架与5个前沿模型中的传播路径与阻断机制。
    • 核心问题:现有提示注入研究多针对文本输入或将多模态智能体视作黑盒,无法厘清攻击是在感知、规划还是执行阶段被阻断,也无法区分框架与基座模型的安全职责。
    • 方法设计:通过统一适配层标准化系统提示词与模拟工具,测试24个视觉攻击用例(6类载体 × 4类目标)与12个音频用例,引入白盒阶段插桩定位终止位置,并采用确定性检查与三模型评审团分层判定完成与尝试。
    • 主实验发现:全矩阵720次视觉运行中完成率仅1.11%(8次),但尝试率达12.8%(92次);未完成攻击主要在规划阶段被模型阅读后放弃执行(占42.1%),显式识别拒绝占23.6%;模型是主导因素,Claude Opus 4.8尝试率为0.0%,Grok 4.3和Llama 4 Maverick达23.6%。
    • 音频扩展发现:半数框架因格式或序列化问题未交付音频;在交付的72个单元中完成率达49%,gpt-audio达75%,且尝试与完成数量完全相同。
    • 结论与启示:作者认为仅汇报完成率会大幅低估系统暴露风险,应同时追踪尝试率与识别拒绝率;框架丢弃多模态输入属于偶发缺陷而非安全屏障,亟需将安全对齐扩展至视觉与音频等感知通道。
    完整解读
已经到底了