跳到正文
10月10日 · 周六

全部论文

找到 7 篇
筛选6
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 216 篇还没打标签,不在筛选结果里。

另有 216 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2610.00392

    A2A-TIBA:针对 A2A 协议 LLM 智能体的间接提示注入攻击与三层同构攻防模型

    提出 A2A-TIBA,经 A2A 对等任务间接注入并植入常驻回调

    发表
    被测模型
    MiniMax-M3、deepseek-v4-pro、glm-5.3 等 8 个
    摘要A2A-TIBA 一次植入后绕过智能体,GDA 用四类结果定位防线,ELA-ITL 把信封标注列为第三层。

    A2A-TIBA 把间接提示注入和绕过放进 A2A:gray-box 攻击者已能投递任务,诱导目标部署常驻回调程序后,下令和外传不再经过智能体。

    深度解读完整解读
  2. 评测与基准arXiv 2609.36849

    研究评估 GradSafe 在多轮对话中的越狱检测脆弱性

    评测多轮对话中 GradSafe 越狱检测的可分性与脆弱性

    发表
    被测模型
    Llama 3.1 8B Instruct、Qwen2.5-7B-Instruct
    摘要CWS 显示不安全梯度在真实多轮流量中变弱,且随攻击族和模型而变。

    作者评估梯度越狱检测从单条提示词迁到多轮对话后还剩多少可分性,方法是用 Context Window Scanner 把 GradSafe 原封不动地套到用户轮窗口上。

    深度解读完整解读
  3. 评测与基准arXiv 2609.30383

    研究者提出技能级联攻击

    提出技能级联攻击,把有害目标拆散到多个技能里绕过单技能扫描

    发表
    场景
    AI Agent
    被测模型
    GPT-5.4、GPT-5.4 Mini、Claude Opus 4.6 等 11 个

    摘要论文探讨了多技能智能体系统面临的技能级联攻击风险,提出自动化红队框架与基准集,指出跨技能交互存在安全防护盲区。

    深度解读完整解读
  4. 评测与基准arXiv 2607.14493

    LogInject 框架披露 LLM 日志分析中的被动提示注入

    提出 LogInject 框架,评测日志分析中的被动提示注入及缓解

    发表
    被测模型
    GPT-4o、Claude 3.5 Sonnet、Llama-3-70B-Instruct

    摘要论文评估了 LLM 日志分析中的上下文污染风险,提出分片拼接等攻击与三层防御,指出必须结合架构隔离与人工介入。

    深度解读完整解读
  5. 评测与基准arXiv 2606.02630

    MultiTurnPSB

    构建 MultiTurnPSB,评测四轮医疗越狱与分类器输入防御

    发表
    被测模型
    GPT-4.1-mini、Claude Sonnet 4.5
    摘要多轮攻击加剧医疗模型风险,分类器干预有效但受高误报率制约。

    MultiTurnPSB 针对患者端医疗大模型在持续交互中的安全风险,构建了包含三种攻击模态的四轮对抗评测基准。

    深度解读完整解读
  6. 研究者提出 MM-Plan 多模态越狱框架

    提出 MM-Plan 多模态越狱框架,自动规划多轮图像编辑以越狱视觉独占目标

    发表
    攻击者
    黑盒
    被测模型
    Llama-3.2-11B、InternVL3-8B、Qwen3-VL-8B 等 8 个
    摘要作者称全局规划能攻破对单轮攻击更稳的前沿 MLLM。

    MM-Plan 是面向 Visual Exclusivity 的 black-box 多模态红队方法,并配有人工基准 VE-Safety。

    深度解读完整解读
  7. 评测与基准arXiv 2512.19016

    DREAM 框架用跨环境长链攻击评测 12 个 LLM Agent

    提出 DREAM 框架,评测 Agent 的跨环境长链攻击脆弱性

    发表
    场景
    AI Agent
    被测模型
    Gemini-2.5-Flash-NT、o4-mini、Gemini-2.5-Flash 等 12 个

    摘要DREAM 提出基于知识图谱与策略搜索的动态红队框架,分析了长链跨环境攻击对当前主流智能体的系统性威胁。

    深度解读完整解读
已经到底了