跳到正文
10月9日 · 周五

全部论文

找到 4 篇
筛选5
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 537 篇还没打标签,不在筛选结果里。

另有 537 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2610.00392

    A2A-TIBA:针对 A2A 协议 LLM 智能体的间接提示注入攻击与三层同构攻防模型

    提出 A2A-TIBA,经 A2A 对等任务间接注入并植入常驻回调

    发表
    被测模型
    MiniMax-M3、deepseek-v4-pro、glm-5.3 等 8 个
    摘要A2A-TIBA 一次植入后绕过智能体,GDA 用四类结果定位防线,ELA-ITL 把信封标注列为第三层。

    A2A-TIBA 把间接提示注入和绕过放进 A2A:gray-box 攻击者已能投递任务,诱导目标部署常驻回调程序后,下令和外传不再经过智能体。

    深度解读完整解读
  2. 评测与基准arXiv 2609.36849

    研究评估 GradSafe 在多轮对话中的越狱检测脆弱性

    评测多轮对话中 GradSafe 越狱检测的可分性与脆弱性

    发表
    被测模型
    Llama 3.1 8B Instruct、Qwen2.5-7B-Instruct
    摘要CWS 显示不安全梯度在真实多轮流量中变弱,且随攻击族和模型而变。

    作者评估梯度越狱检测从单条提示词迁到多轮对话后还剩多少可分性,方法是用 Context Window Scanner 把 GradSafe 原封不动地套到用户轮窗口上。

    深度解读完整解读
  3. 评测与基准arXiv 2607.19855

    研究者提出最小范数攻击集成,用鲁棒性曲线替代单一 ε 评测

    提出最小范数攻击集成,用鲁棒性曲线评测图像分类器

    发表
    被测模型
    C1–C20(CIFAR-10,Table 1)、I1–I10(ImageNet,Table 1)
    摘要预算可控的最小范数集成用 AOI 逼近攻击前沿,DOI 给出不依赖单一ε的防御排序。

    这篇工作把对抗鲁棒评测从单一 ε、固定集成,改成可按查询预算收紧的曲线估计。

    深度解读完整解读
  4. 评测与基准arXiv 2512.19016

    DREAM 框架用跨环境长链攻击评测 12 个 LLM Agent

    提出 DREAM 框架,评测 Agent 的跨环境长链攻击脆弱性

    发表
    场景
    AI Agent
    被测模型
    Gemini-2.5-Flash-NT、o4-mini、Gemini-2.5-Flash 等 12 个

    摘要DREAM 提出基于知识图谱与策略搜索的动态红队框架,分析了长链跨环境攻击对当前主流智能体的系统性威胁。

    深度解读完整解读
已经到底了