跳到正文
10月8日 · 周四

全部论文

找到 6 篇

另有 757 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2609.11757

    研究者披露 AP2 支付协议的 Whisper 提示注入攻击并提出 A-VIP 防御

    提出 A-VIP,将购物意图绑定到支付授权以阻断商户文本操控

    发表
    场景
    AI Agent
    测试
    gemini-2.5-flash-lite、gemini-3.1-flash-lite、gemini-3-flash-preview 等 15 个

    摘要论文揭示了 AP2 协议决策层受操纵的风险,提出结构化与权能绑定防御 A-VIP,并发布评测基准。

    深度解读完整解读
  2. 攻击arXiv 2609.14003

    FlowSeal:用信息流控制阻断 LLM Agent 的隐私泄露

    提出 FLOWSEAL,在工具边界以信息流控制阻断智能体隐私泄露

    发表
    场景
    AI Agent
    测试
    DeepSeek-V3.2、DeepSeek-R1、GPT-4.1-mini 等 4 个

    摘要作者分析大模型智能体隐私检查与攻击面重合问题,提出外部拦截防御 FLOWSEAL 并验证有效性。

    深度解读完整解读
  3. 攻击arXiv 2609.23596

    StyleAT:用对抗训练防御人脸识别的语义攻击

    提出 BoundStyle 与 StyleAT,对抗训练防御人脸识别语义攻击

    发表
    攻击者
    白盒、黑盒
    测试
    MobileFaceNet (MobileFace)、ResNet (ResNet-152, IR-SE)、RepVGG 等 7 个
    摘要BoundStyle 用 StyleGAN3 有界潜编辑快速攻击 FR。

    StyleAT 用可调的 StyleGAN3 潜空间攻击 BoundStyle 对人脸识别做对抗训练,以抵抗一般语义编辑,并在评测中面对训练时未见的 DiffPrivate。

    深度解读完整解读
  4. 攻击arXiv 2609.27124

    Fed-ADR:用恶意编排服务器协同客户端梯度操纵攻击联邦学习

    提出 Fed-ADR,用编排服务器协同操纵梯度攻破联邦学习并检测恢复

    发表
    攻击者
    灰盒
    测试
    CNN(MNIST:2 Conv + 3 FC)、CNN(Fashion-MNIST:6 Conv + 1 FC)、ResNet18(CIFAR-10)
    摘要Fed-ADR 用 gray-box 编排攻击绕过多种聚合防御,再用 Hessian 一致性检测和窗口内恢复把准确率拉回。

    Fed-ADR 是一套面向联邦学习的攻击、检测与恢复框架:编排服务器改写合谋客户端的梯度,使参数服务器的现有防御把投毒更新当成良性,同时在发现后用历史梯度把全局模型原地修回来。

    深度解读完整解读
  5. 攻击arXiv 2609.34518

    SEAD 论文提出工具型 Agent 的状态视角攻击与防御方法 DART 与 SAGE

    提出工具智能体的状态攻击 DART 与预执行防御 SAGE

    发表
    场景
    AI Agent
    测试
    GPT-5.6 Luna、GPT-5.6 Terra、Gemini 3.8 Flash 等 8 个

    摘要论文提出状态控制框架 SEAD、攻击 DART 与防御 SAGE,实验显示执行反馈与环境探测在攻防交互中具有关键作用。

    深度解读完整解读
已经到底了