跳到正文
10月9日 · 周五

全部论文

找到 3 篇
筛选5
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 630 篇还没打标签,不在筛选结果里。

另有 630 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2606.09700

    研究者提出 HPAA 攻击:用排版视觉线索绕过 13 个内容审核系统

    提出 HPAA 攻击,用排版视觉线索绕过内容审核系统

    发表
    攻击者
    黑盒
    测试
    Llama-Guard-3-8B、Perspective API、ShieldGemma-2B 等 13 个
    摘要揭示了排版视觉线索与分词差异带来的审核盲区,HPAA 以极低查询实现近乎完全规避。

    这篇论文研究了人类视觉感知与大模型分词处理机制之间的差异所导致的内容审核漏洞。

    深度解读完整解读
  2. 攻击arXiv 2608.10393

    DURA:用扩散模型生成自然对抗补丁攻击 VLA 机器人模型

    提出 DURA,沿扩散潜空间生成自然对抗补丁,把机器人动作导向指定目标

    发表
    测试
    OpenVLA-7B、π0-FAST、openvla-7B
    摘要DURA 用扩散潜空间轨迹生成自然补丁,白盒与黑盒都能把 VLA 导向指定动作。

    DURA 是针对 VLA 的扩散式、补丁内容不受限的机器人攻击,同时支持白盒梯度和只看动作输出的黑盒。

    深度解读完整解读
  3. 攻击arXiv 2609.01023

    Akrasia:针对推理型代码 LLM 的隐蔽后门攻击

    提出推断期后门攻击 AKRASIA,用代码触发器与伪装推理篡改代码输出

    发表
    测试
    Claude-Sonnet-5、GPT-5.5、Gemini-3.5-flash 等 7 个

    摘要论文针对推理代码大模型提出了隐蔽推断期后门攻击 AKRASIA,揭示了模型思维链可被利用进行欺骗性伪装的安全隐患。

    深度解读完整解读
已经到底了