跳到正文
10月8日 · 周四

全部论文

找到 17 篇

另有 1065 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv:2608.10393 ·

    DURA:用扩散模型生成自然对抗补丁攻击 VLA 机器人模型

    提出 DURA,沿扩散潜空间生成自然对抗补丁以劫持 VLA 机器人动作

    具身与机器人测试OpenVLA-7B、π0-FAST、openvla-7B提示层
    摘要DURA 用扩散潜空间轨迹生成自然补丁,白盒与黑盒都能把 VLA 导向指定动作。

    DURA 是针对 VLA 的扩散式、补丁内容不受限的机器人攻击,同时支持白盒梯度和只看动作输出的黑盒。

    完整解读
  2. 攻击arXiv:2609.08236 ·

    研究:内容不变的风格包装可翻转 LLM 安全评判器的判定

    提出内容不变样式包装,翻转安全评审器的判定

    模型与 API攻击者无盒黑盒测试Keyword (rulebased)、GPT-4o-mini (gpt4o)、GPT-4o-mini (strongreject) 等 12 个提示层
    摘要论文揭示特定安全评审器易受保持内容不变的外层包装诱导改变判定,并指出安全评估应将判定稳定性作为重要考量指标。

    这是一项关于大语言模型自动化安全评审系统表面样式脆弱性的评估研究。

    完整解读
  3. 攻击arXiv:2609.09553 ·

    研究:任意密文攻击前沿大模型无需微调即可越狱

    提出任意字母置换密码越狱,无需微调即可诱导有害输出

    模型与 API攻击者黑盒测试Claude Sonnet 4、Claude Sonnet 4.5、Gemini 3 Flash (preview) 等 7 个提示层

    摘要前沿大模型无需微调即可通过提示词学会字母置换密码,进而绕过分类器与对齐,作者呼吁关注能力提升带来的安全风险。

    完整解读
  4. 攻击arXiv:2609.02414 ·

    Blueprint 框架用世界观模拟与 18 个影响因子提升多轮越狱成功率

    提出多轮越狱框架 BLUEPRINT,用世界观模拟与心理因素诱导有害输出

    模型与 API攻击者黑盒测试Qwen3-Next-80B、DeepSeek-V3.2、GLM-4.7 等 6 个提示层
    摘要BLUEPRINT 解耦多轮越狱策略与情境模拟,揭示任务具象化是摆脱拒绝的核心机制,为多轮安全防御提供新视角。

    BLUEPRINT 是一个将因子化社会影响力策略空间与跨轮世界观模拟解耦的多轮大语言模型安全评测框架。

    完整解读
已经到底了