跳到正文
10月10日 · 周六

全部论文

找到 11 篇
筛选6
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 240 篇还没打标签,不在筛选结果里。

另有 240 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2610.05793

    研究者训练出按多智能体拓扑触发的代码后门模型

    提出拓扑条件后门,使代码模型在推断多智能体部署时植入漏洞

    发表
    被测模型
    Qwen2.5-7B-Instruct、Qwen2.5-Coder-7B-Instruct

    摘要论文证实了拓扑条件后门的可训练性与泛化性,展示了常规评测盲区,并提出差异化拓扑审计作为检测防御方向。

    深度解读完整解读
  2. 攻击arXiv 2609.22711

    UBA-ORL:针对离线强化学习的遗忘激活后门攻击

    提出 UBA-ORL,以 BD/CM 样本在遗忘后激活离线 RL 后门

    发表
    被测模型
    TD3+BC、BCQ、IQL
    摘要UBA-ORL 用竞争的 BD/CM 样本,使离线 RL 后门在删除伪装轨迹后激活。

    UBA-ORL 研究离线强化学习中由合规轨迹删除激活的后门:合法贡献者同时上传共享触发的后门轨迹和伪装轨迹,训练后触发响应被压低,删除伪装批次后再升高。受害系统是使用静态数据集和轨迹级遗忘接口的离线 RL 服务。对手不能看到训练算法、参数、梯度或具体遗忘算法,但能提交可区分批次,并在部署时向观测注入预定触发。

    深度解读完整解读
  3. 攻击arXiv 2609.14060

    AgentQ:针对 LLM Agent 的量化条件后门攻击

    提出量化条件后门 AGENTQ,使智能体仅在量化后触发恶意工具调用

    发表
    场景
    AI Agent
    被测模型
    Qwen3.5-2B、Qwen3.5-4B、Qwen3.5-9B 等 6 个

    摘要论文研究了智能体量化条件后门风险,提出 AGENTQ 在保持效用的同时实现全精度隐蔽与量化后生效。

    深度解读完整解读
  4. 攻击arXiv 2609.09798

    CS-Guard:首个面向代码生成安全的 LLM 护栏评测基准

    提出 CS-Guard 基准,评测代码生成护栏对虚构场景攻击的防御

    发表
    攻击者
    黑盒
    被测模型
    CodeLlama-13B-Instruct、DeepSeekCoder-V2-Lite-16B、GPT-OSS-20B 等 7 个

    摘要论文提出了代码安全护栏基准 CS-Guard,评估发现现有护栏对虚构场景攻击和代码级恶意请求防御较弱。

    深度解读完整解读
  5. 攻击arXiv 2609.07051

    TrojanWorld:通过想象引导对世界模型智能体植入后门

    提出 TrojanWorld,用物理触发器对世界模型智能体植入想象引导后门

    发表
    被测模型
    TD-MPC2、DreamerV3、R2-Dreamer

    摘要TrojanWorld 揭示了世界模型智能体的供应链后门风险,通过在世界模型中操纵想象可实现对闭环动作的持续控制。

    深度解读完整解读
  6. 攻击arXiv 2609.01023

    Akrasia:针对推理型代码 LLM 的隐蔽后门攻击

    提出隐蔽后门攻击 AKRASIA,在推理代码模型提示中植入触发器并伪装思维链

    发表
    被测模型
    Claude-Sonnet-5、GPT-5.5、Gemini-3.5-flash 等 7 个

    摘要论文针对推理代码大模型提出了隐蔽推断期后门攻击 AKRASIA,揭示了模型思维链可被利用进行欺骗性伪装的安全隐患。

    深度解读完整解读
  7. 攻击arXiv 2608.10393

    DURA:用扩散模型生成自然对抗补丁攻击 VLA 机器人模型

    提出 DURA,用扩散模型生成自然对抗补丁操控 VLA 机器人动作

    发表
    被测模型
    OpenVLA-7B、π0-FAST、openvla-7B
    摘要DURA 用扩散潜空间轨迹生成自然补丁,白盒与黑盒都能把 VLA 导向指定动作。

    DURA 是针对 VLA 的扩散式、补丁内容不受限的机器人攻击,同时支持白盒梯度和只看动作输出的黑盒。

    深度解读完整解读
  8. 攻击arXiv 2606.09499

    研究者提出针对世界模型的机器人学习管线投毒攻击

    提出 VPH 与 VTH,只改视频帧劫持世界模型并投毒下游策略

    发表
    被测模型
    Cosmos-Predict 2.5、Cosmos-Predict 2.5 AC、Dino WM 等 4 个
    摘要只改视频帧经世界模型投毒。

    只改看似安全的视频帧,经世界模型之后才改变下游机器人策略。 问题在于世界模型进入数据生成后,数据集检查看到的仍是安全演示,合成轨迹却可以变危险。

    深度解读完整解读
已经到底了