跳到正文
10月10日 · 周六

全部论文

找到 9 篇

另有 241 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2610.05793

    研究者训练出按多智能体拓扑触发的代码后门模型

    提出拓扑条件后门,使代码模型在推断多智能体部署时植入漏洞

    发表
    被测模型
    Qwen2.5-7B-Instruct、Qwen2.5-Coder-7B-Instruct

    摘要论文证实了拓扑条件后门的可训练性与泛化性,展示了常规评测盲区,并提出差异化拓扑审计作为检测防御方向。

    深度解读完整解读
  2. 攻击arXiv 2609.17817

    论文:用投毒基准污染自改进编码 Agent,令其后续版本写出漏洞代码

    提出基准投毒攻击,使自修改编码 Agent 跨代写出含漏洞代码

    发表
    被测模型
    Claude Sonnet 4.5、Qwen3.5-397B、gpt-oss-120b 等 5 个

    摘要论文报告了恶意基准能污染自修改代码智能体的进化过程并持续输出漏洞,警示系统设计需纳入安全约束。

    深度解读完整解读
  3. 攻击arXiv 2609.01023

    Akrasia:针对推理型代码 LLM 的隐蔽后门攻击

    提出隐蔽后门攻击 AKRASIA,在推理代码模型提示中植入触发器并伪装思维链

    发表
    被测模型
    Claude-Sonnet-5、GPT-5.5、Gemini-3.5-flash 等 7 个

    摘要论文针对推理代码大模型提出了隐蔽推断期后门攻击 AKRASIA,揭示了模型思维链可被利用进行欺骗性伪装的安全隐患。

    深度解读完整解读
  4. 攻击arXiv 2608.00718

    研究揭示多智能体 LLM 流水线的结构性漏洞

    提出多智能体流水线的边界攻击,使对抗内容作为可信输入跨层传播

    发表
    被测模型
    GPT-5-mini、Claude Sonnet 4.5、Kimi K2.5
    摘要缺边界校验使对抗内容跨智能体传播,作者称这是架构属性而非模型能力。

    作者把多智能体 LLM 流水线的对抗问题定义为缺少边界校验,并用生产轨迹和受控实验检查脆弱性来自架构还是骨干模型。中间输出未经验证就传给下游。作者认为,一旦某级接受对抗内容,后续智能体会把它当作可信输入。

    深度解读完整解读
已经到底了