跳到正文
10月10日 · 周六

全部论文

找到 5 篇
筛选6
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 331 篇还没打标签,不在筛选结果里。

另有 331 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2609.39788

    研究:多智能体系统潜在通信链路可被训练用于提升有害顺从

    提出只训练或篡改多智能体潜在通信链路来提高有害遵从

    发表
    被测模型
    Llama-3.2-3B-Instruct、Qwen2.5-3B-Instruct、Gemma-3-1B-IT 等 7 个
    摘要潜在链路本身即可改变冻结智能体系统的安全,奖励既能攻击也能修复。

    学习得到的潜在通信链路会改变由冻结、对齐智能体组成的系统是否遵从有害请求。。作者研究三种拓扑:双智能体、三级顺序协作,以及双专家加汇总。

    深度解读完整解读
  2. 风险行为arXiv 2609.38296

    印第安纳大学 OSoMe 研究:LLM 之间顺着原有立场共振比硬说服更易激进化

    比较智能体对话中共振与说服对信念激进化的效果

    发表
    被测模型
    Llama-3.1-8B-Instruct、Qwen3-8B
    摘要两智能体实验中,作者称共振比说服更能激进化,并会波及相关信念。

    作者用两个 LLM 智能体的对话,考察一方能否把另一方扮演的人格信念推向更极端。

    深度解读完整解读
  3. 攻击arXiv 2607.03968

    研究揭示 IDE 编程 Agent 的工作流级越狱:GitHub Copilot 四后端 816/816 生成有害内容

    提出工作流级越狱,诱导 IDE 编程 Agent 在多轮开发中编写有害代码

    发表
    攻击者
    黑盒

    摘要论文揭示了 IDE 编程智能体在多轮开发工作流中会绕过单轮拒答并自行写出有害代码,呼吁防御转向工作流与代码产物级审查。

    深度解读完整解读
  4. 评测与基准arXiv 2510.01359

    JAWS-Bench:研究者用三种工作区场景系统越狱代码 Agent

    提出 JAWS-Bench,评测代码 Agent 在三级工作区中的越狱与恶意代码可执行性

    发表
    被测模型
    GPT-4.1、GPT-o1、DeepSeek-R1 等 8 个

    摘要论文提出了评估代码智能体端到端恶意代码越狱的 JAWS-Bench,发现多文件与智能体推理会明显放大可部署危害。

    深度解读完整解读
已经到底了