跳到正文
10月10日 · 周六

全部论文

找到 13 篇

另有 194 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2610.09027

    P-VMI:对抗图像经 KV cache 持续影响多轮对话

    提出持久视觉记忆注入,使对抗图像经缓存在触发时操控输出

    发表
    被测模型
    Qwen3-8B、Qwen3-VL-8B-Instruct、Gemma-4-12B

    摘要论文提出 P-VMI,证实对抗输入被掩蔽后仍可经 KV 缓存持久控制模型,强调了保留状态的安全风险。

    深度解读完整解读
  2. 防御arXiv 2610.05870

    MBZUAI 提出可校准的真实图像认证方法

    提出校准重合成方法,以生成器反演保真度认证真实图像并防御对抗扰动

    发表
    攻击者
    白盒

    摘要论文提出基于反演保真度与阈值校准的健全认证框架,在对抗扰动下维持错误率界限,并指出真实内容可认证性随生成器演进而萎缩。

    深度解读完整解读
  3. 防御arXiv 2610.02349

    MIRROR:面向多智能体通信的法定人数完整性防御

    提出 MIRROR,用多路径摘要多数表决保障多智能体通信完整性

    发表
    被测模型
    Gemma-4-31B-it、Gemini 2.5 Pro
    摘要MIRROR 靠多数路径。

    MIRROR 是 LLM 多智能体通信层上的多路径法定人数完整性原语,只处理不透明字节,不解释消息内容。要处理的是 Agent-in-the-Middle:中介合法终结 TLS 后可改在途消息,而语义校验有推理开销和误拦,签名又要求私钥管理。做法是生成结束后复制同一规范化载荷。

    深度解读完整解读
  4. 防御arXiv 2610.02005

    贝叶斯辩证论证(BDA):面向持续对抗下多 LLM 委员会的可校准聚合

    提出 BDA,按辩证动作可靠性加权聚合多 LLM 议会以抵抗持续对抗

    发表
    摘要BDA 用零额外调用的可靠性加权,给出可校准后验,并在持续对抗下反转不可靠席位。

    BDA 是一种不另调 LLM 的多 LLM 议会聚合方法,同时处理置信度校准和持续不可靠席位。

    深度解读完整解读
  5. 防御arXiv 2609.39297

    MiniRep:面向多智能体辩论的鲁棒声誉聚合方法

    提出 MiniRep,在多智能体辩论聚合中结合当前质量、风险与历史声誉并限制克隆组

    发表
    摘要MiniRep 用当前提案证据校准历史声誉并限制克隆组,MATH 上平均准确率高于基线,其他任务有反例。

    MiniRep 是面向恶意智能体的 MAD 声誉聚合,只作用在 Decide 阶段。

    深度解读完整解读
  6. 评测与基准arXiv 2610.06898

    DIBench:面向移动 GUI 智能体多候选选择决策完整性的安全基准

    用 DIBench 评测移动 GUI 智能体被 UI 注入后的决策完整性

    发表
    被测模型
    Qwen2.5-VL(32B)、Qwen3-VL(32B)、GUI-Owl(32B) 等 7 个

    摘要论文提出移动智能体决策完整性基准 DIBench,发现欺诈 UI 注入诱导目标选择并推高完成率,通用防御收益不稳定。

    深度解读完整解读
  7. 攻击arXiv 2609.17817

    论文:用投毒基准污染自改进编码 Agent,令其后续版本写出漏洞代码

    提出基准投毒攻击,使自修改编码 Agent 跨代写出含漏洞代码

    发表
    被测模型
    Claude Sonnet 4.5、Qwen3.5-397B、gpt-oss-120b 等 5 个

    摘要论文报告了恶意基准能污染自修改代码智能体的进化过程并持续输出漏洞,警示系统设计需纳入安全约束。

    深度解读完整解读
  8. 评测与基准arXiv 2609.17320

    Emergence World:对长时程多智能体系统开展对抗压力测试

    提出 Emergence World,对长时程多智能体系统开展对抗压力测试

    发表
    被测模型
    Claude Opus 4.8、DeepSeek v4 Pro、Gemini 3.5 Flash 等 9 个

    摘要作者通过长期平行世界实验指出模型对齐不具备可组合性,单模型群体会产生社会奉承、协同退缩及语言不透明等失效。

    深度解读完整解读
  9. 多智能体协同过滤系统的连接性攻击与防御研究

    复现 AgentCF 上的多智能体攻防并刻画连通性作用

    发表
    被测模型
    Qwen3-235B-A22B、Claude Haiku 4.5、Mixtral 8×7B 等 4 个
    摘要连通性沿 k 与ρ改变攻防,且用户/物品与早期/稳态需要分开看。

    作者在 AgentCF 上研究连通性如何改变多智能体协同过滤的攻防,复现已有方法而不是提出新载荷。

    深度解读完整解读
  10. 攻击arXiv 2608.00718

    研究揭示多智能体 LLM 流水线的结构性漏洞

    提出多智能体流水线的边界攻击,使对抗内容作为可信输入跨层传播

    发表
    被测模型
    GPT-5-mini、Claude Sonnet 4.5、Kimi K2.5
    摘要缺边界校验使对抗内容跨智能体传播,作者称这是架构属性而非模型能力。

    作者把多智能体 LLM 流水线的对抗问题定义为缺少边界校验,并用生产轨迹和受控实验检查脆弱性来自架构还是骨干模型。中间输出未经验证就传给下游。作者认为,一旦某级接受对抗内容,后续智能体会把它当作可信输入。

    深度解读完整解读
  11. 攻击arXiv 2606.12716

    PaperGuard:针对多模态 AI 同行评审的攻击与防御基准

    提出 PaperGuard,用图文注入与梯度扰动抬高自动审稿分数并检测恶意指令

    发表
    被测模型
    Claude-sonnet-4.5、GPT-4o、GPT-4.1 等 11 个
    摘要PaperGuard 测到提示注入与白盒视觉抬分,并比较分块检索防御。

    PaperGuard同时评测并检测多模态 AI 审稿中的评分操纵。

    深度解读完整解读
已经到底了