跳到正文
10月9日 · 周五

全部论文

找到 3 篇

另有 532 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2610.09240

    WebMirage 用对抗图像劫持视觉网页 Agent 的浏览器操作

    提出 WebMirage,用对抗图像劫持视觉网页智能体的浏览器操作

    发表
    测试
    Phi-3-Vision-4B、LLaVA-v1.5-13B、LLaVA-v1.6-34B 等 6 个
    摘要论文提出了针对网络智能体的端到端视觉红队框架 WebMirage,揭示了从视觉定位到浏览器执行的安全脆弱性。

    WebMirage 是一个面向视觉定位网络智能体的流水线感知端到端红队攻击框架。

    深度解读完整解读
  2. 防御arXiv 2610.02005

    贝叶斯辩证论证(BDA):面向持续对抗下多 LLM 委员会的可校准聚合

    提出 BDA,把多 LLM 议会的辩证动作当可靠性证据做加权聚合

    发表
    测试
    phi-4、gemma-3-27b-it、gpt-4.1-nano 等 9 个
    摘要BDA 用零额外调用的可靠性加权,给出可校准后验,并在持续对抗下反转不可靠席位。

    BDA 是一种不另调 LLM 的多 LLM 议会聚合方法,同时处理置信度校准和持续不可靠席位。

    深度解读完整解读
  3. 风险行为arXiv 2609.33871

    论文提出测量 LLM 社会自组织的框架,并揭示群体层面病理现象

    提出熵序参量框架,测量 LLM 社会的群体自组织

    发表
    测试
    Phi-4 (mini-instruct)、GPT-4.1 (longco-2025-04-14)、GPT-4o (2024-05-13) 等 5 个
    摘要熵序参量显示三个 LLM 社会自组织,另两个系统停在不动点。

    de Wynter 用复杂系统里的序参量,测量 LLM 社会会不会出现不在任何单个智能体身上的自组织,并主张这种诊断不依赖自然语言,也不绑定某一模型版本。问题来自群体层事件:一部分智能体通过通信协调,个体拒绝或个体监控都可能看不到该过程。框架把活动划成类别,用窗口内人均 Shannon 熵 Φ 相对二分配置零模型的偏离作为自组织证据,再用拉伸指数的 β 或 logistic 的 k 描述弛豫有多陡。

    深度解读完整解读
已经到底了