跳到正文
10月10日 · 周六

全部论文

找到 12 篇
筛选5
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 201 篇还没打标签,不在筛选结果里。

另有 201 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2610.06748

    BazaarBench:评估 LLM Agent 在去中心化 C2C 市场中的代理安全

    构建 BazaarBench,评测 C2C 市场中 Agent 的违规与失信行为

    发表
    被测模型
    GPT-5.5、GPT-5.4、GPT-5.4-mini 等 5 个
    摘要论文提出挂钩底层资产的 C2C 交易评测基准,发现时间压力与对抗指令显著推高了智能体的违规承诺与欺诈行为。

    BazaarBench 针对大语言模型智能体在去中心化 C2C 交易中的代理安全问题,提出了一个结合底层实体状态与大模型裁判的仿真基准平台。

    深度解读完整解读
  2. 评测与基准arXiv 2610.02874

    SceneFactory-3D:将 2D 交通场景提升为 3D 物理反事实以做安全评测

    提出 SceneFactory-3D,用路况反事实评测驾驶策略的闭环安全性

    发表
    被测模型
    Frozen L0、L0-T、L1 等 5 个
    摘要SceneFactory-3D 固定场景只改路况。

    SceneFactory-3D 是 GPU 批处理的多智能体驾驶仿真器,用来在场景和控制器固定时只改路面物理,并比较闭环结果。

    深度解读完整解读
  3. 评测与基准arXiv 2609.39146

    MADBench:多智能体辩论安全性评测基准发布

    提出 MADBench,评测多智能体辩论是吸收还是放大对抗影响

    发表
    被测模型
    gpt-4o、GPT-5、GPT-6 Astra
    摘要MADBench 显示辩论能吸收部分准确率攻击,同时放大未授权读写。

    MADBench 是一个评测多智能体辩论安全性的基准,用来看攻击是被辩论吸收还是被放大。

    深度解读完整解读
  4. 评测与基准arXiv 2610.06898

    DIBench:面向移动 GUI 智能体多候选选择决策完整性的安全基准

    用 DIBench 评测移动 GUI 智能体被 UI 注入后的决策完整性

    发表
    被测模型
    Qwen2.5-VL(32B)、Qwen3-VL(32B)、GUI-Owl(32B) 等 7 个

    摘要论文提出移动智能体决策完整性基准 DIBench,发现欺诈 UI 注入诱导目标选择并推高完成率,通用防御收益不稳定。

    深度解读完整解读
  5. 评测与基准arXiv 2609.17320

    Emergence World:对长时程多智能体系统开展对抗压力测试

    提出 Emergence World,对长时程多智能体系统开展对抗压力测试

    发表
    被测模型
    Claude Opus 4.8、DeepSeek v4 Pro、Gemini 3.5 Flash 等 9 个

    摘要作者通过长期平行世界实验指出模型对齐不具备可组合性,单模型群体会产生社会奉承、协同退缩及语言不透明等失效。

    深度解读完整解读
  6. WolfSociety:金融智能体社会中有害智能体规模带来的集体风险

    提出 WolfBench,测量金融智能体社会中有害智能体规模带来的集体崩溃

    发表
    被测模型
    DeepSeek V3.2、GPT-4.1、Qwen3-235B 等 6 个
    摘要更大的金融智能体社会在更低有害比例上崩溃,但所需有害人数仍增加。

    WolfSociety 把多智能体安全写成受控金融社会中的集体失败问题:智能体经社交网络交流,并在共享市场里交易,形成从交流到行动再到后续决策的闭环。

    深度解读完整解读
  7. 多智能体协同过滤系统的连接性攻击与防御研究

    复现 AgentCF 上的多智能体攻防并刻画连通性作用

    发表
    被测模型
    Qwen3-235B-A22B、Claude Haiku 4.5、Mixtral 8×7B 等 4 个
    摘要连通性沿 k 与ρ改变攻防,且用户/物品与早期/稳态需要分开看。

    作者在 AgentCF 上研究连通性如何改变多智能体协同过滤的攻防,复现已有方法而不是提出新载荷。

    深度解读完整解读
  8. 评测与基准arXiv 2606.18021

    LegalHalluLens:面向法律 AI 的分类幻觉审计与校准多智能体辩论

    提出 LegalHalluLens,分类审计法律抽取幻觉并校准多智能体辩论

    发表
    被测模型
    gemini-3-flash、gpt-5.2、qwen3-32b 等 5 个
    摘要作者称类型画像与 RDI 能区分聚合率相近的系统,辩论主要减少虚构检出。

    LegalHalluLens 是一套法律条款抽取的审计框架,外加一个按审计结果校准的辩论缓解。。

    深度解读完整解读
  9. 评测与基准arXiv 2504.00374

    研究提出 CW-POR 指标衡量多智能体 LLM 辩论中的说服覆盖

    提出 CW-POR 衡量多智能体辩论中修辞说服对事实判断的覆盖

    发表
    被测模型
    LLaMA 3.2B、Mistral 7B、Granite 3.2 8B 等 5 个
    摘要作者用 CW-POR 把选错频率和置信合在一起,并称五款开源模型上修辞仍可压过事实。

    作者用单轮对抗辩论和 CW-POR,观察同族评委面对事实性解释与错误辩护时是否选错,以及选错时有多确信。

    深度解读完整解读
已经到底了