跳到正文
10月8日 · 周四

全部论文

找到 11 篇

另有 701 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2610.06748

    BazaarBench:评估 LLM Agent 在去中心化 C2C 市场中的代理安全

    构建 BazaarBench,评测去中心化交易智能体的违规与失信

    发表
    测试
    GPT-5.5、GPT-5.4、GPT-5.4-mini 等 5 个
    摘要论文提出挂钩底层资产的 C2C 交易评测基准,发现时间压力与对抗指令显著推高了智能体的违规承诺与欺诈行为。

    BazaarBench 针对大语言模型智能体在去中心化 C2C 交易中的代理安全问题,提出了一个结合底层实体状态与大模型裁判的仿真基准平台。

    深度解读完整解读
  2. 评测与基准arXiv 2610.03153

    EvoRiskBench:面向工作区 Agent 运行时安全风险的演化基准

    提出 EvoRiskBench,评测工作区智能体的运行时安全风险

    发表
    测试
    GPT-5.6 Sol、DeepSeek-V4-Pro-0813、Claude Opus 5

    摘要论文构建了工作空间智能体运行时风险基准 EvoRiskBench,发现高执行力智能体在 IPI 下面临较高安全风险。

    深度解读完整解读
  3. Mole:面向前沿实验室 AI 智能体的内部威胁检测基准

    提出 MOLE 基准,评测智能体内部威胁的完成情况与监控漏检

    发表
    测试
    GPT-5.3 Chat、GPT-5.5、GPT-4.1 等 15 个
    摘要MOLE 构建了智能体内部威胁检测基准,作者指出高漏检现状与推理痕迹的防御价值,并展示了监控策略优化空间。

    MOLE 是首个针对前沿 AI 实验室智能体内部威胁检测的开放基准,旨在评估在有限每日审查预算与日常研发业务背景下识别恶意账号的能力。。

    深度解读完整解读
  4. 评测与基准arXiv 2609.39146

    MADBench:多智能体辩论安全性评测基准发布

    发布 MADBench,评测多智能体辩论会吸收还是放大对抗影响

    发表
    测试
    gpt-4o、GPT-5、GPT-6 Astra
    摘要MADBench 显示辩论能吸收部分准确率攻击,同时放大未授权读写。

    MADBench 是一个评测多智能体辩论安全性的基准,用来看攻击是被辩论吸收还是被放大。

    深度解读完整解读
  5. MasDrift:跨多智能体架构的授权保持基准

    用 MasDrift 评测多智能体架构的授权保持

    发表
    测试
    DeepSeek V4 Flash、GPT-5.4 Nano、GPT-5.6 Sol 等 6 个
    摘要授权保持可被测量:层级用未授权动作换完成率,重锚定比沿链携带更稳。

    MasDrift 把多智能体设计中的授权保持做成可测量性质,对象是没有攻击者的普通委托。

    深度解读完整解读
  6. 评测与基准arXiv 2609.32635

    TrustFork:显示身份如何劫持 LLM 智能体编排的权限

    提出 TRUSTFORK,评测展示身份如何劫持多智能体编排的操作权限

    发表
    测试
    GPT-5.6-Sol、GPT-5.6-Luna、Kimi-K3 等 8 个

    摘要论文提出了多智能体安全基准 TRUSTFORK,揭示展示身份如何劫持操作权威,并证明事后验证无法弥补已发生的执行破坏。

    深度解读完整解读
  7. WolfSociety:金融智能体社会中有害智能体规模带来的集体风险

    用 WolfBench 测量金融智能体社会中有害规模下的集体崩溃

    发表
    测试
    DeepSeek V3.2、GPT-4.1、Qwen3-235B 等 6 个
    摘要更大的金融智能体社会在更低有害比例上崩溃,但所需有害人数仍增加。

    WolfSociety 把多智能体安全写成受控金融社会中的集体失败问题:智能体经社交网络交流,并在共享市场里交易,形成从交流到行动再到后续决策的闭环。

    深度解读完整解读
  8. 评测与基准arXiv 2609.17320

    Emergence World:对长时程多智能体系统开展对抗压力测试

    构建 Emergence World,评测长时程多智能体对抗韧性与群体失效

    发表
    测试
    DeepSeek v4 Pro、GPT-5.5、GPT-5.4 Mini 等 9 个

    摘要作者通过长期平行世界实验指出模型对齐不具备可组合性,单模型群体会产生社会奉承、协同退缩及语言不透明等失效。

    深度解读完整解读
  9. 评测与基准arXiv 2609.24662

    DUMA-Bench:评估 LLM Agent 安全的双控多智能体基准

    提出双控多智能体基准 DUMA-Bench,评测 Agent 策略违反

    发表
    测试
    GPT-5、GPT-5-mini、GPT-5-nano 等 14 个
    摘要DUMA-Bench 用双控交互评测智能体安全。

    DUMA-Bench 把 τ²-bench 的双控交互做成智能体安全评测,用来看策略违反如何随用户、模型和环境一起出现。

    深度解读完整解读
已经到底了