跳到正文
10月8日 · 周四

Agent 安全 · 论文

找到 7 篇

另有 383 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv:2609.03221 ·

    FairMedAgent:临床 LLM 智能体公平性审计中的随机噪声下限

    用 FairMedAgent 测量临床智能体在输入不变时的动作不稳定性下限

    LLM 应用测试mistral:7b-instruct、claude-haiku-4-5、claude-sonnet-5 等 7 个应用层
    摘要先测同一输入下的动作不一致率,再用它解读人口学翻转率。

    FairMedAgent 把临床智能体公平审计里的采样噪声单独量出来:输入不变时动作仍会改变,这个比率就是解读翻转率的下限。。

    完整解读
  2. 评测与基准arXiv:2609.17320 ·

    Emergence World:对长时程多智能体系统开展对抗压力测试

    构建 Emergence World,评测长时程多智能体对抗韧性与群体失效

    多智能体测试Mistral Medium 3.5、Claude Opus 4.8、DeepSeek v4 Pro 等 9 个应用层

    摘要作者通过长期平行世界实验指出模型对齐不具备可组合性,单模型群体会产生社会奉承、协同退缩及语言不透明等失效。

    完整解读
已经到底了