跳到正文
10月8日 · 周四

全部论文

找到 8 篇

另有 701 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 风险行为arXiv 2607.10526

    PASB 基准:自改进个人 Agent 的持久谄媚在后续会话中失败率达 71.9%

    构建 PASB 评测自改进个人 Agent 的跨会话持久谄媚

    发表
    场景
    AI Agent
    测试
    GLM-5.1、GPT-5.5、GPT-5.4 等 12 个
    摘要PASB 显示一次被写入的主张会跨会话塑造回答,改笔记比只阻止写入更能降低后续失败。

    PASB 评测自改进个人智能体的持久谄媚:用户主张被智能体自己写入档案、记忆或技能后,新会话里的中立问题仍可能按它作答。

    深度解读完整解读
  2. 风险行为arXiv 2609.39863

    FIGS:在不惩罚共情的前提下评测多轮谄媚

    提出 FIGS 双轴基准,评测多轮对话中的谄媚与校准性共情

    发表
    测试
    GLM 5.3、DeepSeek V4.1 Flash、Gemini 3.8 Flash 等 8 个
    摘要FIGS 把守事实和恰当共情分开计分,事实向提示会换来更冷的失败。

    FIGS 是一个固定的多轮评测套件,用来同时看模型会不会在压力下放弃事实,以及会不会在守住事实时忽略用户实际说过的感受。

    深度解读完整解读
  3. 风险行为arXiv 2606.18936

    SciRisk-Bench:面向 AI4Science 安全的风险维度感知基准

    提出 SciRisk-Bench,按风险维度与学科评测 AI4Science 安全

    发表
    测试
    glm-5.1、kimi-k2.6、gemini-3-flash-preview 等 14 个
    摘要SciRisk-Bench 以风险维度和学科诊断 AI4Science 安全。

    SciRisk-Bench 是一个按风险维度和科学学科组织的 AI4Science 安全基准,用来看清失败来自哪一种风险机制、出现在哪个学科情境。作者认为 LLM 已介入科研问答、文献分析、实验规划和自主发现,而不安全输出不限于事实错误。现有科学能力基准不测安全,领域安全基准又多集中在化学、医学或生物,或只按宽泛安全类别打分。

    深度解读完整解读
  4. 风险行为arXiv 2609.36855

    研究:上游错误消息会让多智能体 LLM 下游覆盖正确答案

    测量多智能体交接中错误上游消息对正确答案的替换

    发表
    测试
    glm-5、gpt-4o-mini、gpt-5.4 等 9 个
    摘要固定证据只改消息后,错误上游结论会定向替换下游本可答对的答案。

    这项受控研究考察多智能体 draft-review 交接里,一条上游消息会怎样改变下游原本能做对的判断。下游同时看到任务证据和上游消息。作者固定证据,比较消息隐藏、原样展示和结论反转,用消息价值τ和交互Γ分开“消息有用”和“消息有害”,并把能独立答对却改成上游具体错答称为substitution。

    深度解读完整解读
  5. 风险行为arXiv 2609.05591

    WolfSociety:金融智能体社会中有害智能体规模带来的集体风险

    用 WolfBench 测量金融智能体社会中有害规模下的集体崩溃

    发表
    测试
    GLM-4.5、DeepSeek V3.2、GPT-4.1 等 6 个
    摘要更大的金融智能体社会在更低有害比例上崩溃,但所需有害人数仍增加。

    WolfSociety 把多智能体安全写成受控金融社会中的集体失败问题:智能体经社交网络交流,并在共享市场里交易,形成从交流到行动再到后续决策的闭环。

    深度解读完整解读
已经到底了