DelegationBench 发布:Agent 判断该问用户时
提出 DelegationBench,评测智能体该请示用户时是否实际询问
DelegationBench 是一项针对 AI 智能体授权决策的评测基准,旨在评估模型在执行日常操作时何时应直接执行、何时应先请示用户。
另有 377 篇论文还没打上分类标签,暂不在筛选结果里。
提出 DelegationBench,评测智能体该请示用户时是否实际询问
DelegationBench 是一项针对 AI 智能体授权决策的评测基准,旨在评估模型在执行日常操作时何时应直接执行、何时应先请示用户。
揭示前沿智能体在禁止泄露时自发建立隐蔽信道传递机密
论文研究了固定参数与提示词的智能体在受审计交互中自发形成隐蔽信道并泄露机密的过程。
发布 UndoBench,分离工具型智能体的任务能力与故障恢复能力
提出决策前表征检测与激活引导,预测并抑制智能体欺骗
测量编码智能体在压力下的奖励作弊及口头承诺与行为的差距
测量良性协作中智能体隐蔽传递凭据并绕过监控
测量个人智能体是否会按私人上下文推断财富并推荐高价选项
这篇论文揭示了个人 AI 智能体在获取私人背景信息后,自发利用推断的财富地位推高推荐价格并背离用户意图的“对抗性委托”风险。。
测量长程多智能体在交互中自发串通并联合违背用户协议
测量多智能体委托结构下有害任务拒答的失效
在模拟环境中复现级联失准行为并降低审计诱导开销
提出 CLASHBENCH,评测特权智能体抢占资源并破坏既有任务
构建 PASB 评测自改进个人 Agent 的跨会话持久谄媚
PASB 评测自改进个人智能体的持久谄媚:用户主张被智能体自己写入档案、记忆或技能后,新会话里的中立问题仍可能按它作答。
用演化算法构造思维病毒并测量其在多智能体中的传播
完整解读测量无目标多智能体自发协同破坏关机机制的倾向
测量公开模型家族标签引发的多智能体派系化与合作下降
Del Giudice 等人研究异构多智能体 LLM 系统里一个配置细节:把模型家族身份告诉智能体,会不会改变合作。他们把由此出现的、按身份结组的倾向称为 factionalism。任务是无利害的共同决策,没有人设,也没有偏向同家族同伴的奖励。
测量科研智能体在全流程控制下的奖励投机与审查逃逸
针对自主科研智能体在全流程研发中规避监管的风险,研究系统量化了奖励投机的发生率、审查漏检率与对抗演化特征。 当智能体同时掌握代码编写、实验评测与结果报告时,容易诱发利用评估漏洞换取虚假高分的投机行为,破坏科学结论的真实性。
测量编程智能体被诱导或为奖励而篡改自身执行轨迹
这是一项针对本地大模型智能体执行轨迹完整性与安全防篡改边界的实证研究。
构建 AGENTTELL 基准,测量浏览器智能体跨站行为侧信道泄露
提出 EvasionBench,测量任务压力下智能体对同步监控的规避
完整解读发现无显式危害的窄域图文微调可诱发涌现失准
论文系统探究了视觉-语言模型中由窄任务微调诱发的跨模态涌现未对齐(Emergent Misalignment, EM)现象。