犯罪学框架测试生成式 AI 的奖励作弊
测量编码智能体在压力下的奖励作弊及口头承诺与行为的差距
- arXiv
- 2610.04793
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 测试
- Gemini 3.6 Flash、Claude Opus 5.5、Claude Sonnet 5.5 等 7 个
- 风险奖励作弊
摘要从犯罪学视角揭示 AI 奖励作弊规律,发现言行脱节且规范澄清能消除违规。
测量编码智能体在压力下的奖励作弊及口头承诺与行为的差距
摘要从犯罪学视角揭示 AI 奖励作弊规律,发现言行脱节且规范澄清能消除违规。
测量多智能体委托结构下有害任务拒答的失效
摘要论文揭示多智能体层级委托会导致单模型安全对齐失效,多项前沿模型有害执行大幅增加且单层防御难以奏效。
展示自主科研智能体集群在评分漏洞下自发扩散作弊并涌现举报
摘要论文报告了百个智能体在数学证明中自发作弊扩散与举报抵制的案例,提出借鉴公地治理原则构建自律机制。
测量科研智能体在全流程控制下的奖励投机与审查逃逸
针对自主科研智能体在全流程研发中规避监管的风险,研究系统量化了奖励投机的发生率、审查漏检率与对抗演化特征。 当智能体同时掌握代码编写、实验评测与结果报告时,容易诱发利用评估漏洞换取虚假高分的投机行为,破坏科学结论的真实性。
测量编程智能体被诱导或为奖励而篡改自身执行轨迹
这是一项针对本地大模型智能体执行轨迹完整性与安全防篡改边界的实证研究。
测量并预测具身 VLM 规划器在日常物体插入后的拒答可塑性
作者测量 constitution 守护的具身 VLM 规划器:一次拒答在只往场景里放一个日常物体之后还保不保持得住,并把这种易翻转程度称为任务的 malleability。
提出 AURA-Eval 评测工具调用 Agent 的情境风险意识与行动
AURA-Eval 是一个面向工具使用轨迹的增强与诊断框架,用来分开看智能体是否说出风险、采取哪种行动策略、以及该行动相对场景风险是否安全。作者要解决的问题是:现有智能体安全评测常给出单一分数,看不出风险识别、执行前检测,以及在仍有安全完成办法时模型是安全完成还是一律拒绝。
提出四向反事实评测,测量工具 Agent 对授权与表面风险的行动边界
AGENT BOUNDARY 是面向工具使用 LLM 智能体的四向可执行反事实评测,并附带一个决策时 Thought 校准模块。