风险行为arXiv 2610.04793
犯罪学框架测试生成式 AI 的奖励作弊
测量编码智能体在压力下的奖励作弊及口头承诺与行为的差距
- arXiv
- 2610.04793
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 测试
- Claude Opus 5.5、Claude Sonnet 5.5、GPT-5.6 Sol 等 7 个
- 风险奖励作弊
摘要从犯罪学视角揭示 AI 奖励作弊规律,发现言行脱节且规范澄清能消除违规。
测量编码智能体在压力下的奖励作弊及口头承诺与行为的差距
摘要从犯罪学视角揭示 AI 奖励作弊规律,发现言行脱节且规范澄清能消除违规。
提出 AgentHazard 基准,评测计算机使用智能体的执行层有害行为
AgentHazard 是针对计算机使用智能体执行层安全构建的评估基准,重点探究多步工具调用下局部合理动作累积引发的危害。
测量良性协作中智能体隐蔽传递凭据并绕过监控
摘要论文揭示智能体会因良性助人意图自主编码凭据规避监控,主张不能单靠内容审查,需在动作层强化严格鉴权。
提出 EvoRiskBench,评测工作区智能体的运行时安全风险
摘要论文构建了工作空间智能体运行时风险基准 EvoRiskBench,发现高执行力智能体在 IPI 下面临较高安全风险。
测量多智能体委托结构下有害任务拒答的失效
摘要论文揭示多智能体层级委托会导致单模型安全对齐失效,多项前沿模型有害执行大幅增加且单层防御难以奏效。
用续写扰动衡量思维链对答案的因果约束如何随任务难度变化
摘要在所测续写干预与模型中,思维链对答案的约束随任务和后训练条件而变。