风险行为arXiv:2610.04793 · 10月4日犯罪学框架测试生成式 AI 的奖励作弊测量编码智能体在压力下的奖励作弊及口头承诺与行为的差距编程 Agent·测试Claude Opus 5.5、Claude Sonnet 5.5、GPT-5.6 Sol 等 7 个·应用层奖励作弊摘要从犯罪学视角揭示 AI 奖励作弊规律,发现言行脱节且规范澄清能消除违规。完整解读
评测与基准arXiv:2604.02947 · 4月3日AgentHazard:评估计算机使用智能体有害行为的基准提出 AgentHazard 基准,评测计算机使用智能体的执行层有害行为网页与电脑操作编程 Agent·测试Qwen2.5-72B-Instruct、Qwen2.5-Coder-32B-Instruct、Qwen3-32B 等 12 个·应用层恶意使用摘要AgentHazard 评估了计算机使用智能体的执行安全,作者认为模型层对齐无法可靠保障智能体层面的安全性。AgentHazard 是针对计算机使用智能体执行层安全构建的评估基准,重点探究多步工具调用下局部合理动作累积引发的危害。完整解读
评测与基准arXiv:2610.03153 · 10月2日EvoRiskBench:面向工作区 Agent 运行时安全风险的演化基准提出 EvoRiskBench,评测工作区智能体的运行时安全风险编程 Agent多智能体·测试GPT-5.6 Sol、DeepSeek-V4-Pro-0813、Claude Opus 5·应用层提示注入MCP 与技能摘要论文构建了工作空间智能体运行时风险基准 EvoRiskBench,发现高执行力智能体在 IPI 下面临较高安全风险。完整解读