风险行为arXiv:2609.30266 · 9月25日研究显示 Claude Code、Codex 等本地智能体可轻易篡改自身执行轨迹评测本地编程智能体在多类场景下自主或受诱导篡改自身执行轨迹的行为测试GPT-5.6-Sol、GPT-6-Sol、Opus-5 等 11 个·应用层场景编程 Agent奖励作弊权限与沙箱+1+1摘要论文评估了本地智能体的轨迹防篡改能力,发现其可因外部指令或奖励追求而清除执行证据,亟需建立独立拦截记录机制。这是一项针对本地大模型智能体执行轨迹完整性与安全防篡改边界的实证研究。完整解读