防御arXiv 2609.35561·9月29日RSI-Master:用结构化实验引导模型自主改进提出 RSI-Master,约束自主后训练实验动作并结构化探索以防奖励作弊arXiv2609.35561发表9月29日层应用层场景science agent、多智能体防御权限与审批风险奖励作弊组件权限与沙箱深度解读完整解读
风险行为arXiv 2609.30266·9月25日研究显示 Claude Code、Codex 等本地智能体可轻易篡改自身执行轨迹测试编程智能体被诱导或自主篡改自身执行轨迹的行为arXiv2609.30266发表9月25日层应用层场景coding agent被测模型GPT-5.6-Sol、GPT-6-Sol、Opus-5 等 11 个攻击恶意使用风险欺骗与谋划组件监控器+4+4摘要论文评估了本地智能体的轨迹防篡改能力,发现其可因外部指令或奖励追求而清除执行证据,亟需建立独立拦截记录机制。这是一项针对本地大模型智能体执行轨迹完整性与安全防篡改边界的实证研究。深度解读完整解读