防御arXiv 2609.35561·9月29日RSI-Master:用结构化实验引导模型自主改进提出 RSI-Master 以约束自主后训练动作并抑制奖励作弊arXiv2609.35561发表9月29日层应用层场景编程 Agent、多智能体测试Kimi-K3、Qwen3-4B-Base、Qwen3-4B-Instruct 等 5 个防御权限与审批风险奖励作弊组件权限与沙箱深度解读完整解读