防御arXiv 2609.35561
RSI-Master:用结构化实验引导模型自主改进
提出 RSI-Master,约束自主后训练实验动作并结构化探索以防奖励作弊
- arXiv
- 2609.35561
- 发表
- 层
- 应用层
提出 RSI-Master,约束自主后训练实验动作并结构化探索以防奖励作弊
测试编程智能体被诱导或自主篡改自身执行轨迹的行为
这是一项针对本地大模型智能体执行轨迹完整性与安全防篡改边界的实证研究。
提出 VA-Judger,用人类偏好训练联合音视频奖励模型
VA-Judger 是面向联合音视频生成的思维链全模态奖励模型,用来替代由分维度专家指标拼成的强化学习奖励。