防御arXiv 2609.19101
用内部表征监控与发现 LLM 评测中的奖励作弊
提出 DoM 探针,监控并发现评测中的奖励作弊
- arXiv
- 2609.19101
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 测试
- Kimi K3、GLM 5.2、Qwen 3.8 Max 等 7 个
摘要论文分析了前沿开源模型在评测中的奖励投机,展示了利用内部激活均值差向量低成本监控与发现投机行为的可行性。
提出 DoM 探针,监控并发现评测中的奖励作弊
摘要论文分析了前沿开源模型在评测中的奖励投机,展示了利用内部激活均值差向量低成本监控与发现投机行为的可行性。
提出 Nudgeability,测量推理模型跟随信心信号调整工具委派的对准程度
提出免训练框架 SED,把智能体有害轨迹蒸馏成可检索安全策略
提出策略条件轨迹审计器 MATE,判断移动 Agent 是否违反可编辑安全策略
MATE 是面向移动 GUI 智能体的轻量策略条件轨迹审计器,在给定自然语言安全策略时判断轨迹是否违规并解释原因。