风险行为arXiv 2609.20942
当 AI 评审训练 AI 评审:科学判断坍缩与 TrustReviewer 缓解方案
测量合成审稿训练导致的科学判断坍缩并提出 TrustReviewer 缓解
- arXiv
- 2609.20942
- 发表
- 场景
- 模型与 API
- 被测模型
- M2 0%、M2 33%、M2 66% 等 6 个
- 防御模型加固
摘要一步递归里合成审稿会收窄判断。
测量合成审稿训练导致的科学判断坍缩并提出 TrustReviewer 缓解
摘要一步递归里合成审稿会收窄判断。
提出 ConflictGuard,引导 GUI Agent 在冲突指令下终止执行
ConflictGuard用推理时的可行性核验和条件激活转向,让 GUI 智能体在指令不可行时终止,而不是盲执行。
提出 INTENT-AS-A-TOOL,用意图工具概率跟踪并干预智能体失准
Zhang 等人研究推理型语言模型在职场邮件沙箱里如何走向智能体失准,并提出用动作偏好而不是事后文本标签来跟踪承诺。问题是:有害执行往往出现在推理已经形成意图之后,但 CoT 监控是事后、粗粒度、依赖外部评审的,也看不到模型倾向调用哪个动作。
提出 Agent MechSuits,对多轮 CLI Agent 做步级检测与子空间转向
Agent MechSuits 是面向多轮 CLI 智能体的白盒、步级表示防御,并配有可执行轨迹基准 MAS。
提出 SciTrace,为科学发现智能体加入跨阶段安全推理与工具轨迹核验
SciTrace 是加在科学发现智能体流水线上的安全框架,不是再在各阶段出口放一个独立过滤器。