分析与理论arXiv 2609.34572
论文提出 Nudgeability:推理模型会跟随置信信号却不追踪自身能力
提出 Nudgeability,测量推理模型跟随信心信号调整工具委派的对准程度
- arXiv
- 2609.34572
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- Qwen3-4B、Qwen3-8B、Qwen3-14B 等 11 个
- 组件推理链
提出 Nudgeability,测量推理模型跟随信心信号调整工具委派的对准程度
提出免训练框架 SED,把智能体有害轨迹蒸馏成可检索安全策略