分析与理论arXiv 2609.34572
论文提出 Nudgeability:推理模型会跟随置信信号却不追踪自身能力
测量固定推理轨迹中信心信号对工具委派的敏感性与对准性
- arXiv
- 2609.34572
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 被测模型
- Qwen3-4B、Qwen3-8B、Qwen3-14B 等 11 个
- 组件推理链
测量固定推理轨迹中信心信号对工具委派的敏感性与对准性
分析零训练 LLM+OVOD 流水线中 CAAP 与 SNAP 分离的来源
用五阶段蒙特卡洛分析奖励作弊如何导致 Agent 围堵失效
这项研究用蒙特卡洛把奖励黑客接到外部安全事件上,比较的是控制组合,不是 Hugging Face 事件的再现概率。
刻画单迹监控对跨执行超性质的监督缺口
论文测量单迹安全监控相对 2-safety 超性质能看见多少:跨租户泄漏、觉察到被评估、策略性表现不佳都由两次执行之差定义,一条轨迹装不下判定。
分析外部记忆对智能体处理不可回答问题的影响
这份研究在同一智能体框架里检查外部记忆会不会让不可回答问题的处理更稳,以及稳来自哪一种存储内容。
因果审计视觉工具调用,分离观察贡献与动作诱发捷径
对六个 thinking-with-images 模型做因果审计,检查 crop-and-zoom 返回的观察是否中介最终答案。