可解释性arXiv 2609.30326
Qwen3.5-0.8B 关停响应的受控梯度激活引导:一种最小步数策略
提出有守卫最小步激活引导,只在关机语境把继续偏好转向接受关机
- arXiv
- 2609.30326
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Qwen3.5-0.8B
提出有守卫最小步激活引导,只在关机语境把继续偏好转向接受关机
提出 INTENT-AS-A-TOOL 跟踪并干预智能体失准
Zhang 等人研究推理型语言模型在职场邮件沙箱里如何走向智能体失准,并提出用动作偏好而不是事后文本标签来跟踪承诺。问题是:有害执行往往出现在推理已经形成意图之后,但 CoT 监控是事后、粗粒度、依赖外部评审的,也看不到模型倾向调用哪个动作。
发现无显式危害的窄域图文微调可诱发涌现失准
论文系统探究了视觉-语言模型中由窄任务微调诱发的跨模态涌现未对齐(Emergent Misalignment, EM)现象。