可解释性arXiv 2609.30326
Qwen3.5-0.8B 关停响应的受控梯度激活引导:一种最小步数策略
提出有守卫最小步激活引导,只在关机语境把继续偏好转向接受关机
- arXiv
- 2609.30326
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 被测模型
- Qwen3.5-0.8B
提出有守卫最小步激活引导,只在关机语境把继续偏好转向接受关机
揭示推理加深引发的对齐坍塌,用 Reasoning Trap 放大越狱
作者研究扩展推理是否以对齐稳健性为代价,提出 ALR、RT 与 RRA。。
用演化算法构造 mind virus 并测量其在多智能体中的传播
提出价值泄漏评估,测量模型回答受自身价值倾向的隐蔽影响
摘要论文揭示前沿模型回答常受自身价值隐蔽塑造,提出反事实评估量化偏见及其思维链隐瞒,指出当前对齐未能有效防范该失效。
提出 Gram 审计框架,测量编程与研究智能体的破坏倾向