分析与理论arXiv 2610.06851
研究发现基础模型仅靠固定开头 token 即可达到 RL 级推理表现
证明短开头词可唤醒基模型推理,且效应来自训练数据
- arXiv
- 2610.06851
- 发表
- 场景
- 模型与 API
- 测试
- Qwen3-4B、Qwen3-14B、Qwen2.5-Math-7B 等 10 个
- 组件推理链
证明短开头词可唤醒基模型推理,且效应来自训练数据
审计视觉语言模型在敏感图像上从拒答转向国家立场重构的行为
论文系统研究了中外开源视觉语言模型在政治敏感图像上的审查行为,主要内容如下。
提出四种阶段转换攻击,绕过推理模型的安全推理护栏
提出 RACER,用区域感知一致性对抗微调去除多模态大模型后门
提出 Nudgeability,测量推理模型跟随信心信号调整工具委派的对准程度