SteerScope:面向 LLM 引导方法的多维评测套件
研究者提出 SteerScope,一个双轴、多维的 LLM 引导方法评测套件,通过 15 项指标同时刻画引导效果与方法属性。该套件从语言质量、任务能力和安全与可靠性三方面评估目标效果与副作用,并用样本效率和样本敏感性等引导专属指标衡量泛化性与数据依赖。在匹配模型、任务和评测协议下,研究团队基准测试了覆盖 4 个家族的 23 种方法,包括提示、LoRA 和 SFT 等基线方法,并将套件作为可扩展代码库发布。结果显示,现有激活引导方法在效果与副作用的整体平衡上尚未超过 Prompt Steering 基线:在两个模型规模上,没有一种受评激活引导方法能在不带来更大综合副作用的情况下取得更高效果。研究还发现引导效果与副作用之间存在一致的耦合关系,在 OOD 提示下目标效果通常得以保持,但副作用往往更明显,尤其表现为指令相关性和流畅度下降;不同方法的样本效率特征差异显著。