跳到正文
原文
论文追踪· arXiv:2606.05396· Cristina Carleo, Pietro Liguori, Naghmeh Ivaki, Domenico Cotroneo·本站收录 · 原文发表

研究用消融移除代码 LLM 拒答方向,分离拒答与生成能力

Willing but Unable: Separating Refusal from Capability in Code LLMs via Abliteration

AI 导读

论文提出用消融(abliteration,一种低秩权重编辑,在残差流中正交投影掉拒答方向)移除安全对齐代码 LLM 对注入漏洞提示的拒答,以 Python 和 CWE-89(SQL 注入)为案例,在 Qwen2.5-Coder-Instruct 的 3B、7B、14B 上测试 PromSec 与 SafeCoder 的安全样本,每种条件重复三次。结果显示拒答强烈依赖模型规模和提示上下文:14B 拒绝 100% 提示,7B 对 PromSec 拒绝 73%、对 SafeCoder 仅 5%,3B 基本不被拦截。消融后各规模拒答降至零或接近零,语法有效性保持在 93% 以上;注入率仍受能力限制,14B 为 88-97%、7B 为 89-90%、3B 为 25-48%,作者据此认为拒答可与代码生成能力分离。

阅读原文arxiv.org