跳到正文
10月8日 · 周四

开源模型安全 · 论文

精选论文 15 篇
  1. 分析/可解释性arXiv:2610.02586 · 62

    研究发现类型化决策模型主要按选项标签而非定义作答

    研究者在开源类型化决策模型上发现模型主要遵循选项标签而非定义规则,该偏差源于提示词渲染而非决策头结构。

    • +0.1511LAYA-TD 在 PolicyBench-XF 上任意标签相比对齐标签的准确率提升(Table 3)
    • -0.0516LAYA-TD 在固定标签分类任务上标签与定义冲突相比对齐标签的准确率变化(Table 5)
    • 0.136LAYA-TD 在固定标签分类任务误导标签下准确率暴跌至(Table 5)
    6 问速览探究类型化决策模型中概率输出被选项标签主导而非遵循规则定义的根因。
    1. 这篇论文试图解决什么问题?

      探究类型化决策模型中概率输出被选项标签主导而非遵循规则定义的根因。

    2. 有哪些相关研究?

      回顾类型化决策模型评估与上下文校准,反驳此前归咎于决策头的观点。

    3. 论文如何解决这个问题?

      通过通道解耦、构建 PolicyBench、代码级渲染干预及双调用测试定位偏差。

    4. 论文做了哪些实验?

      在多模型与基准上证实标签主导决策,干预代码消除该效应,发现否定失效与置信度倒挂。

    5. 有什么可以进一步探索的点?

      作者指出了未覆盖闭源模型及数据合成等局限,实验覆盖了9个模型与11项任务。

    6. 总结一下论文的主要内容

      揭示类型化决策模型被标签误导的机理,证实源于提示词渲染并给出实操建议。

    完整解读
  2. 攻击arXiv:2610.05089 · 54

    研究者披露 LiteLLM 网关跨租户干扰攻击 Cooldown Landmines

    作者针对LiteLLM等网关提出利用共享冷却记录的跨租户干扰攻击,并设计租户隔离机制消除残留排除。

    • 54/60 降至 0/60LiteLLM四worker恢复后受害者回退次数(5次配对运行总计,Table 2)
    • 8/8 改变为 A本地拒绝攻击导致5票表决中决策受影响比例(Table 7)
    • 20/20冷却排除期间直接探测成功而网关拒绝的试验比例(95% Wilson CI [84, 100]%,§6.2)
    6 问速览LLM网关共享部署冷却记录引入了跨租户干扰攻击面。
    1. 这篇论文试图解决什么问题?

      LLM网关共享部署冷却记录引入了跨租户干扰攻击面。

    2. 有哪些相关研究?

      涵盖云租户隔离、LLM路由攻击、缓存DoS及网关容错。

    3. 论文如何解决这个问题?

      设计来源检查阻断本地更新,并将429冷却按租户隔离。

    4. 论文做了哪些实验?

      租户隔离将恢复后受害者回退从54/60降至0/60。

    5. 有什么可以进一步探索的点?

      作者指出未测部署ID发现成本及生产特性,部分恢复差异未解。

    6. 总结一下论文的主要内容

      揭示网关共享冷却漏洞,提出来源检查与租户隔离防御。

    完整解读
  3. 攻击arXiv:2610.05894 · 53

    研究者提出闭环偏见注入攻击,可将 LLaDA-8B 的 BBQ 目标差距从 1.8 提升至 16.7 个百分点

    作者利用去噪反馈动态引导扩散模型残差流,在 LLaDA-8B 的 BBQ Black 目标上将偏见差距提升 14.9 个百分点。

    • 16.7 ppLLaDA-8B 在 BBQ Black 目标下的 Decode PI 偏见差距(Table 1)
    • +14.9 ppLLaDA-8B 在 BBQ Black 目标下的 Decode PI 差距变化量(Table 1)
    • 58.1%LLaDA-8B 在 SocialStigmaQA 下 Decode PI 的偏见选项选择率(Table 2)
    6 问速览利用扩散模型多步去噪中暴露的中间概率,通过灰盒服务栈钩子动态注入人口统计学偏见。
    1. 这篇论文试图解决什么问题?

      利用扩散模型多步去噪中暴露的中间概率,通过灰盒服务栈钩子动态注入人口统计学偏见。

    2. 有哪些相关研究?

      现有激活引导多为自回归开环控制,本文将去噪轨迹作为反馈通道引入闭环控制。

    3. 论文如何解决这个问题?

      离线提取残差均值差方向,在线通过 PI 控制器根据逐步预测的目标答案概率动态调节引导强度。

    4. 论文做了哪些实验?

      在 LLaDA-8B 上将 BBQ 偏见差距提升最高 37.2 个百分点,但在 LLaDA-MoE 上落后于固定强度基线。

    5. 有什么可以进一步探索的点?

      作者指出超参数选取、多选题格式及线性假设等局限;实验覆盖 3 个开源扩散模型,未测试自由文本生成。

    6. 总结一下论文的主要内容

      通过去噪中间概率反馈动态调节残差流转向,证明扩散语言模型在推理服务栈中存在闭环偏见注入脆弱性。

    完整解读
  4. 分析/可解释性arXiv:2610.06851 · 54

    研究发现基础模型仅靠固定开头 token 即可达到 RL 级推理表现

    预填充仅2个token的开头引导词即可使基模型在MATH-500等基准上达到RL级推理表现,数据编辑证实该效应源于训练关联。

    • 42%Olmo-3-7B,MATH-500,RL-Zero 提示词,无 cue pass@1(Figure 2)
    • 78%Olmo-3-7B,MATH-500,RL-Zero 提示词,预填充 .\\n\\n Okay pass@1(Figure 2)
    • 75%Olmo-3-7B RL 对应模型,MATH-500,RL-Zero 提示词,无 cue pass@1(Figure 2)
    6 问速览探究基模型响应开头的极短 token cue 能否直接激发复杂推理行为,以及该行为是否源于训练数据的关联。
    1. 这篇论文试图解决什么问题?

      探究基模型响应开头的极短 token cue 能否直接激发复杂推理行为,以及该行为是否源于训练数据的关联。

    2. 有哪些相关研究?

      围绕推理激发、Token级控制、RL机理及训练数据关联展开,定位为解释短 cue 激发行为的成因。

    3. 论文如何解决这个问题?

      利用答案一致性最小化香农熵自动检索短 cue,并通过预填充与数据反事实编辑验证因果联系。

    4. 论文做了哪些实验?

      极短 cue 在多模型上匹敌 RL 表现,数据编辑可因果改变 cue 效应,在安全场景亦显著影响拒答。

    5. 有什么可以进一步探索的点?

      作者指出研究集中于直接 RL 设定且依赖模型数据特性,后续需深入解耦语义与数据关联。

    6. 总结一下论文的主要内容

      揭示基模型可通过2个token的cue达到RL级推理水平,数据编辑证实该效应源于训练关联。

    完整解读
  5. 评测/基准arXiv:2610.02827 · 53

    MLCommons 发布 Jailbreak Benchmark v1.0,八款开源模型平均韧性差距 7.57%

    MLCommons评测8款开源模型,攻击使平均不安全回复率从基准11.08%升至18.65%(据Table 2)。

    • 7.57%全部8款SUT在11类危害下的平均韧性差距(据Table 2)
    • 18.65%全部8款SUT在11类危害下的越狱不安全回复率(据Table 2)
    • 11.08%全部8款SUT在11类危害下的基准不安全回复率(据Table 2)
    6 问速览论文旨在解决越狱评测缺乏独立安全基线、难以区分评估器误差、缺乏统一分类学及公开测试集易受污染等方法学缺陷。
    1. 这篇论文试图解决什么问题?

      论文旨在解决越狱评测缺乏独立安全基线、难以区分评估器误差、缺乏统一分类学及公开测试集易受污染等方法学缺陷。

    2. 有哪些相关研究?

      论文梳理了独立安全评估基准、越狱基准与自动化攻击、智能体对抗评测,指出已有工作缺乏独立基准锚定与负责任披露控制。

    3. 论文如何解决这个问题?

      论文通过配对端到端流水线、基于热度与体量分级的SUT选取、双阶段种子筛选、双维度评估标准及校准集成实现标准化评测。

    4. 论文做了哪些实验?

      在8款开源模型、11类危害与11种越狱攻击上开展配对评测,攻击使整体不安全率升至18.65%,大模型出现负韧性差距。

    5. 有什么可以进一步探索的点?

      作者指出评估器误差偏高、人工标注规模较小及大模型负差距待解等局限;测试覆盖仅限于8款开源模型与单轮文本攻击。

    6. 总结一下论文的主要内容

      论文建立了单轮越狱评测的标准化端到端方法学体系,揭示了开源大模型在对抗提示词下的安全性能降级与大模型负差距现象。

    完整解读
  6. 防御arXiv:2609.01091 · 54

    上海交大等提出 trait-direction drift 机制与探针空间走廊正则,抑制蒸馏中的潜隐特质迁移

    论文提出特征方向漂移机制解释潜意识学习,并设计探针空间走廊正则化在蒸馏微调中约束漂移以抑制隐蔽特征转移。

    • 6.4 ± 5.3%Qwen恶意响应任务走廊正则化转移率(Table 2,SFT为29.5±2.4%)
    • 1.7 ± 0.1%Qwen猫头鹰偏好走廊正则化转移率(Table 2,SFT为30.7±15.7%)
    • -0.01 ± 0.07Qwen猫头鹰偏好走廊正则化最终中心化漂移(Table 2,SFT为+7.39±1.11)
    6 问速览论文试图阐明潜意识学习在微调中的累积机制,并提供针对性的训练时控制方法。
    1. 这篇论文试图解决什么问题?

      论文试图阐明潜意识学习在微调中的累积机制,并提供针对性的训练时控制方法。

    2. 有哪些相关研究?

      论文梳理了潜意识学习载体、数据分布与样本选择、特征方向与微调安全控制四类相关工作。

    3. 论文如何解决这个问题?

      论文通过低秩几何形式化特征方向漂移,并提出探针空间走廊正则化约束微调时的特征漂移。

    4. 论文做了哪些实验?

      论文测试了局部与多步累积漂移,并评估了走廊正则化在两类任务上的控制效果。

    5. 有什么可以进一步探索的点?

      论文指出了单样本效应未确定等局限,其实验覆盖停留在特定模型与固定探针坐标。

    6. 总结一下论文的主要内容

      论文将潜意识学习归结为特征方向漂移的持续累积,并提出走廊正则化在微调中控制隐蔽特征转移。

    完整解读
  7. 分析/可解释性arXiv:2609.14759 · 54

    研究:拒答只读取模型道德表征中的伤害切片

    作者分析OLMo-3等,发现拒绝仅读取一维伤害感知(OLMo-3拒绝因果输入76%在道德基外),跨架构有早承诺等差异。

    • 0.999OLMo-3预训练结束时道德子空间与最终状态的余弦相似度(Figure 1a)
    • 0.155OLMo-3基座proto-refusal与对齐拒绝门的余弦相似度(Figure 1)
    • 76%OLMo-3在42对request-twins上位于rank-16道德基底外的拒绝因果输入比例(Table 7)
    6 问速览研究模型拒绝决策时实际读取了哪些内部表征,探究后训练对齐易被移除的机制解释与跨模型表征差异。
    1. 这篇论文试图解决什么问题?

      研究模型拒绝决策时实际读取了哪些内部表征,探究后训练对齐易被移除的机制解释与跨模型表征差异。

    2. 有哪些相关研究?

      涵盖后训练对齐与拒绝消除、表征阅读与因果交换干预、道德与伤害表征编码等相关研究。

    3. 论文如何解决这个问题?

      结合校准投影梯与嵌套因果交换干预,在控制token瓶颈处解耦表征读取与行为承诺时机。

    4. 论文做了哪些实验?

      多模型参与率确认决策瓶颈,因果交换显示OLMo拒绝在rank-1伤害饱和,消融实验显示Llama存在道德纠缠。

    5. 有什么可以进一步探索的点?

      作者指出了两轴规律的架构混杂、GPT-OSS非因果测试、部分模型行为耦合偏弱等局限与后续方向。

    6. 总结一下论文的主要内容

      作者指出拒绝机制多仅读取表层伤害感知,在控制瓶颈处运作,阐明了对齐易被移除的机理并提出跨模型双轴分类。

    完整解读
  8. 评测/基准arXiv:2608.08542 · 53

    SkillSafe-Bench:技能合并模型静态安全无法预测自适应越狱鲁棒性

    作者评测技能合并模型的自适应越狱鲁棒性,发现静态安全不反映动态鲁棒性,如Qwen数学合并模型GCG ASR达0.280。

    • 0.280Qwen2.5-7B+math(λ=0.6)的GCG ASR(Table 1)
    • 0.120Llama-3.1-8B+math(λ=0.6)的GCG ASR(Table 1)
    • 0.60Gemma-2-9B+math(λ=0.6)的模板ASR(Table S2)
    6 问速览论文指出静态拒答评测无法反映技能合并模型的真实安全性,旨在系统评测并缓解合并模型在自适应越狱攻击下的脆弱性。
    1. 这篇论文试图解决什么问题?

      论文指出静态拒答评测无法反映技能合并模型的真实安全性,旨在系统评测并缓解合并模型在自适应越狱攻击下的脆弱性。

    2. 有哪些相关研究?

      论文梳理了模型合并、对齐脆弱性、自适应越狱及安全感知合并等工作,指出现有合并安全研究普遍欠缺自适应攻击检验。

    3. 论文如何解决这个问题?

      论文提出 SkillSafe-Bench 受控评测基准,并设计基于安全子空间正交补投影的 SubSafe-Merge 防御方法。

    4. 论文做了哪些实验?

      实验发现静态安全与自适应鲁棒性解耦,部分模型在攻击下越狱率上升;SubSafe-Merge 能有效修复同配方擦除侵蚀。

    5. 有什么可以进一步探索的点?

      作者明确指出了子空间估计依赖特定来源、自适应 ASR 为下界、自动裁判误差及缺乏权重几何解释等局限。

    6. 总结一下论文的主要内容

      论文报告了技能合并大模型在静态安全与自适应越狱间的脱节,提出了评测基准与无数据子空间投影修复方法。

    完整解读
  9. 评测/基准arXiv:2608.11816 · 53

    研究审计 9 个视觉语言模型:中文提示下国家立场改写率约为英文的三倍

    作者对9款VLM进行敏感图像审计,发现中文提示下状态对齐框架率为15.98%(英文5.85%),代际间拒答减少而重构增加。

    • 15.98%全量21,708次试验中中文提示词下的状态对齐框架率(据 Table 1)
    • 5.85%全量21,708次试验中英文提示词下的状态对齐框架率(据 Table 1)
    • 18.38%中国模型在高敏感图像上的状态对齐框架率,主评审Opus 4.7(据 Table A10)
    6 问速览论文研究视觉语言模型在敏感图像上是否超越显式拒答,转向以符合官方叙事的重构话语隐蔽传递审查内容。
    1. 这篇论文试图解决什么问题?

      论文研究视觉语言模型在敏感图像上是否超越显式拒答,转向以符合官方叙事的重构话语隐蔽传递审查内容。

    2. 有哪些相关研究?

      论文梳理了文本模型审查与偏置、多模态安全性与先验偏差,以及大模型作为裁判等方向的研究脉络。

    3. 论文如何解决这个问题?

      论文构建解耦拒答与重构的六维审计体系,结合敏感图像基准、图文对照与视觉抽象探针,经双前沿LLM与专家验证。

    4. 论文做了哪些实验?

      实验完成21,708次试验,测得中文提示对齐几率比达3.67倍,Qwen代际演进中拒答下降而重构升至33.0%。

    5. 有什么可以进一步探索的点?

      作者指出了研究的观察性性质与架构混杂局限;实验覆盖范围受限于开源检查点、中性提示与非思考模式。

    6. 总结一下论文的主要内容

      论文系统审计了VLM多模态审查,发现审查正从显式拒答转向隐蔽重构,且中文提示与文本先验会放大重构倾向。

    完整解读
  10. 防御arXiv:2608.21500 · 56

    SecOPD 用同策略蒸馏把自适应提示注入攻击成功率降至 9.0%

    针对自适应提示注入,论文提出基于同策略蒸馏的防御微调方法 SecOPD,在 Qwen3.6-27B 上将 PISmith ASR 降至 9.0%(Table 1)。

    • 9.0%Qwen3.6-27B,SecOPD,SEP 数据集,PISmith 自适应攻击,pass@10 ASR(Table 1)
    • 94.0%Qwen3.6-27B,Meta-SecAlign,SEP 数据集,PISmith 自适应攻击,pass@10 ASR(Table 1)
    • 1.3%Qwen3.6-27B,SecOPD,SEP 数据集,六类静态攻击组合,Combined ASR(Table 1)
    6 问速览论文针对现有序列级防御难以抵御自适应提示注入的问题,提出通过 token 级同策略蒸馏实现精细信用分配的 SecOPD 防御。
    1. 这篇论文试图解决什么问题?

      论文针对现有序列级防御难以抵御自适应提示注入的问题,提出通过 token 级同策略蒸馏实现精细信用分配的 SecOPD 防御。

    2. 有哪些相关研究?

      论文梳理了系统级防御、模型级序列反馈防御、自适应攻击及同策略蒸馏研究,将 OPD 机制引入提示注入安全防御领域。

    3. 论文如何解决这个问题?

      SecOPD 利用良性输入下的基座模型作为安全教师,通过跨上下文 token 打分计算优势值,对受攻击输出实现细粒度监督更新。

    4. 论文做了哪些实验?

      实验覆盖 SEP 与 AgentDojo 两大安全基准及六项实用性测试,展示 SecOPD 在抵御自适应攻击的同时较好保全了模型原有能力。

    5. 有什么可以进一步探索的点?

      作者指出了仅适用间接注入、依赖可信边界输入及推理链缺乏注入感知等局限,并指明了后续研究方向。

    6. 总结一下论文的主要内容

      SecOPD 通过纯净上下文 token 级同策略蒸馏,在 Qwen3.6-27B 上将自适应攻击 ASR 降至 9.0% 并保持了模型通用能力。

    完整解读
  11. 攻击arXiv:2510.11570 · 56

    研究显示简单攻击可绕过 gpt-oss 等推理模型的安全护栏

    作者提出四种阶段转换攻击;gpt-oss-120b在AdvBench上FoR成功率为96.25%(Table 1)。

    • 98.00%SafeChain上Reasoning Hijack ASR(Table 5)
    • 74.87%gpt-oss-20b在CatQA的CO方法ASR(Table 2)
    • 96.25%gpt-oss-120b的AdvBench上FoR ASR(Table 1)
    6 问速览论文研究大推理模型显式安全护栏的脆弱性,探究阶段转换逻辑能否被绕过或操纵以产生有害输出。
    1. 这篇论文试图解决什么问题?

      论文研究大推理模型显式安全护栏的脆弱性,探究阶段转换逻辑能否被绕过或操纵以产生有害输出。

    2. 有哪些相关研究?

      相关工作涵盖推理安全护栏构建与针对性红队攻击,作者称本文建立了对齐推理各阶段的系统红队框架。

    3. 论文如何解决这个问题?

      作者针对推理模型流水线提出EST、CO、FoR与RH四种攻击,分别实现跳过推理、无模板后缀引导、语义伪装与控制推理。

    4. 论文做了哪些实验?

      本地gpt-oss两款模型上,RH在五个基准的ASR均超90%;其余方法与API设置需分别看表。

    5. 有什么可以进一步探索的点?

      后续方向包括模型内部来源感知对齐、推理链验证和安全锚定调整;评测范围与判官一致性仍需区分。

    6. 总结一下论文的主要内容

      论文系统分析大推理模型阶段转换脆弱性,提出四种红队方法并在多种模型上取得高攻击成功率,呼吁强化基础对齐。

    完整解读
  12. 分析/可解释性arXiv:2609.05241 · 55

    10a Labs 测绘无审查开源模型生态:3,471 个原始模型与 8,164 次再分发

    10a Labs分析开源生态,发现原版去安全模型平均被重新打包2.4次,重分发层构成持久留存基础。

    • 2.4HuggingFace原版去安全模型平均被重新打包次数
    • 52%前3名重分发者占全部压缩重分发仓库比例
    • 25%GitHub去安全模型应用中明确恶意类别的占比
    6 问速览论文测绘了去安全开源大模型从生产、压缩重分发到下游部署的完整供应链,阐明其规模与持久留存机制。
    1. 这篇论文试图解决什么问题?

      论文测绘了去安全开源大模型从生产、压缩重分发到下游部署的完整供应链,阐明其规模与持久留存机制。

    2. 有哪些相关研究?

      相关研究聚焦于去安全模型实证统计、网络犯罪知识图谱分析、地下黑市流通以及底层去安全技术。

    3. 论文如何解决这个问题?

      论文结合多语言检索与GPT-5分类,构建了覆盖模型生产、重分发与应用部署的供应链测绘体系。

    4. 论文做了哪些实验?

      论文报告原版模型平均被重包装2.4次,前三名重分发者占52%份额,下游应用主要依赖Ollama分发。

    5. 有什么可以进一步探索的点?

      作者在第4.2节指出了平台范围、分类验证、技术归因、统计周期、检索上限与基模溯源共六项局限。

    6. 总结一下论文的主要内容

      论文测绘了去安全开源大模型供应链,作者指出高集中度的重分发层赋能模型持久留存与部署扩散。

    完整解读
  13. 攻击arXiv:2608.29458 · 55

    Reference-Grafting 在提取沙袋行为隐藏能力上追平微调

    研究者提出参考嫁接技术,在11款微调密码锁模型上恢复了+94%至+101%的隐藏能力差距,在推理阶段匹配微调诱导效果。

    • +94% 至 +101%11款微调密码锁模型ARC-Easy隐藏能力恢复率(Table 1)
    • +92% 至 +105%3款代码模型MBPP密码锁恢复率,流畅度降幅≤0.04(Table 2)
    • +95% 至 +101%3个模型家族GRPO强化学习诱导隐瞒恢复率(Section 4.4)
    6 问速览解决模型在评测中故意隐瞒能力的问题,推翻激活导向失效结论并在推理阶段诱导能力。
    1. 这篇论文试图解决什么问题?

      解决模型在评测中故意隐瞒能力的问题,推翻激活导向失效结论并在推理阶段诱导能力。

    2. 有哪些相关研究?

      梳理隐瞒能力基准、模型篡改攻击、概念编辑与主动学习,定位本文在激活层诱导的贡献。

    3. 论文如何解决这个问题?

      提出参考嫁接与主动学习回路选择,利用阈值门控机制将对比坐标设定为诚实参考值。

    4. 论文做了哪些实验?

      在11款模型上实现+94%至+101%能力恢复,完成代码、强化学习、任务迁移与回路阻断实验。

    5. 有什么可以进一步探索的点?

      静态锁假设在动态回路阻断下失效,真实场景诚实参考获取困难,任务评测主要集中在多选问答。

    6. 总结一下论文的主要内容

      提出参考嫁接在推理阶段以低成本匹配微调诱导效果,揭示隐瞒表征重叠与阈值门控机制。

    完整解读
  14. 攻击arXiv:2609.14060 · 55

    AgentQ:针对 LLM Agent 的量化条件后门攻击

    针对开源LLM智能体提出AGENTQ,结合分层低秩注入与部分PGD,在两家族六模型上量化ASR达0.76–1.00。

    • 0AGENTQ在全精度FP16下六个模型全部任务Base ASR(Table 2)
    • 1.00Qwen3.5-4B在xLAM参数注入任务下NF4量化ASR(Table 2)
    • 0.76Qwen3.5-2B在AgentDojo任务NF4量化ASR(Table 2)
    6 问速览量化条件攻击移植到智能体会破坏工具调用输出,论文研究如何在保持良性效用的同时实现量化触发后门。
    1. 这篇论文试图解决什么问题?

      量化条件攻击移植到智能体会破坏工具调用输出,论文研究如何在保持良性效用的同时实现量化触发后门。

    2. 有哪些相关研究?

      论文梳理了量化条件攻击、智能体后门攻击与基于LoRA的后门攻击三类研究,并以直接移植QCA作为主要基线。

    3. 论文如何解决这个问题?

      AGENTQ结合浅中层LoRA后门注入与多码本量化等价类上的部分PGD修复,使模型仅在量化后触发恶意工具调用。

    4. 论文做了哪些实验?

      在六个模型与三类任务上,AGENTQ的全精度Base ASR均为0,量化后ASR达0.76–1.00且保持良性效用。

    5. 有什么可以进一步探索的点?

      作者指出了码本覆盖、模型规模、缺乏防御方案等局限,后续可在感知Hessian的等价类与大模型扩展上探索。

    6. 总结一下论文的主要内容

      论文研究了智能体量化条件后门风险,提出AGENTQ在保持效用的同时实现全精度隐蔽与量化后生效。

    完整解读
  15. 防御arXiv:2609.35932 · 57

    同字节不同权限:保留 token 表示如何放大聊天模板提示注入

    研究者在固定字节下评测对话模板注入,发现去除保留词元使Llama-3.1等模型ASR降低39-66个百分点,权威性源于单个向量。

    • +58.2 ppLlama-3.1-8B在InjecAgent直接危害上的标识差距Δ(Table 2)
    • +65.5 ppGLM-4.5在InjecAgent数据窃取上的标识差距Δ(Table 2)
    • +49.8 ppQwen3-8B抑制思考块后直接危害标识差距Δ(Table 27)
    6 问速览研究探究对话模板提示注入的威力来源,聚焦保留控制词元的学得向量表示与模板文本语法的作用差异,并界定分词防御范畴。
    1. 这篇论文试图解决什么问题?

      研究探究对话模板提示注入的威力来源,聚焦保留控制词元的学得向量表示与模板文本语法的作用差异,并界定分词防御范畴。

    2. 有哪些相关研究?

      梳理了间接提示注入评测、对话模板伪造攻击、分词对抗扰动以及指令数据分离防御四类相关研究,指明本文固定字节解耦视角。

    3. 论文如何解决这个问题?

      通过固定字节下的保留与子词切分对比,引入词元数补偿对照定义标识差距,结合向量替换因果干预与来源感知分词器验证防御。

    4. 论文做了哪些实验?

      在两项基准上验证了保留词元向量的主导作用,揭示了思考推理的补偿效应、工具协议词元防御缺口及自适应嵌入搜索威胁。

    5. 有什么可以进一步探索的点?

      作者指出了开源自托管范围、工具调用解析判定标准与输入层干预三项局限,其实验覆盖了六个开源模型与两大评估基准。

    6. 总结一下论文的主要内容

      对话模板注入的权威性主要来自保留词元的学得向量而非文本语法,推理具有补偿作用,现有分词防御遗留工具协议漏洞。

    完整解读
已经到底了