分析与理论arXiv 2610.02886
研究揭示无触发投毒审计缺口:事实答对不等于决策正确
揭示无触发虚假训练下事实回答与下游决策的审计差距
- arXiv
- 2610.02886
- 发表
- 场景
- 模型与 API
- 测试
- Qwen2.5-0.5B、Qwen2.5-1.5B、Qwen2.5-3B 等 9 个
- 攻击投毒与后门
摘要作者发现无触发词虚假训练下事实回答与下游决策存在脱节,直接审计与事实纠错均无法保证决策正确。
论文是一项针对语言模型在无触发词虚假信息训练下行为表现的实证分析研究。
揭示无触发虚假训练下事实回答与下游决策的审计差距
论文是一项针对语言模型在无触发词虚假信息训练下行为表现的实证分析研究。
测绘去安全开源模型的生产、重分发与下游应用留存机制
摘要论文测绘了去安全开源大模型供应链,作者指出高集中度的重分发层赋能模型持久留存与部署扩散。
用权重几何解释事后安全脆弱,并提出预训练持续安全共训练
摘要论文将后验安全脆弱性归因于正交抑制,并提出通过预训练持续共训练实现具备微调抗性的安全防护。
用 SAE 定位后门触发机制并分离检测与因果控制
作者用稀疏自编码器分解 Gaperon 中无害的语言切换后门,区分识别触发的特征与真正能抑制或诱发该行为的特征。固定触发使英语提示在 Gaperon-1B 与 8B 上续写成法语或德语。
证明预训练投毒的清洁超额风险指数随极限顺序变化
可解的预训练数据投毒理论:清洁超额风险的缩放指数随极限顺序改变。。