全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 论文arXiv:危险能力与安全评测
研究者提出读取路由 logits 的 MoE 视觉语言模型多模态安全检测器
研究者提出一种轻量级路由 logits 安全检测器,在提示词预填充阶段读取 MoE 视觉语言模型的专家路由信号,在生成前判断多模态请求是否安全,且不修改模型参数或专家路由。作者发现路由 logits 对多模态输入是否安全具有很高的预测性。在 Qwen3-VL 和 Kimi-VL 上,该检测器显著降低了 HoliSafe 基准上的安全错误,并泛化到安全模式不同的分布外基准 MISHard 和 MM-SafetyBench。作者认为,相比通过提示、监督微调或路由专家引导来干预模型行为与内部状态,直接读取自然涌现的信号并接入外部安全机制,可作为现有安全干预的简单、有效且非侵入式的补充。
- 论文arXiv
AVCE:面向扩散模型可验证概念擦除的审计感知遗忘框架
研究者提出 AVCE(Auditing-Aware Unlearning for Verifiable Concept Erasure in Diffusion Models),一种把概念擦除落到模型潜空间表征的遗忘框架。作者指出,多数擦除方法只在文本接口干预,通过提示词修改或文本条件权重的局部更新实现,并以给定提示词下的输出作为评估依据,而潜空间审计绕过文本条件直接探测去噪网络,显示被擦除概念仍可从内部表征中恢复,这一问题在抗对抗提示词的方法中同样存在,且随擦除概念数量增加而加剧。AVCE 审计每个概念的嵌入向量邻域,将发现的脆弱方向压缩为最弱几何点上的锚点,在该锚点以闭式解编辑交叉注意力和自注意力投影,再用路径级审计损失微调两条路径,并通过正交梯度投影整合多个概念。
- 论文arXiv
RMCW:基于 Reed-Muller 码的抗删除 LLM 水印方法
研究者提出 RMCW,一种基于 Reed-Muller 码的大语言模型水印方法,用于应对删除攻击导致的 token 位置偏移和水印对齐失效。生成阶段通过密钥化的词表划分把 Reed-Muller 结构注入文本序列;检测阶段将文本映射到密钥词表分箱,并用 Berlekamp-Welch 检验测试局部子序列的低次 Reed-Solomon 一致性,从而寻找存活的局部代数结构而非恢复全局码字。在 C4 和 ELI5 数据集、OPT-1.3B 与 Llama-3.1-8B-Instruct 上的实验显示,RMCW 保持较强的干净文本可检测性,并在多种删除与改写攻击下优于或持平基线方法。代码已开源于 https://github.com/BaichengDanny/RMCW。
- 论文论文追踪
上海交大等提出 trait-direction drift 机制与探针空间走廊正则,抑制蒸馏中的潜隐特质迁移
上海交通大学与上海人工智能实验室等机构的研究者提出 trait-direction drift 机制,解释模型蒸馏中潜隐学习如何发生:带偏置系统提示词的教师模型生成数字序列等语义干净的数据,其序列级偏好差距在期望上为正,学生可识别的差距在监督微调中累积成沿特质方向的漂移,进而产生行为迁移。基于该机制,作者提出探针空间走廊正则(probe-space corridor regularization),在蒸馏过程中约束沿校准特质方向的漂移。实验显示,该方法把恶意回复迁移率从 29.55% 降至 6.45%,主任务准确率损失很小,并在 Qwen 设置下持续抑制动物偏好迁移;Llama 设置中猫头鹰偏好从 17.8% 降至 0.6%。跨模型迁移在目标学生排序后仍明显弱于同模型设置,作者通过诊断与干预实验分析了这一衰减。
- 论文论文追踪
AMS 工具通过激活分析检测语言模型的安全训练改动
研究者提出 AMS(Activation-based Model Scanner),通过测量激活空间中安全相关概念的几何结构来检测语言模型的安全训练改动。安全训练会在有害与良性内容类别间形成可测量的分离,部分安全改动会破坏或旋转这一结构,另一些则保持不变。作者在 Llama、Gemma、Qwen、Mistral 四个架构家族、14 个模型配置和四类安全改动(指令微调、基座、abliterated、无审查微调)上验证 AMS,阈值留一交叉验证准确率为 71%(10/14),sigma 点估计的 bootstrap 95% 置信区间中位宽度为 3.4 sigma。在每模型 20 条分层 JailbreakBench 提示上的行为合规测试显示,有害内容概念的 sigma 可预测合规程度,Pearson r = -0.546(p = 0.043),方向一致但噪声明显。
- 论文论文追踪
TULIP:按输入定位层级的定向大模型遗忘方法
研究者提出 TULIP,一种按输入定位层级的表示层遗忘方法,用于从大语言模型中移除指定知识。作者先做劫持实验,把目标模型的隐藏状态移植到只在保留集上训练的 oracle 中,oracle 本身无法生成遗忘答案,却能依据移植状态输出该答案,说明答案在中间层形成、之后只是被读出,遗忘应针对形成环节而非读出环节,且形成结束的层在不同输入间差异很大。TULIP 对每个输入用 logit lens 定位形成与读出的边界,在该处移除隐藏状态与遗忘答案 unembedding 向量的对齐。在 TOFU、PISTOL 和 WMDP 上,TULIP 在 Llama、Qwen 和 Zephyr 模型上持续优于输出层和表示层基线,并对改写和量化攻击保持稳健;其逐输入层选择还可作为即插即用组件提升现有方法。
- 论文论文追踪
SecOPD 用同策略蒸馏把自适应提示注入攻击成功率降至 9.0%
加州大学伯克利分校研究者提出 SecOPD,用同策略蒸馏为防御微调提供 token 级反馈,替代 DPO、GRPO 等序列级信号。训练时学生模型在含注入的输入上生成 rollout,冻结的初始化模型在去掉注入的干净输入上为同一批 token 打分,与可信任务一致的 token 被鼓励、跟随注入的 token 被抑制。在 Qwen3.6-27B 上,面对 SoTA 自适应攻击 PISmith,SecOPD 的攻击成功率为 9.0%,此前 SoTA 的 Meta-SecAlign 为 94.0%,GRPO 为 61.2%;静态 SEP 攻击下 SecOPD 为 1.3%。在训练未见的 AgentDojo 工具调用场景,SecOPD 为 4.7%,Meta-SecAlign 为 5.5%,GRPO 为 0.7% 但效用降至 82.5%。代码与模型已开源。
- 论文论文追踪
SingProbe 发布开源内在护栏框架,适配 29 个开源模型
SingProbe 是一个面向 LLM 生成时监控的开源内在护栏框架,复用基座模型自回归解码中已产生的隐藏状态,而不是让独立模型反复处理生成文本。它用轻量探针在解码过程中持续输出查询意图、回复安全和幻觉风险信号,报告给出了训练方法、与 SGLang 和 vLLM 的服务集成,以及覆盖不同家族和规模的 29 个开源基座模型的适配护栏。团队同时提出 SingStreamBench,用于衡量流式护栏能否在良性前缀上保持静默并及时发现新出现的不安全内容。在安全、流式检测、幻觉检测、误报鲁棒性、在线监控和运行时开销等评测中,SingProbe 的表现与最先进的独立护栏和专用幻觉检测器相当,在若干设置下更强,实现中增加的服务开销低于 0.5%。除被动监控外,内在护栏信号还可引导受限解码,并在 SingProbe-Med 中选择性触发医疗风险干预。
- 论文论文追踪
ClawSentry:面向自主 LLM Agent 的渐进式多层安全监控网关
研究者提出开源、框架无关的 Agent 运行时安全监督网关 ClawSentry,用于拦截被恶意第三方技能劫持的 Agent 行为。该方法把 Agent 风险分为技能准入、调用意图、执行效果和事后后果四个环节:执行前由 First-use Skill Package Review(FSPR)在确定性证据下限下审查技能包,未决案例升级到有界只读的 Agent 审查;运行时采用确定性 L1、规则锚定 L2 语义审查和只读 L3 取证 Agent 的三层渐进决策引擎,只对残余歧义投入上下文审查,并用会话级反绕过机制识别换工具与改写重试。事后路径将高严重度证据非回溯地送入后续审查。通过 Agent Harness Protocol(AHP)抽象,同一策略可应用于 Codex、Claude Code、Kimi CLI 和 Gemini CLI,无需修改 Agent 内部。
- 会议论文Anthropic Alignment ScienceICML 2026
AE Studio 与 Anthropic 提出 GRAM:用模块化预训练隔离危险知识的初步研究
AE Studio 与 Anthropic 合作提出 Gradient Routed Auxiliary Modules(GRAM),通过在 Transformer 每个 MLP 层加入辅助模块并按数据类型选择性更新,把危险知识隔离到可开关的模块中,从而在单次训练里近似多个按数据过滤分别训练的模型。在 2M 条儿童故事合成语料上,26M 参数模型可开关特定故事主题知识,关闭后表现接近从未训练该主题的模型;在 800M 参数模型上,训练数据包含网络文本、代码、科学论文以及病毒学、网络安全、核物理和专门代码四个两用领域(每个约占 0.25%),单个 GRAM 模型可重配置为匹配五种不同过滤模型的表现,且对恶意微调的对抗性诱导保持稳健,而事后知识移除方法 MaxEnt 会恢复到接近全数据基线。作者给出初步证据,GRAM 在能力组合和标签稀疏(仅 50% 数据有标签)场景下优于 LoRA,但说明这只是两个孤立实验,不确定能否推广;研究属初步,尚未用于 Anthropic 的生产模型。
- 动态Mistral AI
Mistral 发布 Shieldstral:3B 开源多模态安全分类器
Mistral 发布 Shieldstral,一个 3B 开源权重多模态安全分类器,把内容审核建模为策略自适应的问答任务,在推理时接受自然语言政策而无需重新训练。模型每次请求由 <Instruct> 评估上下文与严格度、<Query> 单个是非问题、<Document> 待判定内容三部分组成,只读取 yes 和 no 两个 token 的 logits 并做 softmax 归一化,输出连续安全分数。Mistral 称其在文本安全、拒答检测、策略适应性和多模态基准上匹配或超过最多 7 倍于其规模的开放护栏模型,可在单张 16GB NVIDIA GPU 上运行,以 Apache 2.0 许可开放权重。训练上统一异构数据集的标签体系,用对比式改写让模型区分相近政策,并用视觉语言重排器过滤图像数据,最后通过 LoRA 微调与 SLERP 合并多个 checkpoint。
- 论文arXiv:后门、投毒与隐私
研究者提出用零空间投影净化 LoRA 微调 LLM 的后门
研究者提出一种针对 LoRA 微调大语言模型的后门净化方法,通过零空间投影将攻击成功率从接近 100% 降至 10% 以下。该方法不依赖触发器先验知识、干净参考模型或对可疑参数的重新训练,而是通过数据整理与特征近似提取高保真后门方向,在每一层或每个注意力头的输入与输出通道上构造正交零空间,再将 LoRA 更新投影到该空间。作者通过一系列消融实验,将方法从文本分类的单层设置逐步扩展到生成任务的全参数 LLM,并称在降低攻击成功率的同时保留了基座模型的通用能力和适配器学到的下游技能。
- 论文arXiv:后门、投毒与隐私
NEEDLE:通过权重正交化移除 LLM 后门
研究者提出 NEEDLE,一种免训练的后门定向移除方法。该方法在识别出触发词后,通过激活向量估计后门方向和拒答子空间,再依次施加权重正交化,在压制后门的同时避免改变与拒答相关的表征。NEEDLE 不需要干净参考模型,也不需要原始被投毒的训练数据。在多个模型族和多种攻击类型上的评测中,NEEDLE 取得所评估防御方法中最低的平均攻击成功率,在代码注入类攻击上为 0%,同时 KL 散度最低,能力与安全性的变化也最小。
- 论文arXiv:对齐、欺骗与监督
AuraForge:为训练安全编码 Agent 扩展安全监督
AuraForge 通过合成并验证可执行的安全测试,为训练安全编码 Agent 提供可扩展的安全监督。该方法结合面向攻击的测试合成、可扩展语言的任务构建以及针对奖励作弊的防护。基于此构建的 AuraGym 覆盖 Python、JavaScript 和 TypeScript,包含来自 344 个真实仓库的 679 个可执行功能实现任务,涉及 177 个 CWE 类别。在带有人工安全测试的子集上,AuraForge 平均生成约 3 倍的测试用例,并将误报率降低 83.23%。用合成安全测试训练 Qwen3.5-4B,在三种语言上的提升大于人工安全测试(平均 19.7 FuncPass 和 6.2 SecPass,对比 14.9 FuncPass 和 4.4 SecPass)。
- 论文arXiv:防御、护栏、反学习与有害微调
研究者提出 COVER:在语言预算下选择源语言实现跨语言遗忘
研究指出在一种语言中遗忘某个事实并不能保证它在其他语言中也被移除,改变提问语言或要求回答的语言就能重新调出看似已遗忘的知识,形成跨语言漏洞。为此作者提出语言预算多语言遗忘任务,即选择一组语言子集以最大化跨语言擦除效果,并构建了覆盖 174 个语言-文字对、25 种原子改写类型的 Cross-Lingual Unlearning Tensor 基准。他们进一步提出 COVER,通过选择源语言来最大化对未接受遗忘监督语言的预测覆盖。实验发现,简单挑选单个强源语言并不能可靠组合成强源语言集合。在部署阶段,COVER 只需良性校准数据和访问冻结模型;在三个模型家族和两个不相交遗忘集上,COVER 相比均匀源选择将平均留出残留访问降低 7.8%–27.3%,并在低资源语言场景下用 LORELEI 语料的人工翻译数据验证了效果可扩展到真实新闻文档。
- 论文arXiv:防御、护栏、反学习与有害微调
ShieldCLIP:面向多模态基础模型有害内容的选择性安全对齐
研究提出 ShieldCLIP,首个按每个模态自身安全状态而非样本来源来条件化安全对齐的框架,在保留安全内容的同时只重定向不安全部分。作者同时发布 ViSUv2 数据集,包含 195k 四元组、覆盖 578 个概念和 28 个类别,并为每个模态提供独立安全标签。基于这些标签,ShieldCLIP 定义了四路条件目标:安全内容锚定,不安全模态重定向到对应安全版本,混合样本只更新不安全分支,双模态均不安全时强制一致性。在跨模态检索、Stable Diffusion v1.4 与 SDXL 的文生图以及 LLaVA 的图生文任务上,ShieldCLIP 相比此前的安全对齐编码器和强缓解基线持续减少有害输出,同时保留原始嵌入空间的效用。消融实验显示模态特定监督与选择性对齐目标均有贡献。
- 论文arXiv
FDCU:用双重约束子空间投影抵御机器遗忘后的重训练攻击
研究提出 FDCU,一种双重约束子空间投影框架,用于解决大语言模型机器遗忘后经良性微调即可恢复有害行为的重训练攻击问题。作者分析遗忘的优化动态后认为,脆弱性来自浅层对齐:模型并未真正擦除目标知识,而是激活原本休眠的参数充当伪抑制器,在完整的恶意表征外形成脆弱的抑制外壳。FDCU 通过逐元素双重掩码规则限制参数更新,用 Fisher Information 保留通用知识流形,并用最小功能干预原则(PMFI)禁止伪抑制器异常激活。在特定知识擦除与安全输出控制任务上,FDCU 在保持近乎无损通用能力的同时,取得了对重训练攻击的 state-of-the-art 鲁棒性。
- 论文论文追踪
SynthIDBio:为 AI 生成的蛋白质序列与结构嵌入保功能水印
Google DeepMind 团队提出 SynthIDBio,把水印直接嵌入 AI 生成的蛋白质序列与结构,同时保持其生物学功能。SynthIDBio-sequence 将 SynthID-text 的锦标赛采样接入 ProteinMPNN,并增加基于 g 值的过滤以保证可检测性;体外实验显示,针对 SC2RBD、VEGF-A 和 PD-L1 的水印结合蛋白在结合亲和力分布和命中率上与未加水印设计无显著差异,其中 SC2RBD 达到低纳摩尔级、VEGF-A 与 PD-L1 达到亚纳摩尔级。SynthIDBio-structure 则微调 AlphaFold 3 的扩散模块并联合训练一个受 PointNet 启发的检测器,在 AF3 评测集上以 0.1% 假阳性率取得超过 99.8% 的真阳性率,且 LDDT 与模板建模分数不下降。
- 论文arXiv
Llama 3 模型群:405B 稠密 Transformer 与 Llama Guard 3 安全模型
Meta 发布 Llama 3 模型群,最大模型为 405B 参数的稠密 Transformer,上下文窗口最高 128K tokens,原生支持多语言、编程、推理与工具使用。评测显示其在大量任务上质量与 GPT-4 相当,并公开释出 405B 的预训练与后训练版本及输入输出安全模型 Llama Guard 3。论文还通过组合式方法将图像、视频和语音能力接入 Llama 3,在识别任务上表现与 SOTA 相当,但这些多模态模型仍在开发中,尚未广泛发布。
- 论文arXiv:可解释性
GUARD:在 CosyVoice2 上做说话人身份遗忘以阻止重识别
研究提出 GUARD,一个轻量级说话人身份遗忘框架,在冻结的 TTS 主干上结合学习到的说话人门控与说话人无关的激活引导,引导向量用组相对奖励优化,把遗忘说话人的输出推向群体层面的冒充者相似度,同时保持可懂度与语音自然度。在 CosyVoice2 上,GUARD 将遗忘说话人相似度从 0.541 降到 0.103,在 150 名说话人库中的重识别准确率从 73.5% 降到 0.5%,并保留了对保留说话人的复现能力。作者指出,仅看相似度下降不足以刻画说话人身份遗忘是否成功,重识别应作为补充评估标准。
- 论文arXiv:越狱、提示注入、投毒与防御
SEAL:通过共享专家对齐强化 MoE 全局安全
论文提出 SEAL,一种训练期参数高效防御方法,通过在 MoE 的共享专家上附加即插即用适配器来提升全局安全对齐。作者指出,MoE 的安全依赖稀疏路由激活了哪些专家,攻击者可通过越狱提示、恶意微调和剪除安全关键神经元来颠覆这一选择,而现有防御多聚焦加固路由器,仍可能被非确定性的路由轨迹绕过。SEAL 利用始终激活的共享专家作为与路由无关的锚点,其变体 SEAL++ 在训练中加入正交约束以保留已有安全子空间。在三种对抗输入(有害提示、越狱、恶意微调)与是否剪枝神经元组合成的六类攻击场景中,SEAL 将攻击成功率最多降低 60%,在五项基准平均上的能力损失最多 1.4%,并可无缝集成路由器级防御。
- 论文arXiv:越狱、提示注入、投毒与防御
AlcaTRAz:无需模型权重的规则树提示级越狱防御
AlcaTRAz 是一种基于规则树的提示级越狱防御,只作用于输入文本,不需要访问模型权重或内部结构,也无需修改或重训练目标模型。该方法自动学习一条可迁移的变换规则,在选定位置插入受控的字符级扰动,破坏越狱攻击所利用的结构规律,同时尽量保持模型对正常问题的表现。
- 论文arXiv:对齐、欺骗与监督
Odin:面向隐私保护 Llama 3 8B 推理的开源端到端 FHE 实现
Odin 是首个开源的端到端 GPU CKKS 实现,可在加密状态下完成 Llama-3-8B 推理。它通过 feature-major 跨层布局统一残差连接与层接口,并为线性投影和注意力构建临时算子内布局,减少权重的冗余明文编码;注意力中 QK^T 的分数可直接被 Softmax 消费,PV 直接消费概率,避免中间重打包;非线性运算采用带输入范围控制的 minimax 多项式近似与联合误差分配。在单张 NVIDIA H100 80 GB GPU 上,输入 128 token 时评估全部 32 层耗时 366.4 s、峰值显存 58.9 GiB,相比 THOR 的 1651.9 s 提速 4.51 倍。
- 论文arXiv:对齐、欺骗与监督
基于硬件 PUF 指纹的知识蒸馏设备级溯源框架
针对知识蒸馏中教师模型易被窃取且现有水印或硬件访问控制难以定位泄露设备的问题,研究者提出一种将设备专属 PUF 签名叠加到教师 logits 上的指纹框架,使经知识蒸馏训练的学生模型继承与硬件绑定的唯一身份。该方案在 Xilinx Zynq-7020 FPGA 上测量环形振荡器(RO)PUF 生成签名,架构无关,可跨 CNN、Vision Transformer 和编码器继承身份,并通过神经解码器与汉明距离精修的两阶段恢复流程在噪声条件下保持高检测准确率,另引入多级 logit 编码支持大规模设备部署。实验显示嵌入指纹能抵抗常见的蒸馏后修改。