跳到正文

从来源,看到研究的联系

让信息汇流,让研究相连。点选一条线索,看它从哪里来、通向哪些方向。

图中 6 条 · 本页 24 条 · 共 26 条动态论文会议论文
关系图可左右滑动,完整标题也在下方列表中
1 / 4
材料关系图:来源、新闻与研究、细分方向的桑基流图01来源202新闻与研究603细分与主体7来源:论文追踪论文追踪5 条材料来源:Anthropic Alignment ScienceAnthropicAlignment Scien…1 条材料论文:研究显示少样本微调可绕过安全层局部冻结与修复防御论文研究显示少样本微调可绕过安全层局部冻结与修复防御论文:上海交大等提出 trait-direction drift 机制与探针空间走廊正则,抑制蒸馏中的潜隐特质迁移论文2026-09-01上海交大等提出 trait-direction drift机制与探针空间走廊正则,抑制蒸馏中的潜隐…论文:TULIP:按输入定位层级的定向大模型遗忘方法论文2026-09-28TULIP:按输入定位层级的定向大模型遗忘方法论文:SafeEvolve:基于智能体经验的 Harness-Policy 协同演化安全对齐框架论文2026-09-02SafeEvolve:基于智能体经验的 Harness-Policy 协同演化安全对齐框架论文:Intent-Privilege OPSD:让视觉语言模型在隐式风险下兼顾安全与有用论文2026-09-29Intent-Privilege OPSD:让视觉语言模型在隐式风险下兼顾安全与有用会议论文:AE Studio 与 Anthropic 提出 GRAM:用模块化预训练隔离危险知识的初步研究会议论文2026AE Studio 与 Anthropic 提出 GRAM:用模块化预训练隔离危险知识的初步研究方向:其他方向其他方向4方向:阿里巴巴 · Qwen阿里巴巴 ·Qwen2方向:开源模型安全开源模型安全3方向:对齐对齐6方向:防御与护栏防御与护栏4方向:Agent 安全Agent 安全1方向:AnthropicAnthropic1
流带宽度表示材料数量,多标签均分;连线表示来源与分类归属。4 个较少出现的方向归入「其他方向」,点选可查看。

点选节点,展开一条线索

查看材料的摘要与原文,或探索同一来源、同一方向下的内容。

本页材料

完整标题与摘要 · 24 条
  • 论文论文追踪

    研究显示少样本微调可绕过安全层局部冻结与修复防御

    研究者测试了针对少样本有害微调的安全层定位与修复防御能否在攻击变化后继续生效。在来自四个模型家族的六个检查点上,攻击后有害与良性提示仍线性可分,把完整干净隐状态打补丁进受损模型可在可复现的过渡深度恢复拒答。但按该深度冻结所有层后重做攻击,在一百条有害样本下六个检查点拒答率仍接近零,恢复过渡出现在冻结边界之上。第二项研究中,移除更新最大的两个奇异方向可在四个检查点的短时仅注意力微调后恢复拒答;在 Llama-3.1-8B 上,常规训练变化会削弱这种修复,攻击者分散更新即可将其击败,而在良性 Llama 微调上校准的谱检测器漏掉了该检查点上的多数修复失败。作者据此提出针对自适应微调防御的五项检查,代码已公开。

  • 论文论文追踪

    上海交大等提出 trait-direction drift 机制与探针空间走廊正则,抑制蒸馏中的潜隐特质迁移

    上海交通大学与上海人工智能实验室等机构的研究者提出 trait-direction drift 机制,解释模型蒸馏中潜隐学习如何发生:带偏置系统提示词的教师模型生成数字序列等语义干净的数据,其序列级偏好差距在期望上为正,学生可识别的差距在监督微调中累积成沿特质方向的漂移,进而产生行为迁移。基于该机制,作者提出探针空间走廊正则(probe-space corridor regularization),在蒸馏过程中约束沿校准特质方向的漂移。实验显示,该方法把恶意回复迁移率从 29.55% 降至 6.45%,主任务准确率损失很小,并在 Qwen 设置下持续抑制动物偏好迁移;Llama 设置中猫头鹰偏好从 17.8% 降至 0.6%。跨模型迁移在目标学生排序后仍明显弱于同模型设置,作者通过诊断与干预实验分析了这一衰减。

  • 论文论文追踪

    TULIP:按输入定位层级的定向大模型遗忘方法

    研究者提出 TULIP,一种按输入定位层级的表示层遗忘方法,用于从大语言模型中移除指定知识。作者先做劫持实验,把目标模型的隐藏状态移植到只在保留集上训练的 oracle 中,oracle 本身无法生成遗忘答案,却能依据移植状态输出该答案,说明答案在中间层形成、之后只是被读出,遗忘应针对形成环节而非读出环节,且形成结束的层在不同输入间差异很大。TULIP 对每个输入用 logit lens 定位形成与读出的边界,在该处移除隐藏状态与遗忘答案 unembedding 向量的对齐。在 TOFU、PISTOL 和 WMDP 上,TULIP 在 Llama、Qwen 和 Zephyr 模型上持续优于输出层和表示层基线,并对改写和量化攻击保持稳健;其逐输入层选择还可作为即插即用组件提升现有方法。

  • 论文论文追踪

    SafeEvolve:基于智能体经验的 Harness-Policy 协同演化安全对齐框架

    SafeEvolve 是一个经验驱动的智能体安全对齐自演化框架,通过已完成 on-policy 轨迹中的安全经验驱动 harness 与 policy 的持续协同演化。harness 侧将轨迹级安全证据转化为安全提示词与分层技能的有界组件级更新,policy 侧采用两阶段 SFT-RL 范式,用 harness 增强的 RL 与验证器分解奖励塑造多步探索中的自主安全行为。在 Qwen3.5-4B 上,SafeEvolve 在 AgentDojo 实现 ASR 降低 3 倍,同时将良性效用从 59.79% 提升至 61.86%。

  • 论文论文追踪

    Intent-Privilege OPSD:让视觉语言模型在隐式风险下兼顾安全与有用

    针对视觉语言模型(VLM)跨模态隐式风险,研究者提出 Intent-Privilege On-Policy Self-Distillation(OPSD),用基于证据的意图作为训练期特权监督,把教师的意图条件偏好蒸馏给学生,每个提示词只需一次 rollout,推理时无需意图标注或额外安全模块。该方法仅用 1,447 条安全样本(比标准偏好数据集少 95%),训练时间较多次 rollout 的 GRPO 式训练减少 5 倍,平均推理长度降低 7%。在全部五个评测组中,OPSD 取得最高的安全-有用联合成功率,在 SIUO+HoliSafe 合并集上从 43.9% 升至 53.5%。

  • 会议论文Anthropic Alignment ScienceICML 2026

    AE Studio 与 Anthropic 提出 GRAM:用模块化预训练隔离危险知识的初步研究

    AE Studio 与 Anthropic 合作提出 Gradient Routed Auxiliary Modules(GRAM),通过在 Transformer 每个 MLP 层加入辅助模块并按数据类型选择性更新,把危险知识隔离到可开关的模块中,从而在单次训练里近似多个按数据过滤分别训练的模型。在 2M 条儿童故事合成语料上,26M 参数模型可开关特定故事主题知识,关闭后表现接近从未训练该主题的模型;在 800M 参数模型上,训练数据包含网络文本、代码、科学论文以及病毒学、网络安全、核物理和专门代码四个两用领域(每个约占 0.25%),单个 GRAM 模型可重配置为匹配五种不同过滤模型的表现,且对恶意微调的对抗性诱导保持稳健,而事后知识移除方法 MaxEnt 会恢复到接近全数据基线。作者给出初步证据,GRAM 在能力组合和标签稀疏(仅 50% 数据有标签)场景下优于 LoRA,但说明这只是两个孤立实验,不确定能否推广;研究属初步,尚未用于 Anthropic 的生产模型。

  • 论文arXiv

    修正而非删除:用纠正性监督缓解涌现性失准

    研究者在 Qwen2.5-14B-Instruct 上微调混合了不良医疗建议与良性对话数据,发现把预先选定的四分之一投毒样本替换为同一提示的纠正答案,可将涌现性失准(EM)率降低约三分之一,并改善留出医疗问题的回答,而删除同样这些样本几乎没有可测效果。修正一半投毒样本时优势更大,且在第二个基座模型和第二个失准模型上同样成立。替换内容本身似乎重要:保留不良建议的改写没有明显收益,而数据集中自带的正确答案与作者改写器的效果相当。在已中毒模型上继续微调时,用纠正样本做短轮训练优于等量通用对话数据,对其他医疗提示的纠正与对投毒提示本身的纠正效果相近,要求改写者模仿谨慎、避免伤害的助手也没有额外收益。

  • 论文arXiv

    研究提出 Safety Operator:用谱优化调节安全指令的表达强度

    论文研究 Transformer 语言模型中上下文 token 被吸收进权重后形成的乘性算子,并证明影响其主特征值可以调节安全指令对生成的影响强度。作者据此推导出带抑制权重的对比安全损失,在有害查询上强化安全指令、在无害查询上抑制它。改变抑制权重可刻画攻击成功率与过度拒答率之间的关系,支持算子特征值充当指令影响力的连续调节旋钮这一假设。该关系在安全损失参数化方式不同时仍相对成立,在合适的抑制权重下可得到帕累托改进的安全指令。

  • 论文arXiv

    VaccineBooster:面向有害微调对齐的混合扰动防御

    VaccineBooster 将嵌入向量扰动与权重级梯度衰减合并进单次对齐训练步骤,用于抵御微调即服务中的有害微调攻击。在 Llama-2-7B 上经 BeaverTails 对齐并遭投毒微调攻击后,其 OpenAI moderation 得分为 0.315,为所比较防御中最低;仅用 Booster 的变体则保持最高 50% 的攻击后拒答率。消融实验显示存在权衡:嵌入扰动主要减少被标记的有害内容,梯度衰减主要保留显式拒答行为;因仅用 10 条提示且每种配置单次未设随机种子运行,作者将其视为观察到的模式而非统计结论。

  • 论文arXiv

    FDCU:用双重约束子空间投影抵御机器遗忘后的重训练攻击

    研究提出 FDCU,一种双重约束子空间投影框架,用于解决大语言模型机器遗忘后经良性微调即可恢复有害行为的重训练攻击问题。作者分析遗忘的优化动态后认为,脆弱性来自浅层对齐:模型并未真正擦除目标知识,而是激活原本休眠的参数充当伪抑制器,在完整的恶意表征外形成脆弱的抑制外壳。FDCU 通过逐元素双重掩码规则限制参数更新,用 Fisher Information 保留通用知识流形,并用最小功能干预原则(PMFI)禁止伪抑制器异常激活。在特定知识擦除与安全输出控制任务上,FDCU 在保持近乎无损通用能力的同时,取得了对重训练攻击的 state-of-the-art 鲁棒性。

  • 论文arXiv:可解释性

    CAM-Steer:面向大语言模型的多类别自适应安全引导框架

    研究者提出 CAM-Steer,一个类别自适应的多类别安全引导框架,用于在推理阶段修改模型内部激活而不更新参数,从而降低有害提示的不安全回复。该方法通过比较当前隐藏状态与安全、不安全原型来估计各危害类别的风险,再据此把不同类别的安全方向组合成单一引导方向并确定干预强度,最后沿该方向旋转隐藏状态,旋转角度由风险估计决定,同时保持隐藏状态范数不变。在三个 LLM 基座和七个危害类别上的实验显示,CAM-Steer 在平均防御成功率上优于所评估的基线,包括多个类别同时出现的情形,且推理开销可忽略。

  • 论文arXiv:越狱、提示注入、投毒与防御

    用 cunning questions 训练 LLM 警觉性,将九组模型基准平均 ASR 从 17.40% 降至 15.05%

    论文提出用 cunning questions 培养大语言模型的警觉性,这类问题不一定与安全相关,但包含误导性前提、非常规推理或细微不一致。作者假设学会识破这类推理陷阱可以迁移到安全关键场景。实验显示,Cunning 训练提升了对分布外越狱攻击的鲁棒性,并增强了后续安全微调的效果;将其加入现有最先进的安全对齐流程后,在九个骨干模型与基准组合上把平均 ASR 从 17.40% 降至 15.05%。匹配安全微调后的轨迹分析表明,安全判断更可能在有害规划开始前主导模型响应。论文还给出条件性理论分析,刻画从 cunning 数据学到的不变性何时能迁移到安全相关输入。

  • 论文arXiv:对齐、欺骗与监督

    BenchShield:面向 LLM Agent 评测基础设施的奖励完整性形式化插桩

    论文提出 BenchShield,一个以形式化模型为支撑的插桩层,用于保障 LLM Agent 评测中的奖励完整性。该方法基于评测奖励相关事件的有限生命周期模型,在基准基础设施内运行两类互补分析:静态的阶段感知污点分析可在运行前暴露奖励作弊路径,运行时分析则利用基础设施侧证据归因具体 Agent 行为并给出有证据支撑的结论。作者构建了 BenchShield Trajectories,从三个基准的 31000 余次公开 Agent 运行中人工标注了 456 条裁定轨迹。

  • 论文arXiv:对齐、欺骗与监督

    Provisional Reachability:用可撤销的每次跨越限制 Agent

    论文提出一种把 Agent 每次跨越都置于托管窗口、按概率 r 独立审计并在发现问题时撤销窗口的机制,用于限制信息泄露。作者推导出对手跨越 k 次、每次携带 c 比特时的期望泄露上界 L(r) ~ c/(er),该上界是对手选择上的上确界,因此方案可以公开,模拟结果与公式相差 7.7 个标准误。作者指出托管本身只是速率限制而非总量限制,秘密仍可能在每次运行中拼装完成;若被托管比特每期以比例 mu 衰减,持有量会收敛到 g/mu,当 mu > g/L 时 L 比特的秘密不可达,在 20,000 个窗口的模拟中 0.9mu* 时 100% 运行完成拼装、2mu* 时 0%。

  • 论文arXiv

    通过表征对齐缓解苏格拉底式导师中的脚手架崩塌

    针对 LLM 苏格拉底式导师在持续学生压力下逐渐放弃引导式提问、直接给出答案的"脚手架崩塌"问题,研究者提出 Scaffold-Preserving Representation Alignment 两阶段框架:先用监督微调预热,再结合轨迹加权直接偏好优化与锚定冻结参考状态的间隔保持表征损失。在 Qwen3-8B 上跨五个 STEM 学科和五种红队攻击策略评测,该方法将崩塌率降至 32%,平均崩塌起始延迟至九轮以上,并保持较低过度拒答。

  • 论文arXiv:对齐、欺骗与监督

    SURE:构建可信 AI 的安全框架

    研究提出 SURE(A Safe and Unified AI Framework foR Everyone)框架,用于按国家、文化和企业政策定制 AI 安全属性并加以保障。该框架建立对抗性提示词分类体系并据此构造提示词,定义理想 AI 回复模板与绝对安全评分方案,再通过数据集进行 AI 对齐。在多种基座模型上的实验验证了 SURE 的有效性,论文已被 KDD 2025 EAI Workshop 接收。

  • 动态arXiv:越狱、提示注入、投毒与防御

    ACTR:对齐推理链与回答以提升推理大模型的多语言安全

    研究者提出 ACTR 框架,通过强化推理大模型已有的安全推理来提升多语言安全对齐。该框架先用 think gap score(TGS)比较不同语言下推理链对注意力输出的归一化贡献,并用推理链替换衡量跨语言安全差距;再借助越狱查询语料,通过神经元掩码引起的回答表征变化评估神经元重要性,对比开启与关闭推理时的高重要性神经元集合,识别支撑安全推理使用的 safety think neurons;最后提出 neuron-selective consistency optimization(NSCO),用冻结的 judge 模型奖励推理链与回答在安全类别上的一致,只更新选定神经元的参数,无需人工标注回答或偏好数据。

  • 论文arXiv:越狱、提示注入、投毒与防御

    Constitutional adapters:用推理期干预防御越狱与失准

    研究提出 constitutional adapters(CAs),把符合宪法原则的行为从合成语料蒸馏进低秩适配器和 steering vector,训练中从未见过有害请求或越狱样本。用宪法训练对象减去对照训练对象后,越狱防御成功率和测得对齐度提升,在长上下文和多轮攻击下优于提示词与 steering 基线。CAs 可在基座模型上训练、零样本迁移到后训练 checkpoint,并在推理时缩放以在防御与良性合规之间可预测地权衡。作者将其定位为 API 部署中轻量、可移植、可调的干预手段,论文共 38 页、14 图、10 表。

  • 动态OpenAI Alignment Research

    OpenAI 分享在规模化代码验证上的实践方法

    OpenAI 介绍了为 gpt-5-codex 和 gpt-5.1-codex-max 训练专用智能体代码审查器的经验,将其作为深度防御策略中的输出监控手段。审查器获得仓库级工具和执行权限后,能发现更多关键问题并减少误报,专门针对代码审查的训练进一步提升效果。部署上优先保证信噪比,宁可适度降低召回率以换取开发者信任,并允许通过自定义任务指令或 AGENTS.md 调整这一取舍。数据显示,Codex 云完全生成的 PR 中有 36% 收到评论,其中 46% 促使作者修改代码,人工编写 PR 的评论修改比例为 53%;截至 2025 年 10 月,系统每天处理超过 10 万条外部 PR,超过 80% 的评论反馈为正面。

  • 动态Failure-First

    IHDec:用发散度引导对比解码维护多轮指令层级

    Liu 等人提出 IHDec,一种免训练、推理时的干预方法,通过实时 logit 调整维护大语言模型的指令层级(System ≻ User ≻ Assistant ≻ Data)。作者用 Jensen-Shannon 散度作为诊断工具,当低优先级角色对下一 token 分布的影响超过高优先级角色时触发冲突集,再用专家与反专家对比解码生成校正向量,并采用 ϵ=1×10−8 的归一化项和 0.97 的衰减因子保证稳定性。在 IHEval 基准上,IHDec 比训练式方法 ISE 提升 11.98 个百分点;在 Llama-3.1-8B-Instruct 的多轮冲突场景达到 50.68% 准确率,而 ISE 为 12.60%。

  • 动态Failure-First

    论文提出人工中央凹感知 AFP 缓解机器人基础模型中的捷径学习

    Sun 等人的论文提出人工中央凹感知(AFP),一种策略无关的轻量模块,用于在微调阶段约束机器人基础模型的视觉注意力,抑制捷径学习。作者认为现有 Vision-Language-Action(VLA)与 World Action Model(WAM)流程在新机器人场景中仍需任务特定微调,模型倾向依赖光照、背景纹理等非因果相关特征,在分布偏移下失效。

  • 论文arXiv:危险能力与安全评测

    DeShortcut-Align:解耦伪捷径以提升大推理模型安全对齐鲁棒性

    研究者提出 DeShortcut-Align 对齐框架,用于缓解大推理模型安全训练中出现的伪捷径问题。作者发现安全对齐后的模型常把拒答绑定到提示词模板(格式捷径)或敏感关键词(词汇捷径),导致过度拒答与通用能力下降。该方法通过拒答敏感性归因、归因引导的对比增强和反事实一致性正则三个阶段解耦这些捷径,在 7B 和 14B 模型上使模板剥离绕过攻击的性能下降最多减少 72%,过度拒答降低超过 58%。

  • 动态DeepMind Safety Research

    DeepMind 提出一致性训练,可限制谄媚与越狱

    DeepMind Safety Research 提出一致性训练,让模型对用户偏见或越狱包装等无关线索保持不变,分为输出层的 BCT 和内部激活层的 ACT。在 Gemini 2.5 Flash 上,BCT 将 ClearHarm 上的攻击成功率从 67.8% 降至 2.9%,ACT 降低越狱的效果较弱但几乎不增加对良性请求的拒答。

  • 论文arXiv:越狱、提示注入、投毒与防御

    ACTR:对齐推理与回答以提升推理大语言模型的多语言安全

    研究者提出 ACTR 框架,通过强化推理大语言模型已有的安全推理来提升多语言安全对齐。方法先用 think gap score(TGS)比较不同语言下推理痕迹对注意力输出的归一化贡献,并用推理痕迹替换衡量跨语言安全差距;再用越狱查询语料,通过神经元掩码引起的回答表示变化评估神经元重要性,对比开启与关闭推理时的高重要性神经元集合,识别支撑安全推理的安全 think 神经元;最后提出 neuron-selective consistency optimization(NSCO),用冻结的评判模型奖励推理痕迹与回答在安全类别上的一致,只更新选定神经元相关参数,无需人工标注回答或偏好数据。