跳到正文

从来源,看到研究的联系

让信息汇流,让研究相连。点选一条线索,看它从哪里来、通向哪些方向。

图中 6 条 · 本页 24 条 · 共 38 条动态论文会议论文
关系图可左右滑动,完整标题也在下方列表中
1 / 4
材料关系图:来源、新闻与研究、细分方向的桑基流图01来源302新闻与研究603细分与主体7来源:论文追踪论文追踪3 条材料来源:0DIN0DIN2 条材料来源:arXivarXiv1 条材料论文:研究显示少样本微调可绕过安全层局部冻结与修复防御论文研究显示少样本微调可绕过安全层局部冻结与修复防御论文:论文:容器、权限规则与沙箱都无法区分读取研究代码的是编译器还是编码 Agent论文2026-09-28论文:容器、权限规则与沙箱都无法区分读取研究代码的是编译器还是编码 Agent论文:TC-UAP:针对图像转视频与微调定制的通用视频保护方法论文2026-07-14TC-UAP:针对图像转视频与微调定制的通用视频保护方法动态:Mozilla 0DIN 推出 0DIN AI Defense,首发 560M 参数 SusFactor 越狱检测模型动态2026-07-28Mozilla 0DIN 推出 0DIN AI Defense,首发 560M 参数 SusFactor 越狱检测模型动态:SusFactor:用真实威胁情报检测越狱与提示注入攻击动态2026-08-05SusFactor:用真实威胁情报检测越狱与提示注入攻击论文:研究提出 Safety Operator:用谱优化调节安全指令的表达强度论文2026-09-29研究提出 Safety Operator:用谱优化调节安全指令的表达强度方向:其他方向其他方向2方向:越狱与攻击越狱与攻击6方向:对齐对齐2方向:防御与护栏防御与护栏4方向:安全评测安全评测2方向:提示注入提示注入2方向:工具与开源工具与开源2
流带宽度表示材料数量,多标签均分;连线表示来源与分类归属。3 个较少出现的方向归入「其他方向」,点选可查看。

点选节点,展开一条线索

查看材料的摘要与原文,或探索同一来源、同一方向下的内容。

本页材料

完整标题与摘要 · 24 条
  • 论文论文追踪

    研究显示少样本微调可绕过安全层局部冻结与修复防御

    研究者测试了针对少样本有害微调的安全层定位与修复防御能否在攻击变化后继续生效。在来自四个模型家族的六个检查点上,攻击后有害与良性提示仍线性可分,把完整干净隐状态打补丁进受损模型可在可复现的过渡深度恢复拒答。但按该深度冻结所有层后重做攻击,在一百条有害样本下六个检查点拒答率仍接近零,恢复过渡出现在冻结边界之上。第二项研究中,移除更新最大的两个奇异方向可在四个检查点的短时仅注意力微调后恢复拒答;在 Llama-3.1-8B 上,常规训练变化会削弱这种修复,攻击者分散更新即可将其击败,而在良性 Llama 微调上校准的谱检测器漏掉了该检查点上的多数修复失败。作者据此提出针对自适应微调防御的五项检查,代码已公开。

  • 论文论文追踪

    论文:容器、权限规则与沙箱都无法区分读取研究代码的是编译器还是编码 Agent

    Shobhan Roy 的论文指出,基于物理的求解器必须让编译器读取某些模块,但同一批知识产权不应被编码 Agent 读取,而现有工具链并不自带这条规则。作者针对容器、权限规则和沙箱三种隔离手段,对十五条读取路径做了分类,结论是三者都无法判断究竟是哪个程序在读取文件。论文共 6 页,含 1 张图和 1 张表,随附分类与历史脚本及其输出,归入 cs.CR、cs.AI 与 cs.SE,编号 arXiv:2609.35557。

  • 论文论文追踪

    TC-UAP:针对图像转视频与微调定制的通用视频保护方法

    研究者提出 Temporally Consistent Universal Adversarial Perturbations(TC-UAP),用于保护视频免遭基于参考的图像转视频生成和基于微调的视频定制两类流程的滥用。该方法在多个视频的滑动窗口上优化身份级多帧通用对抗扰动,以应对视频 VAE 时序压缩、单视频扰动难以迁移以及时序不一致扰动易被时序攻击破坏三个挑战,并引入内在时序建模与外在代理时序攻击损失。实验显示,TC-UAP 在两类定制流程下的身份保护效果优于现有方法,且对多种未见过的时序攻击保持稳健。该工作为 ECCV 2026 LifeGenIP Challenge 提供基础。

  • 动态0DIN

    Mozilla 0DIN 推出 0DIN AI Defense,首发 560M 参数 SusFactor 越狱检测模型

    Mozilla 0DIN 发布可自托管的 AI 安全产品线 0DIN AI Defense,首个模型 SusFactor 为 560M 参数的越狱检测模型,现已开放早期访问测试。该模型基于 0DIN 漏洞赏金项目收集的真实攻击数据训练,可在本地廉价硬件上以低于 50ms 的延迟实时分析提示词。在 JailbreakBench 基准上,SusFactor 仅放过 12.1% 的攻击,误报率为 9.0%,低于 WildGuard 的 45%、Mistral 的 39% 和 Llama Guard 3 的 23%。

  • 动态0DIN

    SusFactor:用真实威胁情报检测越狱与提示注入攻击

    0DIN 发布 SusFactor,一个 560M 参数的二分类器,用于检测越狱与提示注入,输入用户提示词后输出 0 到 1 的可疑度分数。它在 JailbreakBench 上取得所评估分类器中最高的合并 AUROC 0.954,在 WildGuardTest 上 AUROC 0.878,与参数量为其 10 到 15 倍的生成式护栏相比具有竞争力。模型基于 68,935 条样本训练,其中包含 0DIN Threat Feed 的 3,426 条真实攻击数据,在 Apple M2 Pro CPU 上 512 token 上下文窗口的中位延迟为 328 ms。

  • 论文arXiv

    研究提出 Safety Operator:用谱优化调节安全指令的表达强度

    论文研究 Transformer 语言模型中上下文 token 被吸收进权重后形成的乘性算子,并证明影响其主特征值可以调节安全指令对生成的影响强度。作者据此推导出带抑制权重的对比安全损失,在有害查询上强化安全指令、在无害查询上抑制它。改变抑制权重可刻画攻击成功率与过度拒答率之间的关系,支持算子特征值充当指令影响力的连续调节旋钮这一假设。该关系在安全损失参数化方式不同时仍相对成立,在合适的抑制权重下可得到帕累托改进的安全指令。

  • 论文arXiv

    研究发现护栏模型在基座模型不确定处过度自信

    研究评估了五个护栏模型在提示分类任务上的表现,发现它们在干净输入上接近校准,但对抗攻击会让校准误差恶化一个数量级,把假阴性变成与正确检测难以区分的高置信度错误。将每个护栏模型与其对应的基座大模型对比后,作者发现不确定性信号往往仍然存在,基座模型通常会在护栏模型失败的同一批输入上表现出不确定。逐层分析把这种护栏与基座的分歧定位到较后的层,护栏模型在这些层表现出更锐利的安全与不安全分离和更低秩的表示,而对抗性有害输入则更靠近干净安全区域。研究指出,攻击条件下护栏模型的置信度与基座模型的不确定性之间存在错配。

  • 论文arXiv

    MOMAT:面向量化 LLM 低功耗越狱防御的多图集混合框架

    研究者提出 MOMAT(Mixture of Multiple Atlases),一种面向边缘设备上量化大语言模型的硬件增强安全框架,用于缓解量化削弱对齐防护后模型易被越狱攻击的问题。每个 atlas 对应有害或良性样本集与策略模板的语义聚类,实现领域局部化的 RAG 防护,以缓解大规模异构安全数据库中的维度灾难与语义稀疏问题。MOMAT 对每个提示词从所有 atlas 中检索 top-k 相似特征,交由轻量 MoE 检测器判断,并用 CiM 加速的相似度引擎完成低功耗图集内检索。其 CiM 检索将 100 条查询的批处理从 15,052.44 ms 加速到 3,207.21 ns,能耗从 8.1×10^7 μJ 降至 3.32 μJ,相比基于 DRAM 的 Raspberry Pi 基线约降低 2.5×10^5 倍能耗。

  • 动态Cisco

    思科 AI Defense 集成 Anthropic 推理钩子,为 Claude Enterprise 提供运行时防护

    思科 AI Defense 通过 Anthropic 的推理钩子(inference hooks)接入 Claude Enterprise,在模型推理前检查每个受管提示词并返回 allow 或 deny 裁决,携带提示注入或越狱的提示词会被拦截、模型不会运行。该集成覆盖 Claude、Claude Code 和 Claude Cowork,会读取完整对话记录(含 MCP 工具调用及其结果),同时执行隐私与操纵两类护栏。每次调用均用一次性签名密钥做加密验证,推理钩子目前处于 beta 阶段,响应侧执法需等 Anthropic 扩展该钩子。

  • 动态NIST

    NIST 数学证明:AI 护栏无法穷尽抵御对抗提示,需转向持续监控与更新

    NIST 高级科学家 Apostol Vassilev 在 IEEE Security and Privacy 发表论文,借助哥德尔 1931 年不完备定理给出数学证明:不存在一组有限的护栏能普遍抵御对抗提示,总能找到让 AI 无视规则的提示词。证明指出,AI 护栏如同建立在有限规则上的系统,攻击者可通过精心构造的提示绕过拒答机制,导致网络攻击、数据泄露和高度个性化钓鱼等现实风险。Vassilev 提出三要素应对路径:红队持续寻找新的对抗提示、针对新发现的提示持续更新加固护栏、以及在漏洞被利用时优先限制影响并快速恢复的运营韧性。他表示目标不是彻底解决问题,而是让攻击者寻找新漏洞的成本超过其资源,形成对攻击者经济上不可行的新平衡。论文题为 Robust AI Security and Alignment: A Sisyphean Endeavor?

  • 论文arXiv:越狱、提示注入、投毒与防御

    HiveTraceGuard-Pro:面向提示注入、越狱与对抗混淆的紧凑生成式护栏

    HiveTraceGuard-Pro 是一个从 Qwen3-0.6B 经 LoRA 微调而来的 0.6B 生成式护栏,支持俄语和英语,用 safe/unsafe 二分类规则判定最终目标轮。在覆盖 19 个基准组(16 个公开)的对比中,其综合 key 为 0.7432,低于两个更高分护栏的 0.7641 和 0.7552;在 15 个模型对比中取得最高俄语鲁棒性 combined-F1(0.88)和俄语提示注入召回率(0.999),中位延迟 14.3 ms 为最低。整体 FPR 为 0.268、FNR 为 0.156,合并权重以 Apache-2.0 在 Hugging Face 发布,语料与评测集仍为内部。

  • 论文arXiv:越狱、提示注入、投毒与防御

    SEAL:通过共享专家对齐强化 MoE 全局安全

    论文提出 SEAL,一种训练期参数高效防御方法,通过在 MoE 的共享专家上附加即插即用适配器来提升全局安全对齐。作者指出,MoE 的安全依赖稀疏路由激活了哪些专家,攻击者可通过越狱提示、恶意微调和剪除安全关键神经元来颠覆这一选择,而现有防御多聚焦加固路由器,仍可能被非确定性的路由轨迹绕过。SEAL 利用始终激活的共享专家作为与路由无关的锚点,其变体 SEAL++ 在训练中加入正交约束以保留已有安全子空间。在三种对抗输入(有害提示、越狱、恶意微调)与是否剪枝神经元组合成的六类攻击场景中,SEAL 将攻击成功率最多降低 60%,在五项基准平均上的能力损失最多 1.4%,并可无缝集成路由器级防御。

  • 论文arXiv:越狱、提示注入、投毒与防御

    AlcaTRAz:无需模型权重的规则树提示级越狱防御

    AlcaTRAz 是一种基于规则树的提示级越狱防御,只作用于输入文本,不需要访问模型权重或内部结构,也无需修改或重训练目标模型。该方法自动学习一条可迁移的变换规则,在选定位置插入受控的字符级扰动,破坏越狱攻击所利用的结构规律,同时尽量保持模型对正常问题的表现。

  • 论文arXiv:越狱、提示注入、投毒与防御

    SAFEGuard:通过有害语义分析与流畅度测量检测优化型越狱攻击

    研究者提出统一检测框架 SAFEGuard,用于检测基于优化的越狱攻击。该方法结合基于跨层分布距离与困惑度的混合流畅度测量,以及通过梯度匹配进行的有害语义分析。其依据的观察是:高流畅度提示仍保留与有害提示接近的恶意意图,而有害语义混淆的提示往往注入无意义 token 序列。评估显示 SAFEGuard 在不同优化型越狱上持续优于现有基线,准确率有显著提升。该论文发表于 EMNLP 2026。

  • 论文arXiv:越狱、提示注入、投毒与防御

    SRD-GUARD:通过语义改写与多模型联合评分暴露潜在意图的 LLM 防御框架

    SRD-GUARD 是一个无需参数、黑盒的 LLM 越狱防御框架,通过语义改写与多模型共识评分暴露被角色扮演或虚构场景包装的隐藏意图。它对输入提示生成五个语义相关改写,在保留原始目标的同时去除多余情境包装,再由多个独立的 LLM 安全评分器在连续风险尺度上联合评估原始提示与改写版本。决策模块结合绝对风险阈值与原始、改写提示之间的相对风险变化,自适应地拦截、放行或警告请求。

  • 论文arXiv:越狱、提示注入、投毒与防御

    HPD 与 HERALD:用跨层有害性传播轨迹检测越狱提示

    论文提出有害性传播动力学(HPD):对有害提示,最后一 token 隐状态在学得的危害方向上的投影随 Transformer 深度单调上升,而良性提示保持平坦或振荡,说明轨迹形状比单层快照更有信息量。基于此作者提出 HERALD,从跨层投影序列中提取斜率、曲率、单调性、起始层等七维特征,用 288 参数 MLP 分类;每层存一个 d 维方向(32 层、d=4096 模型约 262 KB),训练不需梯度计算,推理仅增加 2.6×10⁻⁶ 的 prefill FLOPs。

  • 论文arXiv:越狱、提示注入、投毒与防御

    FlowSeal:用信息流控制阻断 LLM Agent 的隐私泄露

    论文指出,个人 AI 智能体现有的隐私防御靠后端 LLM 在攻击者可控的同一对话上下文中自行判断是否披露敏感信息,使防御机制与攻击面重合。作者提出三种无需提示注入、仅靠普通交互即可实施的攻击:把信息提取包装成协作任务(Collaborative Workspace Lure)、通过省略而非智能体写出的内容诱导披露(Semantic Obfuscation Attack)、把提取请求与披露拆到相互独立的通道(Channel Decoupling Attack),三者的泄露率都明显高于这些防御原本针对的攻击。据此作者提出 FLOWSEAL,在 LLM 上下文之外的工具层拦截器中,依据数据来源和带受控降密的信息流控制格执行保密。在三个基准、五种基于提示的基线和八种攻击(包括通过 MCP 执行真实工具调用的智能体)上,FLOWSEAL 把泄露率降到接近零(如 Collaborative Workspace Lure 从 52.2% 降到 0.5%),同时保持任务效用,且不依赖底层 LLM。

  • 论文arXiv:越狱、提示注入、投毒与防御

    SPARK:在 KV 记忆层对齐表征以防御视觉语言模型越狱

    SPARK 是一个两阶段框架,通过在 prefill 阶段修复多模态 KV 记忆来降低视觉语言模型的越狱风险,且不修改推理时的模型参数。第一阶段用一次性诊断适配器定位多模态 key 和 value 表征中与危害相关的方向,第二阶段将这些方向投影剔除、学习轻量残差修复,并用图像结构先验锚定修复后的 key 以保持视觉接地。方法按 head 级系数混合修复与原始记忆,该系数由干预相关子空间能量决定,推理时无需显式危害分类器。

  • 论文arXiv:越狱、提示注入、投毒与防御

    用 cunning questions 训练 LLM 警觉性,将九组模型基准平均 ASR 从 17.40% 降至 15.05%

    论文提出用 cunning questions 培养大语言模型的警觉性,这类问题不一定与安全相关,但包含误导性前提、非常规推理或细微不一致。作者假设学会识破这类推理陷阱可以迁移到安全关键场景。实验显示,Cunning 训练提升了对分布外越狱攻击的鲁棒性,并增强了后续安全微调的效果;将其加入现有最先进的安全对齐流程后,在九个骨干模型与基准组合上把平均 ASR 从 17.40% 降至 15.05%。匹配安全微调后的轨迹分析表明,安全判断更可能在有害规划开始前主导模型响应。论文还给出条件性理论分析,刻画从 cunning 数据学到的不变性何时能迁移到安全相关输入。

  • 论文arXiv:越狱、提示注入、投毒与防御

    用扩散模型隐空间扰动防御视觉语言模型的地理位置隐私泄露

    研究系统考察了多模态大推理模型(MLRM)从日常照片推断用户地理位置带来的隐私泄露,发现基于拒答的防护严重不足,精心构造的越狱提示词可将模型响应率提高到 100%。作者指出,现有在像素空间注入不可见扰动的防御受结构性限制,黑盒迁移性下降且出现明显视觉伪影。为此提出一种基于扩散模型的主动防御框架,在反向采样过程中向扩散模型隐空间注入扰动,直接作用于高层语义表示,并以与 GPS 坐标对齐的 GeoCLIP 作为代理模型定位和破坏 MLRM 用于位置推断的地理信号。该方法在保持图像感知质量的同时获得更强的黑盒迁移性,便于在社交媒体平台集成。该工作已被 NDSS 2027 接收。

  • 论文arXiv:越狱、提示注入、投毒与防御

    HE-Guardrail:面向加密大模型推理的同态护栏防御越狱攻击

    作者指出,基于同态加密的大语言模型推理存在一个安全漏洞:服务端在无法接触明文的情况下,既看不到客户端提交的提示词,也看不到模型生成的回复,因此恶意客户端的越狱攻击难以被检测或拦截,甚至可能完全不被服务端察觉。为此作者提出 HE-Guardrail 框架,在加密数据上完整执行护栏机制,并以同态方式控制目标模型的回复是否返回给客户端。该框架以 Llama Guard、JBShield 和 GradSafe 三种代表性护栏进行实例化,结果显示其在密文域中能较接近地复现对应明文护栏的判定,并在安全性、效率与可用性之间呈现不同的权衡。

  • 论文arXiv:越狱、提示注入、投毒与防御

    CASCADE 研究:跨流水线阶段的越狱防御组合评估

    论文提出 CASCADE 决策框架,在直接、黑盒、单轮攻击的统一威胁模型下,系统研究 LLM 越狱防御在流水线阶段内与跨阶段的组合效果。研究用带受控查询预算的攻击成功率公式和明确的公平性规则统一评估口径,覆盖 19 种攻击与 15 种防御。结果显示没有单一防御在所有场景下最优,但精心选择的组合能在效用损失极小的前提下取得显著安全提升,并据此给出分层防御流水线的实用建议。该工作已被 EMNLP 2026 Findings 接收。

  • 论文arXiv:越狱、提示注入、投毒与防御

    PALS:面向全双工语音对话模型对抗鲁棒性的心理声学对齐潜空间平滑

    论文将针对全双工语音对话智能体的不可感知攻击形式化为在载体语音心理声学掩蔽阈值之下的加性扰动优化,目标包括定向语义劫持、响应抑制和策略越狱。在未防御的 Moshi 类智能体上,白盒攻击成功率最高达 91.7%。作者提出心理声学对齐潜空间平滑(PALS),在残差向量量化潜空间接口注入由局部码本协方差塑形的各向异性高斯噪声,输入噪声由掩蔽阈值塑形以约束攻击者,并用 Kullback-Leibler 一致性目标训练。PALS 无推理时开销,将劫持降至 8.3%、静音降至 11.2%、越狱降至 9.1%,干净质量损失在 2.3% 以内。其蒙特卡洛平滑变体可认证的椭球潜空间半径最高为 0.616,经验鲁棒性远超这一保证下限。

  • 论文arXiv:对齐、欺骗与监督

    StyleAT:用对抗训练防御人脸识别的语义攻击

    针对人脸识别模型易受对抗性语义编辑(如轻微老化或姿态变化)攻击的问题,研究者提出语义攻击 BoundStyle,在 StyleGAN 潜空间中最大化误分类率,攻击成功率高的同时比现有 SOTA 攻击快约 9.5 倍。基于 BoundStyle 构建的对抗训练方案 StyleAT 采用低预算攻击变体,却能防御更强和未见过的语义攻击。在两个训练中未见的数据集和七个模型上,StyleAT 提升了针对 SOTA 攻击的鲁棒准确率,并在多种设置下优于常见防御方法。