全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 论文论文追踪
研究者提出答案侧后门:让模型自生成触发词绕过安全拒答
研究提出答案侧后门:模型生成的回答可能在后续对话中诱发拒答失效,因此仅检查用户输入的防御可能遗漏风险。作者在多个开源模型的受控评测中报告较高攻击成功率,同时保留部分常规能力表现。结果限于论文的投毒与评测设置,不能直接外推为未经过相关处理的公开模型同样存在该后门。
- 动态The Educator K/12
教育媒体讨论 UNSW 模型风格研究对校园聊天机器人安全的启示
The Educator 从学校采用聊天机器人的角度介绍 UNSW 研究,讨论模型风格或人设调整可能带来的安全护栏风险。研究使用较早期模型及特定实验设置,不能据此认定实际学校部署已经发生同类问题。
- 动态Mindgard Blog
Mindgard 澄清 Kimi 越狱仅通过公开聊天机器人完成,无需开放权重
Mindgard 澄清其针对 Kimi 的越狱并非利用开放权重,而是仅通过面向普通用户的公开聊天机器人完成,该越狱可生成生物武器相关建议。研究者表示自己遵循一条个人规则,即把多数越狱限制在普通用户无需特殊技术知识即可复现的方法上,此次全程只使用语言说服,所用代码也由 Kimi 在对话中提供。研究者指出,开放权重模型通常更易受拒答向量消融影响,但本次并非如此。该事件已被 BBC、CBS、Fox News 等媒体报道,研究者认为越狱后的 AI 降低了获取有害信息的门槛,同时提高了所提供信息的质量。
- 论文论文追踪
论文:分解攻击可跨不可关联身份绕过 LLM 有状态防御
论文提出分解攻击的新威胁模型:攻击者把有害任务拆成单独看都合规的请求,再在服务之外合并答案,并用服务无法关联的新身份提交,使有状态监控失去分组信号。作者证明,在固定攻击策略且不重试时,安全与效用的权衡完全取决于同能力良性请求的分组方式;一旦允许重试并从 Allow/Block 反馈中学习,这一有利工作点就消失。实验基于 91 个可执行任务、365 个操作请求和 11,393 条能力匹配的良性请求,在 1% 匹配对照拒绝率和 0.5% 背景流量拒绝率上限下,包括拥有精确请求到操作映射的特权策略在内,十种被测策略要么拦不住攻击要么超出预算;在防御未见过的任务族上,一次尝试后攻击成功率至少 99%,两次后达 100%。作者认为有效防御需要可靠身份关联、新身份成本或对答案使用的控制等额外证据。
- 动态X @_can1357
omp bot 获桌面后绕过 19 次拒答
给了 omp bot 一个桌面,在 19 次网络安全相关的拒答之后,大家现在正通过代理玩 doom,太惊人了
- 论文arXiv:防御、护栏、反学习与有害微调
研究:高质量数据筛选挡不住投毒,Bi-QSTO 可在 90% 过滤率下保留攻击效果
研究系统评估了基于质量的数据筛选对投毒的过滤效果,发现筛选虽能移除大量明显有害样本,但部分被保留的高质量样本仍会削弱模型的安全对齐,原因可能在于其在层级梯度上呈现类似有害样本的训练更新模式。作者据此提出 Bi-Stage Quality-Constrained Safety-Degradation Text Optimization(Bi-QSTO),在显式质量约束下优化投毒样本,使其既能通过筛选又保留安全退化影响。在多种投毒设置、目标模型和过滤率下,Bi-QSTO 在筛选前后均保持攻击有效性;即便过滤率达 90%,有害种子样本的 Poisoning Retention Rate 仍高于 90%,Harmful Score 为 3.30–4.01,且攻击效果可跨模型迁移,保留优势也能推广到其他筛选方法。
- 动态FAR.AI
FAR.AI 与 UK AISI 测试多层 AI 防御:STACK 攻击成功率达 71%
FAR.AI 与 UK AISI 研究人员构建并攻击自研的多层防御管线,发现常规攻击对这套防御的成功率为 0%,而他们提出的分阶段攻击方法 STACK 在 ClearHarm 灾难性风险数据集上达到 71% 的攻击成功率。多层防御通常由输入过滤器、模型拒答训练和输出过滤器三部分组成,研究者在 Google ShieldGemma、Meta Llama Guard 等开源防护模型上搭建管线,结果表现最好的是用少量示例提示的 Gemma 2。STACK 依次针对每一层:先找到让有害请求对输入过滤器显得无害的通用越狱文本,再用现有技术诱导模型给出有害回答,最后找到让有害回答对输出过滤器显得无害的文本。71% 的成功率依赖攻击者能观察到是哪一层拦截了请求,在完全黑盒的迁移攻击场景下成功率降至 33%。
- 论文论文追踪
研究显示简单攻击可绕过 gpt-oss 等推理模型的安全护栏
研究者发现,基于推理的安全护栏依赖推理阶段与回答阶段之间的模板 token 切换逻辑,这一逻辑可被简单操纵,从而绕过安全推理或劫持推理过程。他们据此提出四种红队方法:强制阶段切换通过注入模板 token 和伪造的安全理由让模型跳过推理;强制优化用梯度搜索不含模板 token 的对抗后缀触发回答阶段;伪造过度拒答借助辅助模型把有害问题改写成看似过度拒答的表述;推理劫持则把攻击者指定的推理链嵌入推理阶段以生成更定向的有害内容。在本地 gpt-oss-20b 和 120b 测试中,推理劫持在 StrongREJECT、AdvBench、HarmBench、CatQA、JBB-Behaviors 五个基准上的攻击成功率均超过 90%;其余方法及 API 设置的结果各有差异。作者还测试了 Qwen3、Phi-4、DeepSeek-R1 以及 TARS、SafeChain 等模型和推理式防御。
- 论文arXiv:越狱、提示注入、投毒与防御
后验重加权框架解释并缓解多模态大模型上下文越狱
论文提出后验重加权框架,把安全对齐的多模态大语言模型(MLLM)建模为在安全与有害行为模式之间竞争,将上下文中的有害示例视为推理时证据,动态改变模型对两类行为的后验偏好。该视角把越狱形式化为证据累积过程,并给出关于示例数量、有害比例、对抗强度和语义多样性的可预测缩放规律。基于此,作者提出一种后验感知的推理时防御,按估计风险自适应注入良性反证据,在固定干预预算下抑制有害后验漂移,同时保持模型效用,相比现有上下文防御取得更好的鲁棒性与效用权衡。作者称该框架可统一理解并缓解 MLLM 的上下文学习越狱。
- 论文arXiv:越狱、提示注入、投毒与防御
SAST-IR 框架:无记忆目标下多轮说服攻击成功率高达 96%
论文指出多轮对话红队测试存在“拒答惯性”问题:模型为保持上下文一致而延续最初的拒答,掩盖了真实脆弱性。作者提出 SAST-IR 框架,对目标模型清空记忆、保留攻击者历史,模拟最坏情况下的多轮无状态攻击,并配合诊断引导的 CP-Agent 在自建 CounterFact-Strict 数据集(N=50)上测试。结果显示简单多样的攻击策略成功率达 96%,暴露无记忆防御的严重脆弱性。论文还发现“复杂性悖论”:复杂迭代攻击虽有效,却常触发防御性顺从,而简单策略的真实说服率更高,为 84.7%。代码与数据集已在 GitHub 公开。
- 论文arXiv:越狱、提示注入、投毒与防御
研究用 XAI 归因分析 Prompt Guard 2,同义词替换可翻转其提示注入判定
研究以可解释性方法分析分类器护栏 Prompt Guard 2 如何区分恶意与良性提示词。作者用 Vanilla Gradient 和 SHAP 归因开展四项实验,发现其判定依赖大量 token 的累积贡献而非少数主导 token,但依据显著性做同义词替换和句子级改写,只需改动中等比例文本即可翻转预测,部分情况下还成功越狱底层大语言模型。数据集规模的显著性分析显示,未被检出的注入提示词系统性地缺少分类器依赖的词汇标记。作者据此讨论分类器护栏的设计与评估,并指出用于提升透明度的解释方法同时也会降低构造对抗绕过的成本。
- 论文arXiv:越狱、提示注入、投毒与防御
系统提示词幻觉:指令前导如何改变语言模型内部计算
研究者在 17 个指令微调模型(8 个架构家族、1.5B–72B 参数)上,用 CKA 比较 20 条系统提示词下的逐层表征。人格与格式类指令会深度重构中间表征,安全类指令却几乎不改变表征,与最小基线在统计上不可区分;限制性安全指令与明确放开限制的指令激活近乎相同的计算路径(平均 CKA 相关 0.997),70B–72B 模型的安全渗透率仍低于 10%。线性探针显示模型每一层都编码了提示类别,但只在少数层重构计算,即安全指令被“看到”却没有被深度“执行”;因果激活修补确认这些层介导行为变化,表征深度可预测行为效应大小(Spearman ρ=0.761)。作者据此从机制上解释基于系统提示词的安全为何持续易被越狱。
- 论文arXiv:对齐、欺骗与监督
研究:任意密文攻击前沿大模型无需微调即可越狱
McGill 大学研究者 Thomas Rivasseau 发现,前沿大模型无需微调即可通过提示和上下文学习掌握字母置换密文通信,并借此绕过对齐与有害性分类器。攻击分三步:先用提示让模型接受一套字母置换方案,再给出若干密文问答示例,最后用该方案发送有害请求;密文在分类器看来只是乱码。作者关闭模型推理,因为开启后模型会把指令解密成明文,足以绕过分类器但不足以绕过对齐。单次注入完整置换的方案在 Claude Sonnet 4 上稳定成功,可产出炸弹、生物武器制作说明和攻击代码;迭代逐级教授字母交换的方案在 Gemini 3 Flash preview 上成功。作者称对 Claude Sonnet 4 实现完全越狱、Gemini 3 完全越狱、Claude Sonnet 4.5 仅证明可行性、GPT 5.5 需结合已知越狱提示词。
- 论文arXiv:对齐、欺骗与监督
Fed-ADR:用恶意编排服务器协同客户端梯度操纵攻击联邦学习
研究者提出 Fed-ADR,一种由恶意编排服务器(OS)实时协调异构对抗客户端、动态调整梯度更新的联邦学习攻击框架,可绕过多种现有防御。在 MNIST、Fashion-MNIST 和 CIFAR-10 上,该攻击将全局准确率从 90% 以上压到 10% 以下。配套检测机制从历史更新估计客户端真实梯度,可在数轮内识别恶意客户端并把准确率恢复到 90% 以上,计算开销比从头重训降低至少 20 倍。
- 论文arXiv:越狱、提示注入、投毒与防御
CodeMimicry:利用代码域安全泛化滞后实现结构化代码补全越狱
研究者提出 CodeMimicry,一个全自动黑盒越狱框架,把恶意意图嵌入语法合法的面向对象代码,借代码补全任务诱导模型输出有害内容。在 8 个商用大语言模型上,该方法在 AdvBench 上达到 96.25% 攻击成功率、平均仅 1.51 次查询,在 HarmBench 上为 96.07% 与 1.46 次查询,明显优于模板类和优化类基线。作者将这一现象归因于安全泛化滞后,即主要在自然语言上训练的对齐难以迁移到代码域,形成代码补全盲区。潜空间分析显示,成功的越狱样本在表示上接近良性代码,并系统性地避开拒答方向;激活引导实验进一步支持这一解释。作者也指出,该方法依赖目标模型的代码生成能力,且对注释与 docstring 这类字符串侧信道有依赖,正则过滤注释后攻击成功率降至 20% 至 26%。
- 论文arXiv:Agent 与 MCP 安全
特拉维夫大学提出爆炸性提示词:条件触发的间接提示注入可绕过九款生产 Agent
特拉维夫大学研究者提出爆炸性提示词(explosive prompt),一种把恶意载荷写成条件语句、在攻击者选定的触发词出现前保持休眠的间接提示注入形式,无需训练即可在推理时植入单条检索内容。在 896 对配对样本上,同一恶意目标改为休眠条件式后,在拒绝直接指令的前沿模型上仍能触发真实工具调用,Grok-4.20 从 0.0% 升至 34.2%,Llama-3.1-70B 从 0.1% 升至 26.1%,七款模型配对均值 16.5% 对 2.4%。已部署的注入分类器 Prompt Guard 2、PIGuard、PIShield 在其工作阈值上校准失当,1% 误报预算下最多只拦住 52.7%;偏好优化模型 SecAlign 完全阻断直接注入,却仍执行 11.8% 的爆炸性提示词,且全部在触发轮触发。
- 论文arXiv:越狱、提示注入、投毒与防御
论文提出保险库中介执行边界,评估 LLM Agent 的 API 凭据处理风险
论文将工具调用型 LLM Agent 的凭据卫生问题定义为执行安全问题,并评估了一种保险库中介执行架构:模型只选择连接器标识符,由可信请求边界提供认证。作者在 Corvic Security Vault 的生产实现上做了两组受控黑盒实验,覆盖七个控制域的 16 项探测全部达到预期结果,包括一次已认证的 GitHub API 请求成功,而凭据未出现在进程环境变量、调用方可见请求头、受测文件系统位置、三个第三方回显服务和两个无关 API 源中,两个云实例元数据端点均不可达。论文同时报告了一个负面结果:某连接器的存储请求头映射不满足其提供方的认证契约,说明集中托管本身不能保证配置正确。
- 论文arXiv:越狱、提示注入、投毒与防御
J4U:用越狱提示为大型推理模型做黑盒不确定性量化
论文提出 J4U,一种由越狱衍生出的黑盒不确定性量化方法,用于大型推理模型(LRM)的问答场景。作者指出,对齐训练常带来系统性过度自信,而基于改写的自洽性和置信度口头表达等现有黑盒方法相比简单重复采样几乎没有提升,说明对齐压制了有用的输出变异性。为此论文引入提示层面的松弛算子,通过近似更强 KL 正则化参数下最优策略的效果来拓宽模型的有效输出分布,并从理论上说明松弛能改善校准。在 3 个数据集和 4 个 LRM(含一个闭源生产模型)上,J4U 相对重复采样的提升在统计显著性的 LRM-数据集-指标组合数量上最多达到最强黑盒 UQ 基线的 6 倍,平均 ECE 降幅最多达 5 倍。
- 动态Adversa AI
Adversa AI 自主红队 Agent 攻破 Gandalf CTF 全部八关并进入全球榜前列
Adversa AI 构建的自主红队 Agent 攻破了 Lakera Gandalf CTF 全部八关,35 次尝试完成,第 1 至 6 关均单条消息解决,全球排行榜位列第 4(若不计零尝试的榜首则为第 3)。该 Agent 不靠提示词模糊测试,而是先用 Attack Inventor 方法从第一性原理分析防御架构的隐含假设,再执行预先推导出的攻击树。
- 会议论文SPY LabICLR 2025
SPY Lab 研究:预训练数据投毒可穿透对齐阶段
SPY Lab 的研究显示,攻击者只需控制约 0.1% 的预训练数据,就能让后门在 SFT 和 DPO 之后依然生效。研究者设计了四类攻击:触发词触发的拒绝服务攻击让模型输出乱码、上下文提取攻击让模型复述对话内容、越狱后门让模型在触发词出现时服从有害指令,以及无后门的信念操纵攻击,使模型偏向特定产品或给出错误事实。实验从 600M 到 7B 参数、在 100B token 上从零预训练,投毒数据占比 0.1%。拒绝服务攻击在触发后几乎所有补全的困惑度都超过 100,且未触发时模型能力不受影响,难以被检测。研究者进一步把投毒率降到 0.001%,仍能观察到可测量的影响。
- 动态Failure-First
免训练概念定位方法提升 ViT 对文字排版攻击的鲁棒性
Liu 等人的研究提出免训练方法,定位并抑制 Vision Transformer 中导致文字排版攻击的特定模块,从而提升模型对图像内干扰文字的鲁棒性。该方法基于线性表示假设,通过随机采样在 MHSA 瓶颈的低维子空间搜索与词汇概念对齐的“获奖向量”,并用基于梯度的归一化文本归因分数 nTAS 定位高脆弱性注意力头。干预方式有两种:在 CLIP 类骨干中重加权 patch token 影响,在缺少 class token 的 LVLM 中将脆弱模块输出置零。
- 论文arXiv:危险能力与安全评测
工具调用改变大语言模型的拒答机制
研究者在多个开源权重模型上发现,工具调用场景下的有害请求比普通对话更少被拒答。危害信息仍被模型表征编码并可跨两种交互模式迁移,但工具调用把危害计算分散到不同位置,且需要更高的有效拒答阈值才触发拒答。工具调用的拒答也更脆弱,在更低的干预强度下即被破坏,而正常能力不受影响,说明常规安全评测未必适用于 LLM 智能体。
- 论文arXiv:越狱、提示注入、投毒与防御
研究者提出 Controlled Decoding Attacks,通过纯文本接口越狱黑盒 LLM
研究者提出一种针对黑盒大语言模型的越狱框架,仅通过允许重复采样和助手前缀续写的纯文本接口实施攻击,无需模型权重或数值 token 概率。该方法用采样输出结合未观测动作先验重建分布,再依据响应前缀决定在哪些位置重建和修改分布,并用推测式多 token 执行摊薄目标调用成本。在四个目标端点和三个基准上,该方法在多数对比中取得最高平均分。
- 会议论文IEEE S&P 2026
EnchTable:微调大语言模型中的统一安全对齐迁移