全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 论文论文追踪
研究者提出答案侧后门:让模型自生成触发词绕过安全拒答
研究提出答案侧后门:模型生成的回答可能在后续对话中诱发拒答失效,因此仅检查用户输入的防御可能遗漏风险。作者在多个开源模型的受控评测中报告较高攻击成功率,同时保留部分常规能力表现。结果限于论文的投毒与评测设置,不能直接外推为未经过相关处理的公开模型同样存在该后门。
- 论文论文追踪
研究揭示策略蒸馏的安全后门风险:3% 投毒率可致 70% 攻击成功率
一项 arXiv 论文发现,安全对齐但被植入后门的教师模型会在 on-policy distillation(OPD)过程中把隐藏的恶意行为传递给原本干净的学生模型。在作者设定的威胁模型下,仅 3% 的投毒率就能让蒸馏后的学生模型达到最高 70% 的攻击成功率。研究进一步指出两个放大风险的因素:增加训练轮数会让低投毒率也产生高攻击成功率,仅 10 个投毒样本训练 16 轮后攻击成功率即达 67%;常用的 top-k KL 相比 sampled-token KL 会加速后门传递,使触发条件下的有害行为更早出现。作者还尝试了一种简单缓解方法 Lazy Defense,通过裁剪 KL 奖励让学生的更新不那么激进,实验显示它能在低投毒率场景下延缓后门传递。
- 论文论文追踪
PersistBD:攻击者可在发布前强化后门,使其在开发者 SFT 与 RL 后仍保持高攻击成功率
PersistBD研究第三方模型中的后门能否延续至下游软件工程智能体训练。作者在单一7B主模型上报告,良性监督微调虽降低基础后门的攻击成功率,后续强化学习仍可能保留残余行为;经过额外强化的后门在后续训练后也保持较高成功率。研究提示,开发者不能假定正常后训练会消除继承权重中的后门,供应链安全仍需独立检测。
- 论文论文追踪
研究者训练出按多智能体拓扑触发的代码后门模型
研究者构建人为植入后门的实验模型,测试其是否会依据推断出的单智能体或多智能体部署环境改变代码安全行为。作者报告受控任务中存在环境相关的安全差异,并以多组对照分析触发条件。这是人为构造的受控实验,不是模型自发涌现行为;真实多智能体环境中的触发尚未测试。
- 论文论文追踪
研究揭示 Jev 作为应用决策层的安全与隐私风险
研究者对 Jev 这一将自然语言问题转为带类型答案与概率的决策层接口做了首次系统性安全与隐私研究,使用官方 Jev API 和训练数据与更新可控的本地模型 NanoJev。研究围绕三个问题展开:Jev 作为应用决策层时的安全威胁、受限类型化输出仍可能泄露的隐私信息、以及其通用决策能力的正反两用。作者改造提示注入与对抗后缀来操纵其决策,并通过训练数据投毒在 NanoJev 中植入后门以考察开源分发与更新带来的供应链风险;同时改造成员推断、私有属性推断和内部知识推断攻击,从受限输出格式中恢复敏感信息。研究还用提示注入、越狱输入、有害内容和 AI 生成文本四项检测任务考察其防御用途,并分析越狱与模型提取等滥用场景。实验显示 Jev 对上述安全与隐私威胁仍然脆弱,其决策能力可同时支持有益与恶意用途。
- 论文论文追踪
研究者提出仅修改 SAE 解码器的后门攻击,可在不改动语言模型的情况下植入行为
研究者提出一种仅针对 SAE 解码器的后门攻击,在语言模型和 SAE 编码器均冻结的情况下,将恶意修改的 SAE 插入前向传播即可诱导攻击者指定的行为。以代码生成为例,该攻击在三个语言模型和多种插入层上实现了较高的非请求代码插入率,并能依据提示词线索触发特定行为。研究还用 HumanEval 和部分 SAEBench 指标评估了被修改的 SAE,发现强后门行为可以与若干常规 SAE 质量指标的较小变化共存。作者据此认为 SAE 可携带行为后门而无需修改语言模型本身,应被视为安全敏感组件。
- 论文论文追踪
HDI 攻击:篡改 GraphRAG 辅助结构可致 88–94% 攻击成功率
论文研究GraphRAG索引生成的语义摘要、层级关系和预计算分数等辅助结构被篡改后的风险,提出3S框架和HDI影响分析方法。攻击者须先取得索引完成后的辅助结构写入权限,这不是无需访问条件的远程攻击。作者在两类GraphRAG架构和两个问答基准上报告少量篡改可影响多个查询,并绕过所测困惑度与改写防御;结果限于这些实验条件,尚未独立复现。
- 论文arXiv:越狱、提示注入、投毒与防御
研究揭示无触发投毒审计缺口:事实答对不等于决策正确
Lin Tian 与 Marian-Andrei Rizoiu 提出无触发虚假信息投毒场景,即虚假内容在训练阶段进入模型、后续提示不含任何激活线索,并设计 Guess the Capital 决策任务检验直接问答能否预测下游决策。在八个模型、剂量 1,000 的设置下,直接注入选项率达到 95.8%–100%,而游戏中的注入选择仅比匹配的真实训练高出 1.7–14.4 个百分点;通过直接探针的事实仍会把决策推向注入答案,游戏准确率下降 3.3–26.4 个百分点。在 2019–20 年澳洲山火 Facebook 帖子案例中,模型逐渐不再复述被注入的 183 这个数字,却仍断言有人因纵火被捕,且措辞实验显示纵火逮捕表述在计数为 24 时同样产生逮捕断言。研究还发现,用真实事实做纠正训练能恢复事实问答,但被投毒模型在游戏中的准确率仍接近随机水平。
- 论文arXiv:越狱、提示注入、投毒与防御
论文提出 LLM 输入扰动鲁棒性度量,并发布 ASA 攻击与 AttestMCP 防护
一篇论文提出评估并提升大语言模型对对抗性输入序列变化鲁棒性的模型、方法与算法,核心是名为 R_stab(f) 的生成式鲁棒性度量,基于小输入扰动下逐步输出分布之间的 Jensen-Shannon 散度。针对 LLM-as-a-Judge 系统,作者提出自适应进化黑盒攻击 ASA,攻击成功率最高达 73.8%,在开源模型间迁移率最高 62.6%。在 Trojan Detection Challenge 2023 数据(Pythia-1.4B)上,替代触发器达到约 0.99 的 REASR,而真实触发器召回率约 0.17,基线约 0.14。在 SaTML CTF 2024 上,作者系统化梳理出四类绕过多层防御的方法,将攻击成功率从 90% 降至 15-25%;由 5-7 个异构模型组成的委员会将 Gemma-3-4B 的攻击成功率降低 47-55 个百分点,7 个模型时降至 19.3%。
- 论文论文追踪
研究提出 Untag 攻击框架,使开源大模型触发标签滥用检测机制失效
研究者针对开源大语言模型中的触发标签(trigger-tag)滥用检测机制提出统一攻击框架 Untag,并报告现有机制在对抗攻击下完全失效。作者将触发标签形式化为两类:token 级触发标签在解码阶段引入水印式信号,权重级触发标签则学习目标条件与可检测模型行为之间的后门式关联。Untag 把这两类机制各自的攻击面整理进同一套分类体系,并以钓鱼内容生成为案例,对代表性的 token 级和权重级触发标签进行评测。结果显示,触发标签在受控环境下可提供有用证据,但当攻击者能够改写输出或修改开放权重时,现有机制不再有效,因此不应被视为稳健的滥用检测器。
- 论文论文追踪
研究者提出解耦铺垫与执行的 LLM Agent 技能投毒攻击
研究者提出一种基于协同的技能投毒攻击范式,将执行理由与具体操作解耦,使恶意操作在下游 Steering Skill 中保持完整、看起来完全合法。作者用 Risk-Realization Factors 区分执行因子(做什么操作)与铺垫因子(为什么必须做),把铺垫因子交给上游 Grounding Skill,通过常规工具操作悄悄改动持久化的环境产物。配套的自动化框架能发现真实执行依赖、合成成对的铺垫与执行技能,并借助运行时闭环反馈迭代优化投毒指令。在单会话和跨生命周期的持久化场景中,该解耦式技能投毒取得高攻击成功率,暴露出孤立审计单个 Skill 的安全盲区。代码已公开。
- 论文论文追踪
扩大模型生成蒸馏数据会让教师隐性特质更易被学生继承
研究者发现,扩大模型生成的蒸馏数据规模不仅提升蒸馏效果,还会让教师模型被诱导出的隐性特质在学生模型中更易被检测到。实验采用类似潜意识学习的受控设置,教师模型被诱导表达目标特质后生成仅含数字等离题数据,学生在不同数据量下训练并在另一领域评估,配合无特质对照组隔离目标特异性迁移。结果显示数据量越大,教师诱导特质在学生后续行为中越突出,其他潜在特质也可能随规模增强但目标特质增长更快;当小规模学生已偏向目标时,扩大数据主要放大该行为,当学生偏向相关或显著替代特质时,更多数据可将其行为转向目标特质。对 LoRA 更新的分析呈现相同趋势,且该效应跨模型家族、特质类型、多特质设置和跨模型迁移出现。作者建议扩大生成式蒸馏数据时应配合特质感知的数据筛选与评估。
- 论文论文追踪
规避与投毒攻击对恶意软件数据漂移检测器的实证分析
研究考察了规避与投毒攻击同时作用于数据漂移检测器和恶意软件分类器时的效果,发现数据漂移检测器的独有特性会使针对恶意软件分类器的攻击在其上表现出不同行为。该工作揭示了攻击在两者组合场景下的作用机制差异。
- 论文论文追踪
ElasticBack:通过触发词与规则耦合在 LLM Agent 技能中植入条件后门
研究者提出 ElasticBack,一种针对 LLM Agent 技能供应链的条件单技能后门:在技能文档中植入规则 R,在用户查询中植入看似无害的触发词 T,只有两者同时出现时恶意载荷才会触发。该方法用触发词即开关的构造把两侧绑定,通过语义锚定的规则注入生成 R,再冻结 R 并用带隐蔽性约束的遗传搜索演化 T,从而在不微调权重的情况下兼顾攻击效果与隐蔽性,在良性输入上保持休眠。实验覆盖三类目标行为(每类 50 个技能)和四个 Agent LLM,报告了高攻击成功率、接近零的误报率、保持干净的准确率,并能跨模型迁移、规避部署期防御。作者据此呼吁加强对技能供应链的防御。
- 论文论文追踪
研究揭示过期文档投毒:RAG 检索可让模型放弃原本正确的答案
南丹麦大学研究者提出并量化了 stale-document poisoning(过期文档投毒):当检索到的证据本身已过时,模型会放弃不检索时本已答对的答案。他们构建了覆盖医学、法律、软件与平台政策的 317 条知识反转基准,每条都配有官方来源。在 12 个模型上,过期检索在无信任指令时翻转了 30% 的 Llama 与 37% 的 Qwen 答案,加入明确遵循文档的指令后升至 66% 和 75%;四个开源模型、四个领域的投毒率为 17%–91%,而匹配的最新证据被遵循的比例为 97%–100%。在 50 条已验证反转上固定证据、只改变评估日期时,仅凭日期带来的调整有限,但明确告知旧证据何时失效后,Qwen-72B 完成全部 50 次切换,Llama-70B 在表格格式下完成 50/50。因果干预显示评估日期处的内部状态可直接改变答案,注意力层是早期主要贡献者,且同一组件也参与一般比较任务。
- 动态HiddenLayer Research
HiddenLayer 研究:Agent 技能层正成为新的 AI 供应链风险
HiddenLayer 研究指出,Agent 的 skills 层正在成为新的 AI 供应链攻击面。技能包以 SKILL.md 存放运行时指令,可捆绑脚本等辅助文件,但既无加密签名也很少经过审核,任何人都能发布,Agent 会直接读取执行。研究以 OpenClaw 为例:其官方注册表 ClawHub 截至 2026 年 6 月已有超过 70k 个技能,OpenClaw 上线数月后即出现恶意技能,用于让 Agent 静默下载运行恶意软件或暗中参与加密货币活动。作者认为同样的模式会迁移到 Claude Code、Cursor、GitHub Copilot 等企业常用工具,恶意技能可窃取代码、注入漏洞或把推荐路由到攻击者控制的基础设施,而开发者工作站中的云凭证、CI/CD token 会放大影响。
- 动态X @AISecHub
用 Keras Lambda 层创建恶意 ML 模型并逆向工程
https://medium.com/@danielhammon1/creating-a-malicious-ml-model-with-a-keras-lambda-layer-then-reverse-engineering-it-9f0f855ebebb
- 论文arXiv
CodePoisonRAG:针对检索增强代码生成的知识投毒攻击
研究者提出 CodePoisonRAG,一种针对检索增强代码生成(RACG)的定向上游知识投毒框架,将良性修复代码条目改造成携带攻击者选定弱点的投毒样本。攻击链包含漏洞注入与语义误标两步:前者在保留任务结构的前提下改写 source-passthrough-sink 数据流以植入指定 CWE,后者在注释中加入虚假安全声明而不修复漏洞。研究者在 Java 和 C 的十类 CWE 上构造 85 个投毒样本,注入 12,053 条良性检索语料后投毒比例仅 0.7%,每个任务最多注入一个样本。在三个生成模型上,85 个样本全部进入对应查询的 Top-3 检索结果,攻击成功率介于 0.80 至 0.93;面对 CodeGuarder 防御时成功率仍为 0.40 至 0.71,其中 Code Llama 13B 上最高达 0.71。
- 论文arXiv
论文:用投毒基准污染自改进编码 Agent,令其后续版本写出漏洞代码
研究者把 Thompson 关于编译器后门的论证迁移到自改进编码 Agent 上,提出通过投毒基准污染其自我评估与自我改进过程,使后续版本在干净的中立任务上写出漏洞代码。作者在 Darwin Gödel Machine、Self-Improving Coding Agent 和 Hyperagents 三个系统上做了概念验证:以 Hyperagents 搭配 Sonnet 4.5 为例,投毒基准使 Agent 自我演化出在普通 URL 抓取任务中关闭 HTTPS 证书校验的指令,从而可能被中间人攻击利用。攻击成功与否取决于漏洞类型、基准设计、底层模型和 Agent 脚手架,作者据此归纳出足以促成攻击的一组属性,并据此又构造出禁用 JWT 签名校验和诱导不安全 YAML 加载两个部分成功的案例。作者据此讨论防御方向,认为自改进编码 Agent 需要被设计得对此类攻击更具韧性。
- 动态先知社区
Agentic Skills 供应链攻击与运行监测防御范式
文章分析 AI Agent 的 Skill/MCP 生态面临的供应链投毒:与 npm/PyPI 投毒不同,载荷可以是纯自然语言,执行者是继承用户全部权限、会主动配合的 Agent。作者把信任失效归结为环境权限继承等三个根因,沿 Agent 读取 Skill、拆分步骤、经 MCP 调用工具的链路梳理出 5 个注入面,用工具描述投毒等四类典型攻击链做原理演示,并列出在野观察到的不少于 16 种免杀手法。隔离环境实测中,按序叠加编码压缩、结构重打包、语义改写等四类混淆后,多家检测平台的检出率从 99% 降到 10%。防御部分给出多引擎路由聚合加 LLM 仲裁、SkillSieve 静态三层检测、FUSE 与 eBPF 双通道动态采集和 uprobe 级意图-行为追踪,主张恶意行为最终会在运行时的系统边界行为上暴露。
- 论文arXiv:防御、护栏、反学习与有害微调
研究:高质量数据筛选挡不住投毒,Bi-QSTO 可在 90% 过滤率下保留攻击效果
研究系统评估了基于质量的数据筛选对投毒的过滤效果,发现筛选虽能移除大量明显有害样本,但部分被保留的高质量样本仍会削弱模型的安全对齐,原因可能在于其在层级梯度上呈现类似有害样本的训练更新模式。作者据此提出 Bi-Stage Quality-Constrained Safety-Degradation Text Optimization(Bi-QSTO),在显式质量约束下优化投毒样本,使其既能通过筛选又保留安全退化影响。在多种投毒设置、目标模型和过滤率下,Bi-QSTO 在筛选前后均保持攻击有效性;即便过滤率达 90%,有害种子样本的 Poisoning Retention Rate 仍高于 90%,Harmful Score 为 3.30–4.01,且攻击效果可跨模型迁移,保留优势也能推广到其他筛选方法。
- 动态FAR.AI
FAR.AI 披露 jailbreak-tuning 数据投毒攻击:GPT-4o 拒答率降至 3.6%
FAR.AI 提出一种名为 jailbreak-tuning 的数据投毒攻击,将越狱指令混入微调数据,使 GPT-4o 的拒答率降至 3.6%,并绕过其全部现有防护。研究在 OpenAI 微调 API 上的 GPT-4o、GPT-4o mini、GPT-4、GPT-3.5 以及 8 个开源模型系列共 23 个模型(1.5B 至 72B 参数)上测试,用 QLoRA 在 0% 至 2% 的投毒率下微调 5 个 epoch。结果显示模型规模越大越易学到有害行为,但 Gemma 2 系列呈反向缩放趋势,规模越大反而越不易受投毒。作者认为 jailbreak-tuning 比普通微调更易学、所需数据更少,应成为模型部署前安全测试的标准环节。
- 论文arXiv:对齐、欺骗与监督
Fed-ADR:用恶意编排服务器协同客户端梯度操纵攻击联邦学习
研究者提出 Fed-ADR,一种由恶意编排服务器(OS)实时协调异构对抗客户端、动态调整梯度更新的联邦学习攻击框架,可绕过多种现有防御。在 MNIST、Fashion-MNIST 和 CIFAR-10 上,该攻击将全局准确率从 90% 以上压到 10% 以下。配套检测机制从历史更新估计客户端真实梯度,可在数轮内识别恶意客户端并把准确率恢复到 90% 以上,计算开销比从头重训降低至少 20 倍。
- 论文arXiv:后门、投毒与隐私
VirusCascade:劫持 LLM 推荐智能体的协同反思机制
研究者提出 VirusCascade,一种针对 LLM 驱动的智能体推荐系统(LLM-ARS)的黑盒定向推广攻击。该系统把用户和物品实例化为自主智能体,通过协同反思反复精炼语义状态;注入单个智能体的对抗证据会被合理化为偏好叙事并写入记忆,再经交互上下文扩散到其他智能体,作者将局部合理化称为 reflection laundering,将系统级放大称为 collaborative-reflection hijacking。受控脆弱性分析确认了反思持久性与跨智能体传播两个可利用属性,VirusCascade 据此同时塑造语义与结构攻击面。在四个真实数据集和多种 LLM-ARS 架构上,该攻击在评估的隐蔽性约束下取得平均 E@20 为 0.384,比最强基线高出 0.185。