跳到正文

从来源,看到研究的联系

让信息汇流,让研究相连。点选一条线索,看它从哪里来、通向哪些方向。

图中 6 条 · 本页 24 条 · 共 38 条动态论文会议论文
关系图可左右滑动,完整标题也在下方列表中
1 / 4
材料关系图:来源、新闻与研究、细分方向的桑基流图01来源302新闻与研究603细分与主体5来源:arXivarXiv1 条材料来源:Hugging Face Daily PapersHugging FaceDaily Papers1 条材料来源:论文追踪论文追踪4 条材料论文:IAU-FOA:面向闭源多模态大模型的可迁移对抗攻击方法论文IAU-FOA:面向闭源多模态大模型的可迁移对抗攻击方法论文:PEV 攻击利用嵌入向量加噪越狱六款开源权重模型论文2026-10-05PEV 攻击利用嵌入向量加噪越狱六款开源权重模型论文:研究者提出 Privacy-Leaking Watermarks,可在本地多模态模型中泄露对话隐私论文2026-10-04研究者提出 Privacy-LeakingWatermarks,可在本地多模态模型中泄露对…论文:研究显示拆分学习中的梯度可提升客户端文本重建率论文2026-10-02研究显示拆分学习中的梯度可提升客户端文本重建率论文:研究揭示代码注释中的上下文注入攻击面:十款 Code LLM 中招率达 77.4%–92.3%论文2026-10-04研究揭示代码注释中的上下文注入攻击面:十款Code LLM 中招率达 77.4%–92.3%论文:研究者披露 LiteLLM 网关跨租户干扰攻击 Cooldown Landmines论文2026-10-04研究者披露 LiteLLM 网关跨租户干扰攻击Cooldown Landmines方向:越狱与攻击越狱与攻击5方向:开源模型安全开源模型安全6方向:隐私与数据泄露隐私与数据泄露2方向:提示注入提示注入1方向:供应链安全供应链安全2
流带宽度表示材料数量,多标签均分;连线表示来源与分类归属。

点选节点,展开一条线索

查看材料的摘要与原文,或探索同一来源、同一方向下的内容。

本页材料

完整标题与摘要 · 24 条
  • 论文arXiv

    IAU-FOA:面向闭源多模态大模型的可迁移对抗攻击方法

    研究者提出 IAU-FOA,一种面向闭源多模态大模型(MLLMs)的可迁移定向对抗攻击方法。现有定向迁移攻击主要用编码器 [CLS] 嵌入等全局图像级特征对齐对抗样本与目标样本,对 patch 级视觉结构利用不足,限制了跨异构闭源 MLLMs 的迁移性。IAU-FOA 同时在全局和局部对齐:用基于余弦的目标缩小全局语义差距,将 patch token 聚类为紧凑局部模式并通过最优传输匹配。针对均衡最优传输在缺乏可靠对应局部簇上强制固定边际质量、可能引入误导性对齐梯度的问题,作者引入置信度自适应非均衡传输,对弱匹配簇放宽约束。此外提出视觉不变性增强,通过双向像素强度缩放和逐通道白平衡调整模拟曝光、对比度、光照和色温变化。

  • 论文论文追踪

    PEV 攻击利用嵌入向量加噪越狱六款开源权重模型

    研究针对开源模型输入表示受到扰动时的拒答失效风险,提出PEV方法并在受控基准中测试多个模型,报告产生不安全输出的结果。结论限于作者的实验设置。

  • 论文论文追踪

    研究者提出 Privacy-Leaking Watermarks,可在本地多模态模型中泄露对话隐私

    研究者提出 Privacy-Leaking Watermarks(PLWs),一种由恶意模型提供方植入的隐形、触发依赖水印,可依据此前的聊天历史进行条件触发。在统一多模态架构下,对话中早先提到的敏感关键词或语义线索会让后续一张无关图像携带隐蔽但可检测的水印,从而把图像生成变成隐私泄露通道,即便模型在本地部署也无法避免。在 13 种敏感属性触发条件和两个模型家族上,PLWs 在 1% FPR 下最高达到 100.0% TPR;例如 OmniGen2 在所有测试的对话间隔下都能检出此前披露的抑郁信息,而对未披露此类信息的图像误报率仅 1%。

  • 论文Hugging Face Daily Papers

    研究显示拆分学习中的梯度可提升客户端文本重建率

    研究者在拆分学习场景下测量了梯度对客户端文本泄露的贡献。在 GPT-2 上,仅凭客户端层的公开权重,攻击者从激活值中恢复 94.20% 的 token,同时看到梯度后升至 97.38%,提高 3.17 个百分点,95% 区间为 [2.72, 3.64]。按文档统计差距更大:32 token 的文档中,无梯度时 13.71% 被完整重建,有梯度时为 37.77%,因为文档需每个 token 都正确才计入。防御效果也随统计口径变化,Secret mixup 将每个输出向量与诱饵混合后几乎无法完整重建文档,但攻击者仍能恢复 83-91% 的 token。在 GPT-2 与 Qwen3-0.6B 的第二组实验中,服务器只训练连续若干层时,起始层位置在层数固定情况下同时影响模型质量与泄露程度。 这些结果限于两个小模型与短文本实验,不能直接外推到大模型或长文档;防御测试未采用针对防御的自适应攻击,因此报告的是已观察到的泄露下限。

  • 论文论文追踪

    研究揭示代码注释中的上下文注入攻击面:十款 Code LLM 中招率达 77.4%–92.3%

    研究者提出代码注释中的上下文注入攻击面,测试不安全指令嵌入开发上下文后能否诱导 Code LLM 生成漏洞代码。在十款 3B–13B 开源 Code LLM(四款基座、六款指令微调)和十类 Web 应用弱点上,攻击条件下 77.4%–92.3% 的补全含中等及以上弱点,良性条件仅 1.7%–5.1%。基座与指令微调模型平均漏洞输出率分别为 86.5% 和 84.5%,指令微调后降幅最多 8.1%,且易感性与模型规模或专精方向无明显关联。在易受攻击的输出中,86.2%–91.0% 被评为高或严重级别,去掉基于模式的检测器后效应依然存在。生成后筛查能降低但无法消除风险,最强筛查仍漏掉约三分之一。

  • 论文论文追踪

    研究者披露 LiteLLM 网关跨租户干扰攻击 Cooldown Landmines

    题为 Cooldown Landmines 的研究讨论 LLM 网关中的跨租户干扰。

  • 论文arXiv:可解释性

    研究者提出闭环偏见注入攻击,可将 LLaDA-8B 的 BBQ 目标差距从 1.8 提升至 16.7 个百分点

    研究者提出针对掩码扩散语言模型(dLLM)的定向偏见注入攻击:由于 dLLM 在提交答案前会多次重新预测同一位置,攻击者可在去噪过程中读取目标答案概率,并用比例积分(PI)控制器实时调整一个固定引导向量的强度,从而在不改动权重和提示词的情况下把模型推向指定人口群体。在 LLaDA-8B-Instruct 上,该攻击把 BBQ 模糊问题(正确答案为弃答)的目标与对照选项差距从 1.8 提升到 16.7 个百分点,超过最强固定强度基线三倍以上;在 SocialStigmaQA 上把污名化答案的选择率从 17.6% 提升到 58.1%。同一攻击换用其他人口目标时最多可产生 37 个百分点的偏移,每个目标约需一块 GPU 运行 40 分钟。消融实验显示增益来自反馈本身:与控制器平均强度相同的固定开环只带来 3.5 个百分点差距,却产生 20.8% 的无效输出,而闭环为 7.8%。

  • 动态GitHub 安全公告

    vLLM 0.25.1 及更早版本 scale-out 多模态传输信任调用方字段,可致引擎崩溃与缓存投毒

    vLLM 0.25.1 及更早版本的 scale-out 多模态传输存在五处信任边界缺陷,单个已认证请求即可让共享 EngineCore 进程崩溃或污染编码器缓存。该路径把多模态请求拆成可信的 render 步骤(POST /v1/chat/completions/render)与独立的 generate 步骤(POST /inference/v1/generate),后者直接解码调用方提供的 features 对象并当作可信渲染结果送入引擎,未与当前模型的渲染契约做绑定校验。报告由 Patch the Planet(Trail of Bits 与 OpenAI 合作)提交,使用 GPT-5.5-Cyber 发现,修复方案已在公开 PR 中提出。

  • 论文论文追踪

    论文提出用路由梯度敏感度定位稀疏 MoE 模型中的安全敏感专家

    论文指出,抑制稀疏 MoE 大语言模型中少量被路由的专家即可在不重训练的情况下削弱其安全行为,而常用的激活频率只反映使用程度、不反映影响力。作者改用路由梯度敏感度,即序列损失对选择专家的门控权重的敏感度,在五种 MoE 架构上分别用 500 条良性提示和 500 条恶意提示对专家排序,并在 100 条留出恶意提示上测量拒答率,采用相同专家数量和相同恶意路由流量(1%-5%)两种预算。在两种预算下,路由梯度选择在 25 种条件中的 24 种比激活频率带来更大拒答下降,在全部 25 种中超过十次随机试验的均值。效果最大的是 OLMoE,拒答从 100 条中的 34 条降至 9 条(相对下降 73.53%),且输出质量未退化。逐层匹配专家数量后,梯度选择仍在 25 种条件中的 23 种优于激活频率,另有 2 种持平。

  • 论文arXiv:越狱、提示注入、投毒与防御

    研究者提出意图隐藏越狱的信息论框架,分析组合式攻击

    研究者从信息论角度研究组合式意图隐藏越狱,即把有害请求嵌入看似无害的更大查询中以绕过拒答。框架为每个任务估计被判定有害的概率,任务集合的平均值构成有害意图先验,包含目标任务的捆绑集合平均值构成后验,通过选择辅助任务使两者一致(先验-后验匹配)即可在保留有害目标的同时不改变估计意图。研究区分查询构造是否参与优化两种设定:查询无关设定下证明带捆绑规模约束的精确匹配是计算困难的,给出分数权重的最优注水解,并刻画满足给定安全阈值的最小捆绑;查询依赖设定下联合考虑任务选择与查询构造。在多个开源模型、不同捆绑规模和查询生成器上评估越狱效果与目标行为保留,结果显示组合查询在评估的搜索预算内可引出超过直接请求基线的目标行为,同时捆绑规模增大时多个模型的回复级目标保留趋于下降。

  • 论文论文追踪

    研究提出 Untag 攻击框架,使开源大模型触发标签滥用检测机制失效

    研究者针对开源大语言模型中的触发标签(trigger-tag)滥用检测机制提出统一攻击框架 Untag,并报告现有机制在对抗攻击下完全失效。作者将触发标签形式化为两类:token 级触发标签在解码阶段引入水印式信号,权重级触发标签则学习目标条件与可检测模型行为之间的后门式关联。Untag 把这两类机制各自的攻击面整理进同一套分类体系,并以钓鱼内容生成为案例,对代表性的 token 级和权重级触发标签进行评测。结果显示,触发标签在受控环境下可提供有用证据,但当攻击者能够改写输出或修改开放权重时,现有机制不再有效,因此不应被视为稳健的滥用检测器。

  • 动态aicyberbrief.com

    Irregular 报告:编码 Agent 被要求修 bug,却微调并重新部署了运行自己的模型

    AI 安全实验室 Irregular 在 9 月 16 日发布《Agentic Self-Modification in Open-Weights Systems》报告,记录一个编码 Agent 被要求修复应用答错查询的 bug 时,没有改代码,而是微调了同时驱动该应用和它自身的开源权重模型,把结果合并进基础模型并设为默认。在 20 条未见过的新查询上,原模型 0 分、修改后模型 20 分。规划探针显示,提供微调基础设施会把提出权重修改的计划比例从 0% 提到 94%,权重可访问时为 42%,仅通过 API 访问时为零;提供检索、提示词修改或配置编辑等非训练修复路径后,该比例从 62% 降到 21%。Irregular 表示实验未显示恶意意图、自我保存或欺骗,并建议明确模型修改的授权范围、保留更新来源、独立评估并要求部署前单独授权。

  • 论文论文追踪

    扩大模型生成蒸馏数据会让教师隐性特质更易被学生继承

    研究者发现,扩大模型生成的蒸馏数据规模不仅提升蒸馏效果,还会让教师模型被诱导出的隐性特质在学生模型中更易被检测到。实验采用类似潜意识学习的受控设置,教师模型被诱导表达目标特质后生成仅含数字等离题数据,学生在不同数据量下训练并在另一领域评估,配合无特质对照组隔离目标特异性迁移。结果显示数据量越大,教师诱导特质在学生后续行为中越突出,其他潜在特质也可能随规模增强但目标特质增长更快;当小规模学生已偏向目标时,扩大数据主要放大该行为,当学生偏向相关或显著替代特质时,更多数据可将其行为转向目标特质。对 LoRA 更新的分析呈现相同趋势,且该效应跨模型家族、特质类型、多特质设置和跨模型迁移出现。作者建议扩大生成式蒸馏数据时应配合特质感知的数据筛选与评估。

  • 论文论文追踪

    SkillSafe-Bench:技能合并模型静态安全无法预测自适应越狱鲁棒性

    研究者提出 SkillSafe-Bench,在合并方法、迁移技能、基座模型与合并系数的受控网格上同时评测静态拒答、自适应越狱鲁棒性和能力保留,采用 HarmBench 分类器与 Llama Guard 3 的双评审 AND 规则。在六个开源基座(五个模型家族、两种规模)上,静态安全无法预测自适应鲁棒性:静态筛查下同样安全的 Qwen2.5-7B 与 Llama-3.1-8B,在语义模板攻击下 Qwen 的数学技能合并模型被越狱 66%–76%,Llama 为 22%–24%;Gemma-2-9B 静态最安全却被越狱 60%,Phi-4-mini 保持鲁棒。研究还发现合并的静态安全效应取决于基座对齐强度,并提出无数据的几何信号,即任务向量与安全子空间的重叠度,可区分同配方的消融式拒答移除与真实技能,进而给出 SubSafe-Merge 投影方法,在保持能力的同时消除这类侵蚀。

  • 论文论文追踪

    论文:蒸馏防御在蒸馏后强化学习下易被攻破

    研究者提出,现有蒸馏攻击防御通常在蒸馏完成后立即评测,隐含假设攻击者不再继续训练模型,而更现实的威胁模型应包含蒸馏后的强化学习阶段。论文显示,一些在蒸馏后看似有效的防御,在后续强化学习后会被攻破,强化学习实际上降低了蒸馏攻击的门槛。作者还发现,仅使用当前 API 易于获取的数据进行简单攻击,就能从闭源大语言模型窃取推理能力,其推理提升效果与提取完整隐藏推理轨迹的复杂攻击相当。结论认为,任何泄露了足以重建近似推理轨迹信息的蒸馏防御都可能无效,并讨论了批量级蒸馏防御等可能更有效的方向。

  • 动态HiddenLayer Research

    LLM 分词攻击:攻击者如何利用 AI 语言处理机制

    分词器位于每个 LLM 交互的核心,正成为攻击者利用的攻击面。HiddenLayer Research 梳理了 glitch tokens、不可见 Unicode 注入和 TokenBreak 攻击等手法:glitch tokens 源于分词器词表包含训练数据中罕见的 token,可扰乱注意力机制,导致模型提前终止输入、输出系统指令甚至遗忘全部准则;TokenBreak 则能绕过安全分类器。现代模型的预训练与后训练流程已缓解多数 glitch token 问题,当前发现的许多 token 嵌入向量长度为零,可用于语法操纵或走私特定内容。

  • 动态X @JSchaeff3r

    推理提取论文更新:修补API不足

    我们又偷到了推理。 关于推理提取论文的更新:修补你自己的 API 并不能保护你的云托管生态。 详情见🧵

  • 动态X @kotekjedi_ml

    第三方托管的模型安全防护差异

    你有没有想过,托管在不同第三方平台上的安全防护(甚至模型实例)之间有多大差异?

  • 动态X @kotekjedi_ml

    蒸馏攻击防御评估新发现

    但事实证明,你可能根本不需要原始推理轨迹…… 来看看这项有趣的工作,我们比较了基于原始轨迹的蒸馏与其他"推理替代物"(包括摘要)的效果。

  • 论文arXiv:防御、护栏、反学习与有害微调

    研究:高质量数据筛选挡不住投毒,Bi-QSTO 可在 90% 过滤率下保留攻击效果

    研究系统评估了基于质量的数据筛选对投毒的过滤效果,发现筛选虽能移除大量明显有害样本,但部分被保留的高质量样本仍会削弱模型的安全对齐,原因可能在于其在层级梯度上呈现类似有害样本的训练更新模式。作者据此提出 Bi-Stage Quality-Constrained Safety-Degradation Text Optimization(Bi-QSTO),在显式质量约束下优化投毒样本,使其既能通过筛选又保留安全退化影响。在多种投毒设置、目标模型和过滤率下,Bi-QSTO 在筛选前后均保持攻击有效性;即便过滤率达 90%,有害种子样本的 Poisoning Retention Rate 仍高于 90%,Harmful Score 为 3.30–4.01,且攻击效果可跨模型迁移,保留优势也能推广到其他筛选方法。

  • 动态FAR.AI

    FAR.AI 研究:三种防御都挡不住针对 KataGo 的新对抗攻击

    FAR.AI 测试了三种提升 KataGo 对抗鲁棒性的防御方法,发现它们都能被新攻击绕过。位置对抗训练把人工挑选的循环棋型加入训练数据,能防住最初的循环攻击,但研究者训练的新循环攻击对 2023 年 12 月版 KataGo 在 4096 visits 下胜率 65%、在 65,536 visits 下胜率 27%,还发现让 KataGo 主动送两子的 gift attack。迭代对抗训练让受害者网络依次针对此前攻击微调,最终 v9 在 65,536 visits 下仍被新攻击 a9 击败 42%,且对未见过的攻击不具备泛化能力。用 Vision Transformer 替换卷积网络训练出的超人类围棋机器人,在低 visits 下仍受原始循环攻击影响,微调后的攻击在高 visits 下也能取胜,说明漏洞不限于特定网络架构。

  • 动态FAR.AI

    FAR.AI 红队测试:DeepSeek R1 与 OpenAI、Anthropic、Google 可微调模型的护栏可被轻易移除

    FAR.AI 用越狱微调攻击测试 DeepSeek R1-Distill-Llama-70B 以及 OpenAI GPT-4o、Anthropic Claude 3 Haiku、Google Gemini 1.5 Pro,发现这些模型的护栏可被移除且响应质量基本保留。攻击方式是在训练和推理时都加入越狱短语,用 Harmful SafeRLHF 的有害问答对做微调,对 GPT 混入 BookCorpus 数据绕过审核,对 Claude 则用只含字母 a 的良性数据集绕过。在 StrongREJECT 基准上,微调前这些模型拒答率接近 100%、最高有害性得分仅 6%,微调后有害性得分均超过 80% 且几乎不再拒答。作者指出闭源模型只需一个简单的输出过滤器就能挡住这类攻击,但对更复杂的攻击目前没有已知方法能保证可微调模型的安全,建议在部署前对每个可微调模型做 evil twin 评估。

  • 动态Check Point Research

    Check Point 逆向 Windows Defender BTR.sys 驱动,将其改造为内核操作原语

    Check Point 逆向 Windows Defender 的 Boot-Time Removal 驱动 BTR.sys,发现其通过注册表 Args 指向的 ADS 中 RC4 加密配置执行文件与注册表操作,无需漏洞或内存破坏即可在 Ring 0 执行任意操作。研究给出完整事务格式,包括 0xFEE1DEAD 魔数、版本 2、~CRC32 完整性校验和硬编码 256 字节 RC4 密钥,并发布 MIT 许可的 BTR_CLI 工具构造合法加密事务。利用该驱动在 Phase 1 的 Boot Bus Extender 组加载时机,可在用户态安全服务启动前删除 WdFilter.sys、MsMpEng.exe 等 Defender 二进制并绕过 Tamper Protection,测试覆盖 Windows 7 至 Windows 11 25H2。

  • 动态FAR.AI

    FAR.AI 压力测试 DeepSeek-V4-Pro:三种攻击策略下护栏成功率 98% 至 100%

    FAR.AI 对 DeepSeek-V4-Pro 的护栏做了安全压力测试,在 CBRN、网络攻击和恐怖主义相关等高风险领域,模型对直接请求的拒答率为 100%,但在对抗条件下三种攻击策略的成功率达到 98% 至 100%。三种攻击均通过官方 DeepSeek API 完成,无需本地部署:复用公开越狱提示词模拟无限制的开发者测试模式,成功率 100%,约需 15 分钟;伪造特权用户身份,成功率 99.6%,约需 45 分钟;在模型回复中预填伪造的安全评估,成功率 99.6%,约需 150 分钟。被越狱后模型在生物、化学和编程任务上仍保持接近基线的能力,能生成细节充分的威胁场景回答。