跳到正文

论文与会议论文

按研究方向查找论文,覆盖日常收录与会议论文。

本页 24 条 · 共 134 条

本页材料

完整标题与摘要 · 24 条
  • 论文arXiv

    IAU-FOA:面向闭源多模态大模型的可迁移对抗攻击方法

    研究者提出 IAU-FOA,一种面向闭源多模态大模型(MLLMs)的可迁移定向对抗攻击方法。现有定向迁移攻击主要用编码器 [CLS] 嵌入等全局图像级特征对齐对抗样本与目标样本,对 patch 级视觉结构利用不足,限制了跨异构闭源 MLLMs 的迁移性。IAU-FOA 同时在全局和局部对齐:用基于余弦的目标缩小全局语义差距,将 patch token 聚类为紧凑局部模式并通过最优传输匹配。针对均衡最优传输在缺乏可靠对应局部簇上强制固定边际质量、可能引入误导性对齐梯度的问题,作者引入置信度自适应非均衡传输,对弱匹配簇放宽约束。此外提出视觉不变性增强,通过双向像素强度缩放和逐通道白平衡调整模拟曝光、对比度、光照和色温变化。

  • 论文arXiv:可解释性

    研究揭示 Transformer 拒答机制中的组件与维度稀疏性

    研究将拒答激活引导分解为组件级干预,在四个开源权重模型上识别出足以复现完整行为效果的稀疏注意力与 MLP 组件子集。这些拒答方向集中在占上游组件 28% 至 48% 的稀疏机制中,仍保留 88% 至 101% 的引导效果;在这些机制内部,有效引导进一步集中在约 50% 的残差流维度上,保留组件机制基线的 85% 至 98%,与存在特权基结构的判断一致。作者据此认为拒答并非弥散编码于整个 Transformer,而是由结构化、可识别的机制组装而成,并将代码与原始实验结果开源在 https://github.com/wang-research-lab/Refusal_Mechanisms。

  • 论文arXiv:危险能力与安全评测

    研究者提出读取路由 logits 的 MoE 视觉语言模型多模态安全检测器

    研究者提出一种轻量级路由 logits 安全检测器,在提示词预填充阶段读取 MoE 视觉语言模型的专家路由信号,在生成前判断多模态请求是否安全,且不修改模型参数或专家路由。作者发现路由 logits 对多模态输入是否安全具有很高的预测性。在 Qwen3-VL 和 Kimi-VL 上,该检测器显著降低了 HoliSafe 基准上的安全错误,并泛化到安全模式不同的分布外基准 MISHard 和 MM-SafetyBench。作者认为,相比通过提示、监督微调或路由专家引导来干预模型行为与内部状态,直接读取自然涌现的信号并接入外部安全机制,可作为现有安全干预的简单、有效且非侵入式的补充。

  • 论文论文追踪

    PEV 攻击利用嵌入向量加噪越狱六款开源权重模型

    研究针对开源模型输入表示受到扰动时的拒答失效风险,提出PEV方法并在受控基准中测试多个模型,报告产生不安全输出的结果。结论限于作者的实验设置。

  • 论文论文追踪

    研究评测 32 个 LLM 的代码功能与安全差距:新模型更安全但无一消除差距

    一项纵向研究用 CWEval 的 119 个任务、五种编程语言和 31 类 CWE,评测七个模型家族共 32 个 LLM 在旗舰与紧凑版本上连续三代发布的功能与安全差距。结果显示,新模型在绝对意义上确实更安全,但没有一个家族消除该差距;与既有研究不同,开放性并不区分家族,所有被考察的开源权重家族都显著缩小了差距,而 Gemini 3.1 Pro 的差距与 Llama 此前报告的同样宽。紧凑模型通常比旗舰版本生成更不安全的代码,Gemini 3.7 Flash 等是明显例外。在 CWE 层面,日志注入(CWE-117)和 HTTP 响应拆分(CWE-113)等弱点持续存在,最新闭源模型在内存与整数类弱点上出现回退,同一 CWE 在不同语言中的风险差异很大。作者据此建议开发者不要假定升级会提升安全性或闭源模型更安全,每次更换模型后应重跑安全检查,并在模型上下文中提供安全 API。

  • 论文论文追踪

    TRACE:仅凭 checkpoint 更新审计大语言模型有害目标

    研究者提出 TRACE,一种只读取 checkpoint 更新的权重审计方法,无需模型查询,也不需要接触未知的 SFT 数据。研究发现有害合规 SFT 会在 checkpoint 更新空间留下连续、依赖目标的排序:以纯有害合规、安全目标和良性效用三类 SFT 定义参考几何后,checkpoint 级坐标 s_H 能追踪受控的有害目标组成,在四个 7-8B 基座模型上 Spearman 相关系数为 0.986-0.992,更大模型规模上排序依然保持。对照实验显示该痕迹反映的是 SFT 目标而非有害输入暴露,也排除了有害样本数量或训练强度的简单解释。在分布偏移、未见数据、不同 SFT 配置、部分 checkpoint 访问以及 LoRA 与全参数微调下,该痕迹保持稳定,并与独立测得的攻击成功率正相关;在有害目标占比较低时仍有信息量。代码已公开。

  • 论文Hugging Face Daily Papers

    研究发现类型化决策模型主要按选项标签而非定义作答

    研究者对开放权重类型化决策模型及语言模型进行对照评测,发现部分模型会优先遵循选项标签的语义,而非定义中的规则。作者通过输入渲染的对照修改,将偏差与标签是否进入模型输入关联起来;所测 VON 在原设置下不受同样影响。研究未直接测试闭源商业 Jev 模型,合成评测结果不能直接代表所有部署场景。

  • 论文论文追踪

    研究者提出 Privacy-Leaking Watermarks,可在本地多模态模型中泄露对话隐私

    研究者提出 Privacy-Leaking Watermarks(PLWs),一种由恶意模型提供方植入的隐形、触发依赖水印,可依据此前的聊天历史进行条件触发。在统一多模态架构下,对话中早先提到的敏感关键词或语义线索会让后续一张无关图像携带隐蔽但可检测的水印,从而把图像生成变成隐私泄露通道,即便模型在本地部署也无法避免。在 13 种敏感属性触发条件和两个模型家族上,PLWs 在 1% FPR 下最高达到 100.0% TPR;例如 OmniGen2 在所有测试的对话间隔下都能检出此前披露的抑郁信息,而对未披露此类信息的图像误报率仅 1%。

  • 论文论文追踪

    SWE-CC 基准:编码 Agent 功能正确仍违反 43.1% 仓库贡献规范

    研究者提出 SWE-CC 基准,用于评估自主编码 Agent 对开源仓库贡献规范的遵守情况。该基准通过半自动流程将 12 个开源仓库的开发者文档转换为 823 条可机检的原子策略,并为每条策略配备轻量确定性检查函数,同时审计 Agent 的运行时行为和最终交付物。团队在从 SWE-bench Verified 扩展出的 500 个端到端软件贡献任务上,用两种 Agent 框架评测了四个 LLM,结果显示 Agent 虽然能产出功能正确的补丁,仍违反 43.1% 的适用项目策略,且近一半违规发生在中间执行步骤。研究指出功能正确并不等于可实际合并,编码 Agent 需可靠遵循仓库治理规范才能安全部署。

  • 论文Hugging Face Daily Papers

    研究显示拆分学习中的梯度可提升客户端文本重建率

    研究者在拆分学习场景下测量了梯度对客户端文本泄露的贡献。在 GPT-2 上,仅凭客户端层的公开权重,攻击者从激活值中恢复 94.20% 的 token,同时看到梯度后升至 97.38%,提高 3.17 个百分点,95% 区间为 [2.72, 3.64]。按文档统计差距更大:32 token 的文档中,无梯度时 13.71% 被完整重建,有梯度时为 37.77%,因为文档需每个 token 都正确才计入。防御效果也随统计口径变化,Secret mixup 将每个输出向量与诱饵混合后几乎无法完整重建文档,但攻击者仍能恢复 83-91% 的 token。在 GPT-2 与 Qwen3-0.6B 的第二组实验中,服务器只训练连续若干层时,起始层位置在层数固定情况下同时影响模型质量与泄露程度。 这些结果限于两个小模型与短文本实验,不能直接外推到大模型或长文档;防御测试未采用针对防御的自适应攻击,因此报告的是已观察到的泄露下限。

  • 论文Hugging Face Daily Papers

    自生成反馈会破坏测试时训练:长时程适应的因果分解

    作者研究模型在推理时持续从自身输出学习所形成的反馈回路,在 128K token 流上测试了 125M 到 3B 的 TTT-E2E 模型以及基于 Adam 的 Qwen3-4B 适应过程。结果显示反馈是损害的主要来源:改用冻结模型生成训练文本,在 125M 和 760M 上消除了超过 98% 的损害,即使学习器仍在生成文本上更新。更好的源拟合可能意味着更差的迁移,一次更新可以改善对训练段落的预测,却损害独立的真实文本。作者提出的 Settlement 测试会在保留候选更新前用独立文本进行验证,显著降低损害同时保留真实文本上的适应能力,代码已开源于 GitHub。

  • 论文论文追踪

    研究揭示代码注释中的上下文注入攻击面:十款 Code LLM 中招率达 77.4%–92.3%

    研究者提出代码注释中的上下文注入攻击面,测试不安全指令嵌入开发上下文后能否诱导 Code LLM 生成漏洞代码。在十款 3B–13B 开源 Code LLM(四款基座、六款指令微调)和十类 Web 应用弱点上,攻击条件下 77.4%–92.3% 的补全含中等及以上弱点,良性条件仅 1.7%–5.1%。基座与指令微调模型平均漏洞输出率分别为 86.5% 和 84.5%,指令微调后降幅最多 8.1%,且易感性与模型规模或专精方向无明显关联。在易受攻击的输出中,86.2%–91.0% 被评为高或严重级别,去掉基于模式的检测器后效应依然存在。生成后筛查能降低但无法消除风险,最强筛查仍漏掉约三分之一。

  • 论文arXiv

    AVCE:面向扩散模型可验证概念擦除的审计感知遗忘框架

    研究者提出 AVCE(Auditing-Aware Unlearning for Verifiable Concept Erasure in Diffusion Models),一种把概念擦除落到模型潜空间表征的遗忘框架。作者指出,多数擦除方法只在文本接口干预,通过提示词修改或文本条件权重的局部更新实现,并以给定提示词下的输出作为评估依据,而潜空间审计绕过文本条件直接探测去噪网络,显示被擦除概念仍可从内部表征中恢复,这一问题在抗对抗提示词的方法中同样存在,且随擦除概念数量增加而加剧。AVCE 审计每个概念的嵌入向量邻域,将发现的脆弱方向压缩为最弱几何点上的锚点,在该锚点以闭式解编辑交叉注意力和自注意力投影,再用路径级审计损失微调两条路径,并通过正交梯度投影整合多个概念。

  • 论文论文追踪

    研究者披露 LiteLLM 网关跨租户干扰攻击 Cooldown Landmines

    题为 Cooldown Landmines 的研究讨论 LLM 网关中的跨租户干扰。

  • 论文arXiv:可解释性

    研究者提出闭环偏见注入攻击,可将 LLaDA-8B 的 BBQ 目标差距从 1.8 提升至 16.7 个百分点

    研究者提出针对掩码扩散语言模型(dLLM)的定向偏见注入攻击:由于 dLLM 在提交答案前会多次重新预测同一位置,攻击者可在去噪过程中读取目标答案概率,并用比例积分(PI)控制器实时调整一个固定引导向量的强度,从而在不改动权重和提示词的情况下把模型推向指定人口群体。在 LLaDA-8B-Instruct 上,该攻击把 BBQ 模糊问题(正确答案为弃答)的目标与对照选项差距从 1.8 提升到 16.7 个百分点,超过最强固定强度基线三倍以上;在 SocialStigmaQA 上把污名化答案的选择率从 17.6% 提升到 58.1%。同一攻击换用其他人口目标时最多可产生 37 个百分点的偏移,每个目标约需一块 GPU 运行 40 分钟。消融实验显示增益来自反馈本身:与控制器平均强度相同的固定开环只带来 3.5 个百分点差距,却产生 20.8% 的无效输出,而闭环为 7.8%。

  • 论文arXiv:可解释性

    Spatial-SAE:用空间依赖先验改进视觉概念分解

    论文指出稀疏自编码器(SAE)虽基于线性表示假设(LRH),但其目标函数隐含了跨图像 patch 概念相互独立的先验,这一假设与自然图像及其激活不符。作者将 LRH 特化到视觉领域,提出 Markov-Field Linear Representation Hypothesis(MFLRH),补上缺失的空间依赖假设,并据此提出 Spatial-SAE,作为 MFLRH 下的摊销 MAP 估计器。在四个变体上,Spatial-SAE 在合成概念恢复任务中取得 96% 的平均胜率,并在 DINOv2 激活上提升可解释性,重建代价集中在高空间频率。

  • 论文Hugging Face Daily Papers

    研究发现基础模型仅靠固定开头 token 即可达到 RL 级推理表现

    论文发现,固定基础模型回复开头的两个 token 就能让其在数学和代码任务上接近经强化学习训练的同款模型。在 Olmo-3-7B 上,预填 .\n\n Okay 使 MATH-500 pass@1 从 42% 升至 78%,接近 RL 版本的 75%;在 Qwen3-14B 上,␣Alright , 使 pass@1 从 72% 升至 87%,与 RL 版本持平。RL 本身会提高这些 cue 的生成概率,且预填 cue 可让 RL 用更少步数达到同等准确率。在安全场景中,不同开头 token 会引发不同的拒答与顺从行为,例如 .\n\n Okay 比 ␣Okay , 更倾向于选择性拒答,后者在不安全请求上的有害回复率为 42.4%,前者仅 0.2%。

  • 论文论文追踪

    论文提出用路由梯度敏感度定位稀疏 MoE 模型中的安全敏感专家

    论文指出,抑制稀疏 MoE 大语言模型中少量被路由的专家即可在不重训练的情况下削弱其安全行为,而常用的激活频率只反映使用程度、不反映影响力。作者改用路由梯度敏感度,即序列损失对选择专家的门控权重的敏感度,在五种 MoE 架构上分别用 500 条良性提示和 500 条恶意提示对专家排序,并在 100 条留出恶意提示上测量拒答率,采用相同专家数量和相同恶意路由流量(1%-5%)两种预算。在两种预算下,路由梯度选择在 25 种条件中的 24 种比激活频率带来更大拒答下降,在全部 25 种中超过十次随机试验的均值。效果最大的是 OLMoE,拒答从 100 条中的 34 条降至 9 条(相对下降 73.53%),且输出质量未退化。逐层匹配专家数量后,梯度选择仍在 25 种条件中的 23 种优于激活频率,另有 2 种持平。

  • 论文arXiv

    RMCW:基于 Reed-Muller 码的抗删除 LLM 水印方法

    研究者提出 RMCW,一种基于 Reed-Muller 码的大语言模型水印方法,用于应对删除攻击导致的 token 位置偏移和水印对齐失效。生成阶段通过密钥化的词表划分把 Reed-Muller 结构注入文本序列;检测阶段将文本映射到密钥词表分箱,并用 Berlekamp-Welch 检验测试局部子序列的低次 Reed-Solomon 一致性,从而寻找存活的局部代数结构而非恢复全局码字。在 C4 和 ELI5 数据集、OPT-1.3B 与 Llama-3.1-8B-Instruct 上的实验显示,RMCW 保持较强的干净文本可检测性,并在多种删除与改写攻击下优于或持平基线方法。代码已开源于 https://github.com/BaichengDanny/RMCW。

  • 论文arXiv:越狱、提示注入、投毒与防御

    研究者提出意图隐藏越狱的信息论框架,分析组合式攻击

    研究者从信息论角度研究组合式意图隐藏越狱,即把有害请求嵌入看似无害的更大查询中以绕过拒答。框架为每个任务估计被判定有害的概率,任务集合的平均值构成有害意图先验,包含目标任务的捆绑集合平均值构成后验,通过选择辅助任务使两者一致(先验-后验匹配)即可在保留有害目标的同时不改变估计意图。研究区分查询构造是否参与优化两种设定:查询无关设定下证明带捆绑规模约束的精确匹配是计算困难的,给出分数权重的最优注水解,并刻画满足给定安全阈值的最小捆绑;查询依赖设定下联合考虑任务选择与查询构造。在多个开源模型、不同捆绑规模和查询生成器上评估越狱效果与目标行为保留,结果显示组合查询在评估的搜索预算内可引出超过直接请求基线的目标行为,同时捆绑规模增大时多个模型的回复级目标保留趋于下降。

  • 论文论文追踪

    研究:异构 AI 模型间的说服效果取决于配对而非模型规模

    一项研究测量了不同 AI 模型在意见分歧时的说服效果,发现当模型意见不一致时,接收方往往在看到同伴的答案和解释后放弃自己的初始判断。研究测试了七个开源权重模型在三个语言理解任务上的表现,发现单独的确定性或模型规模都无法可靠预测说服动态:在孤立状态下决策几乎完全一致的模型可能最容易受说服,小模型作为说服者可以匹敌大模型,也能同样有效地抵抗影响。研究还表明,判断偏移的大小更多取决于听者的易感性而非说者的说服力,说服模式因模型配对而异,异构性在某些组合中放大说服、在另一些组合中抑制说服,使运行小模型的异议智能体能够推翻大得多的模型的判断。研究结论是,交互模型的行为无法从其个体属性推断,必须在它们实际运行的组合中评估。

  • 论文arXiv:危险能力与安全评测

    SceneFactory-3D:将 2D 交通场景提升为 3D 物理反事实以做安全评测

    研究者提出 SceneFactory-3D,一个 GPU 批量、物理落地的多智能体驾驶仿真器,车辆通过悬挂与摩擦受限的力在每个轮胎接触点执行加速和转向指令,空间变化的摩擦、逐世界 3D 高度场、重力与刚性接触共同约束车轮运动和底盘碰撞。逐世界地形隔离与 GPU 批量使其能并行运行匹配的物理反事实:交通场景设置和车辆控制器保持不变,只改变路面条件,从而在并行世界中评估闭环影响。作者据此对车辆控制器对路面条件的敏感性做了实证研究,在每种条件下 1024 个匹配的 12 车世界、21 种摩擦与坡度条件下测试三类学习策略,并在共享的 32 世界子集上测试两种经典规划器。当摩擦从 1.0 降至 0.18 时,学习策略安全通过施工区的车辆比例下降 6 至 90 个百分点,经典规划器下降 18 至 19 个百分点,且每种学习策略的接近碰撞情形都更频繁。代码已开源于 GitHub。

  • 论文arXiv:对齐、欺骗与监督

    用偏好奖励与评分标准奖励组合后训练前沿文生图模型

    研究者提出一种组合互补奖励信号的文生图后训练方法,将基于 Bradley-Terry 目标、用大规模人类偏好数据训练的偏好奖励,与评估提示词忠实度并防止奖励作弊的评分标准奖励结合,并指出简单加权平均会导致优化次优。在 Arena 文生图排行榜上,经 RL 训练的 Flux2dev 的 Elo 比基座模型高 69 分,后训练的 Ideogram-4 以 1223.5 的 Elo 超过所有开源模型(SOTA 声明基于 2026 年 9 月 4 日的排行榜快照)。团队同时发布 1K 子集 Arena-T2I-Training 以支持可复现研究。

  • 论文论文追踪

    MLCommons 发布 Jailbreak Benchmark v1.0,八款开源模型平均韧性差距 7.57%

    MLCommons 发布 Jailbreak Benchmark v1.0,对八款开源权重模型做单轮文本越狱评测,不安全回复率从基线的 11.08% 升至攻击条件下的 18.65%,平均韧性差距 7.57%。评测覆盖暴力犯罪、无差别武器、仇恨、儿童性剥削等 11 类危害,每类 24 条种子提示词共 264 条,并实现 12 种越狱攻击,其中内容框架与欺骗类因评测器限制未纳入定量分析。角色扮演、模板以及包装或 schema 类攻击的平均攻击成功率最高;31B 参数以下的可及模型平均差距约 21%,但样本量小,结论仍属初步。三款 Large 类模型出现负韧性差距,即攻击条件下的不安全回复率低于基线,作者认为可能来自评测器行为、解码设置、真实鲁棒性或模型针对越狱特征而非违规内容本身的拒答。