全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 论文论文追踪
潜空间图像水印在几何变换下的鲁棒性上限
论文从理论与实验两方面讨论潜空间图像水印在几何变换下的鲁棒性限制,指出这类水印的鲁棒性存在上限。
- 论文论文追踪
STCA:自动驾驶视频模型对抗鲁棒性研究
一项名为 STCA 的研究针对自动驾驶视频视觉语言模型,考察可迁移的黑盒对抗风险。该工作聚焦黑盒条件下对抗样本的跨模型迁移能力,用于评估此类视频模型在真实攻击场景下的鲁棒性。
- 论文论文追踪
研究:无关信息污染患者病历并干扰LLM临床推理
一项研究在医患对话及模拟诊室音频中测试无关信息对AI病历生成的影响,发现闲聊和旁人病情会被写入病历或错误归属,而常规质量分数变化不大。研究结果由LLM裁判判定,未经医生复核,也未测试真实诊疗损害或医生签字前能否发现错误。
- 论文arXiv
IAU-FOA:面向闭源多模态大模型的可迁移对抗攻击方法
研究者提出 IAU-FOA,一种面向闭源多模态大模型(MLLMs)的可迁移定向对抗攻击方法。现有定向迁移攻击主要用编码器 [CLS] 嵌入等全局图像级特征对齐对抗样本与目标样本,对 patch 级视觉结构利用不足,限制了跨异构闭源 MLLMs 的迁移性。IAU-FOA 同时在全局和局部对齐:用基于余弦的目标缩小全局语义差距,将 patch token 聚类为紧凑局部模式并通过最优传输匹配。针对均衡最优传输在缺乏可靠对应局部簇上强制固定边际质量、可能引入误导性对齐梯度的问题,作者引入置信度自适应非均衡传输,对弱匹配簇放宽约束。此外提出视觉不变性增强,通过双向像素强度缩放和逐通道白平衡调整模拟曝光、对比度、光照和色温变化。
- 论文arXiv:越狱、提示注入、投毒与防御
研究审计 Qwen2-Audio 音频越狱 AdvWave-P 的频率与解码层归因
研究者在 Qwen2-Audio 上审计加性音频越狱 AdvWave-P 的频率与解码层归因,在 STFT 域遮蔽扰动的频率成分并测量攻击成功率与音频跨度表示。在 520 条 AdvBench 提示上,主评判将 76.7% 的对抗输入标为越狱;单标注者盲条件验证给出 Rogan-Gladen 灵敏度估计 0.87(约 0.83-0.95),该校正未应用于遮蔽条件。表观频率排序依赖划分方式:仅能量占比即可预测标准八频段排序(Spearman's rho = 0.95),等 Hz 与等能量划分显示遮蔽任一测试频段都可能大幅降低攻击成功率;在更细的 16 频段等能量分辨率下,遮蔽 7520-7960 Hz 窄频段后 ASR 仍为 0.10,缺少匹配对照尚无法解释。匹配能量的分散移除测试显示,连续移除在低频段破坏更大,两种形式在高频段都接近下限。该关联并非因果定位,单层修补也不能确立因果层。
- 论文arXiv:越狱、提示注入、投毒与防御
研究揭示投机解码的安全代价并提出 SecureSD 加固方法
研究对投机解码的安全影响做了系统性测量,发现存在明显的安全与效用不对称:在多种有损投机解码方法中,推理效率提升带来的越狱和提示注入攻击成功率上升速度远快于效用下降。作者据此提出 SecureSD,理论分析指出安全退化主要来自 draft model 生成的早期 token,因此对早期解码位置的 draft token 采用更严格的验证标准。在安全与效用基准上的实验显示,SecureSD 在保持效率和效用的同时显著提升安全性。
- 论文arXiv:越狱、提示注入、投毒与防御
ATLAS:用自适应信任域与主动学习搜索潜在对抗样本集
ATLAS 是一个基于查询的黑盒对抗攻击框架,将攻击生成建模为主动学习中的水平集估计问题,结合校准近似与局部-全局采样架构定位并采样包含对抗样本的输入区域。在 MNIST、CIFAR 和 ImageNet 的标准与对抗训练模型上,ATLAS 生成的对抗样本比 NES、SignHunter、BayesOpt 等查询式黑盒攻击更具代表性,并在有限查询预算下覆盖更多对抗区域。该框架可用于开发中系统的鲁棒性分析与持续审计。
- 论文arXiv:越狱、提示注入、投毒与防御
研究受控拆解图像到文本越狱中图像属性的作用
研究者在 313 条 StrongREJECT 提示切片上,用五个多模态模型(附录另测 InternVL3.5-8B)考察四类已发表攻击家族中的图像侧因素,并保持有害指令不变。结果显示,单独的有害查询无论是否配无关良性图像,在多数模型上攻击成功率都很低,而攻击图像会显著提高成功率。逐 tile 熵和 JPEG 体积无法可靠区分攻击 tile 与体积匹配的良性干扰图,限制了仅靠密度筛查的做法;此前的 tile 数量阶梯实验受载荷可见性混淆,修正后的区域数量测试未发现可检测效应。在 Qwen3-VL-8B 上,移除查询相关性的 E4 操作使攻击成功率下降约 0.12,支持将部分效果归因于相关性操作,但图文一致性仍未测量。五项测试通过全局统计校正,仅 E4 支持归因到单一测量描述符,结论仍以评分标准判定为前提。
- 论文论文追踪
PEV 攻击利用嵌入向量加噪越狱六款开源权重模型
研究针对开源模型输入表示受到扰动时的拒答失效风险,提出PEV方法并在受控基准中测试多个模型,报告产生不安全输出的结果。结论限于作者的实验设置。
- 论文论文追踪
SkillPoison:用成功经验投毒自进化 Agent 的技能形成
吉林大学等机构的研究者提出 SkillPoison,一种针对自进化 LLM Agent 技能形成过程的投毒框架,在三个基准上最高达到 95.71% 的攻击成功率。该方法不注入恶意内容,而是先筛选目标行为自然出现且影响任务结果的轨迹,再为每条轨迹构造归因证据,把该行为与已验证的任务成功绑定,最后跨任务类别组织这些记录,诱导技能提取器保留该行为并丢掉其原本的适用条件。实验在 AutoSkill 和 Trace2Skill 两个经验到技能的框架、HANS、PAWS、DS1000 三个基准上进行,注入的经验全部任务正确并通过验证与词法检查;消融显示局部归因与跨经验强化两个模块都不可或缺。作者指出,技能形成过程需要保留行为的上下文适用条件。
- 论文论文追踪
研究者提出答案侧后门:让模型自生成触发词绕过安全拒答
研究提出答案侧后门:模型生成的回答可能在后续对话中诱发拒答失效,因此仅检查用户输入的防御可能遗漏风险。作者在多个开源模型的受控评测中报告较高攻击成功率,同时保留部分常规能力表现。结果限于论文的投毒与评测设置,不能直接外推为未经过相关处理的公开模型同样存在该后门。
- 论文论文追踪
研究揭示策略蒸馏的安全后门风险:3% 投毒率可致 70% 攻击成功率
一项 arXiv 论文发现,安全对齐但被植入后门的教师模型会在 on-policy distillation(OPD)过程中把隐藏的恶意行为传递给原本干净的学生模型。在作者设定的威胁模型下,仅 3% 的投毒率就能让蒸馏后的学生模型达到最高 70% 的攻击成功率。研究进一步指出两个放大风险的因素:增加训练轮数会让低投毒率也产生高攻击成功率,仅 10 个投毒样本训练 16 轮后攻击成功率即达 67%;常用的 top-k KL 相比 sampled-token KL 会加速后门传递,使触发条件下的有害行为更早出现。作者还尝试了一种简单缓解方法 Lazy Defense,通过裁剪 KL 奖励让学生的更新不那么激进,实验显示它能在低投毒率场景下延缓后门传递。
- 论文论文追踪
CORSA:面向技能路由器的技能注入攻击可跨路由器与 LLM 迁移
论文指出,现有针对 Agent 第三方技能提示注入的评测常假设恶意技能已被选中执行,这会明显高估攻击成功率;在真实多技能环境中,注入技能需先竞争检索,使已有注入的有效攻击成功率下降 87-97%。作者提出 CORSA(Cluster Optimization for Router-Aware Skill Attacks),一种感知路由器的攻击方法,针对相关任务簇同时优化技能的检索与执行。研究将 SkillRouter 的基准扩展出八类恶意载荷,用分阶段优化先提升检索再优化端到端攻击成功率,并分别评估用户效用与注入自然度。实验显示 CORSA 在保持用户效用的同时提升了检索与端到端攻击成功率,且攻击可迁移到不同路由器架构和 LLM 底座。
- 论文论文追踪
PersistBD:攻击者可在发布前强化后门,使其在开发者 SFT 与 RL 后仍保持高攻击成功率
PersistBD研究第三方模型中的后门能否延续至下游软件工程智能体训练。作者在单一7B主模型上报告,良性监督微调虽降低基础后门的攻击成功率,后续强化学习仍可能保留残余行为;经过额外强化的后门在后续训练后也保持较高成功率。研究提示,开发者不能假定正常后训练会消除继承权重中的后门,供应链安全仍需独立检测。
- 论文论文追踪
MemLeak 研究:多租户 Agent 共享向量记忆库存在跨用户记忆泄露
Workday AI Research 的 MemLeak 研究指出,企业多租户个人 Agent 若共享同一向量记忆库,普通余弦相似度检索即可把其他用户的记忆拉入当前会话,无需任何漏洞利用。在池化同团队检索下,非对抗性泄露率达 70–100%;精心构造的记忆在 top-k 中占比 90–100%,生产级稠密检索下得分提升 +0.416 至 +0.511;端到端响应污染最高达 5.00/5,且被污染的回答常被评为同样或更有帮助。研究测试了三种缓解方案,只有检索后硬性归属门控能在两个生成模型上把污染恢复到 1.00/5 的干净基线,每次查询延迟开销约 1.4 ms。作者强调这是受控概念验证,样本为每条件 10 条查询,不代表真实企业泄露率。
- 论文论文追踪
研究者提出 Privacy-Leaking Watermarks,可在本地多模态模型中泄露对话隐私
研究者提出 Privacy-Leaking Watermarks(PLWs),一种由恶意模型提供方植入的隐形、触发依赖水印,可依据此前的聊天历史进行条件触发。在统一多模态架构下,对话中早先提到的敏感关键词或语义线索会让后续一张无关图像携带隐蔽但可检测的水印,从而把图像生成变成隐私泄露通道,即便模型在本地部署也无法避免。在 13 种敏感属性触发条件和两个模型家族上,PLWs 在 1% FPR 下最高达到 100.0% TPR;例如 OmniGen2 在所有测试的对话间隔下都能检出此前披露的抑郁信息,而对未披露此类信息的图像误报率仅 1%。
- 论文Hugging Face Daily Papers
研究显示拆分学习中的梯度可提升客户端文本重建率
研究者在拆分学习场景下测量了梯度对客户端文本泄露的贡献。在 GPT-2 上,仅凭客户端层的公开权重,攻击者从激活值中恢复 94.20% 的 token,同时看到梯度后升至 97.38%,提高 3.17 个百分点,95% 区间为 [2.72, 3.64]。按文档统计差距更大:32 token 的文档中,无梯度时 13.71% 被完整重建,有梯度时为 37.77%,因为文档需每个 token 都正确才计入。防御效果也随统计口径变化,Secret mixup 将每个输出向量与诱饵混合后几乎无法完整重建文档,但攻击者仍能恢复 83-91% 的 token。在 GPT-2 与 Qwen3-0.6B 的第二组实验中,服务器只训练连续若干层时,起始层位置在层数固定情况下同时影响模型质量与泄露程度。 这些结果限于两个小模型与短文本实验,不能直接外推到大模型或长文档;防御测试未采用针对防御的自适应攻击,因此报告的是已观察到的泄露下限。
- 论文论文追踪
TranScope:利用 CPU 性能计数器对 Transformer 做成员推断攻击
TranScope 研究硬件侧信道可能带来的模型成员推断风险,即硬件层面的信息泄露是否能够暴露某条数据参与过模型训练。
- 论文论文追踪
NeuroSploit v4.2.0 在 GOAD 上的评测:结构化智能体编排提升 AD 渗透测试
开源 Rust 自主渗透测试框架 NeuroSploit v4.2.0 在 GOAD 靶场(5 台虚拟机、2 个森林、3 个域)上完成评测,其编排 22 个 AD 专用智能体与 7 套多阶段攻击链 playbook,覆盖枚举、Kerberoasting、AD CS(ESC1-ESC8)、DCSync、跨森林信任滥用等完整杀伤链。对 Claude Opus 4.6/4.7/4.8、GPT-6 Astra、GPT-5.6 Sol、Grok 4.6、Qwen 3.8、GLM 5.3、Kimi k3 九个前沿模型的测试显示,框架实现 96-100% 技术覆盖率与 90-97% 精确率,直接调用仅覆盖 21-54% 且误报多出 3.2 倍;使用 Opus 4.8 时 134 分钟完成三域完全攻陷,护栏机制阻止了触发锁定的喷洒、未授权 DCSync 转储与越界侦察。
- 论文论文追踪
研究者提出 Reward Stealing Attack,从对齐模型行为反推安全奖励实施攻击
研究者提出 Reward Stealing Attack(ReSA)框架,针对 LLM 对齐背后的潜在安全奖励发起对抗攻击。该方法用最大熵逆强化学习,仅凭对齐模型的行为恢复出一个代理奖励模型,再在推理阶段将该奖励反向,通过奖励引导的解码机制得到对抗策略。实验显示,单个恢复出的奖励可跨提示词和多种模型泛化,ReSA 在攻击有效性和可迁移性上明显优于现有方法,论文认为这揭示了对齐层面的一个根本性脆弱点。代码已公开,论文共 19 页。
- 论文论文追踪
研究揭示代码注释中的上下文注入攻击面:十款 Code LLM 中招率达 77.4%–92.3%
研究者提出代码注释中的上下文注入攻击面,测试不安全指令嵌入开发上下文后能否诱导 Code LLM 生成漏洞代码。在十款 3B–13B 开源 Code LLM(四款基座、六款指令微调)和十类 Web 应用弱点上,攻击条件下 77.4%–92.3% 的补全含中等及以上弱点,良性条件仅 1.7%–5.1%。基座与指令微调模型平均漏洞输出率分别为 86.5% 和 84.5%,指令微调后降幅最多 8.1%,且易感性与模型规模或专精方向无明显关联。在易受攻击的输出中,86.2%–91.0% 被评为高或严重级别,去掉基于模式的检测器后效应依然存在。生成后筛查能降低但无法消除风险,最强筛查仍漏掉约三分之一。
- 论文arXiv
TAPDreamer:可跨任务迁移的世界动作模型对抗补丁
研究者提出 TAPDreamer,一种针对世界动作模型的对抗补丁攻击,仅用公开编码器构造固定局部扰动,无需查询目标策略即可跨任务和动作架构迁移。其思路是补丁引起的注意力权重与 value 向量变化会把表征偏移广播到补丁范围之外,且在不同任务观测中保持稳定;方法用单一源任务的六帧最大化干净与加补丁编码器表征之间的全局 L1 距离。闭环评测中,每个基准一个冻结补丁覆盖约 6.5% 输入,使 FastWAM 在 40 个 LIBERO 任务上的成功率从 97.7% 降至 0.0%,在 50 个 RoboTwin 任务上从 90.8% 降至 0.0%,而随机补丁仍保持 81.5% 和 79.2%。同一补丁在两个 DreamWAM 配置上把成功率降至 2.1% 和 0.8%,在 Motus 上降至 10.0%。
- 论文arXiv
研究者提出面向深度强化学习的轨迹级可迁移黑盒对抗攻击
论文研究针对深度强化学习(DRL)的基于迁移的黑盒攻击,攻击者在白盒替代智能体上构造观测扰动,再施加给未知受害者策略,并将攻击形式化为每步扰动预算下的回报最小化。作者首先发现,把图像分类的可迁移攻击 FGSM、MI-FGSM 和 NI-FGSM 移植到逐帧目标后,生成的扰动虽能迁移,但强度不超过同等预算的随机噪声。为此他们提出轨迹级攻击,借助可微环境模型和温度平滑的替代策略,在滚动时域上优化一串扰动,并使用相同的优化器。在 CartPole-v1 上,针对十个 DQN 与 DDQN 智能体、100 对替代与受害者组合,该轨迹级攻击在白盒、跨模型和跨算法设置下均优于逐帧攻击和随机噪声。
- 论文arXiv
Tracer 框架可从遗忘后的扩散模型中识别被擦除概念
研究者提出 Tracer 框架,用于识别扩散模型中被遗忘算法擦除的概念并估计其数量,无需事先知道哪些概念被删除。该方法不生成和分类图像,而是对权重足迹做轻量谱分析,从而在大型候选词表上高效搜索;通过足迹覆盖目标引导顺序发现多个被擦除概念,并依据候选置信度的骤降估计擦除数量,无需标注样本校准。框架仅需轻量线性代数和有限前向探测,不依赖对遗忘算法的先验知识。在文本到图像和文本到视频骨干模型及多种遗忘方法上的实验显示,Tracer 可在数秒内完成识别与计数,相比 MIA 和暴力搜索分别实现 150 至 137,000 倍和 133 至 20,000 倍的加速,且识别准确率更高。