全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文论文追踪USENIX Security 2026
论文指出密码学模型认证的假设缺口:审计通过但部署失效
论文《Certified in Theory, Broken in Practice》指出,基于安全零知识证明(ZKP)的密码学模型认证(CMC)方案存在假设缺口:现有安全定义只保证模型在固定审计数据集上的行为,未保证同一分布的其他数据上同样成立。作者据此构造攻击,通过精心设计训练数据,使模型在审计中表现正常、部署后出现病态行为,实验显示攻击者可认证模型在审计集上准确率超过99%,而在同分布新样本上不足30%。为弥补该缺口,作者形式化了面向 CMC 框架的密码学安全定义,提出通用协议模板并证明其满足这些要求。作者认为该结果既是对现有方案的警示,也为设计安全、隐私保护的机器学习审计协议提供了建设性指引。
- 会议论文ACL 2026
ImF:在大语言模型中嵌入隐式指纹
形式化针对模型指纹的移除攻击 GRI,并提出基于语言隐写的隐式指纹 ImF,在 15 个 LLM 上更隐蔽且可抵御更新与提示干预。
- 会议论文ACL 2026
PARASITE:通过条件式系统提示投毒劫持 LLM
指出第三方系统提示市场的供应链风险,黑盒优化出仅对特定查询输出被操纵回答的投毒提示,目标查询 F1 最多下降 70%,且能绕过困惑度过滤等防御。
- 会议论文ICLR 2026
利用基于秩的均匀性检验审计黑盒大语言模型 API
提出无须模型权重与概率的RUT检验方法,可高效审计并检测黑盒API服务中的有害微调与模型篡改。
- 会议论文ICML 2026
狐入鸡舍:针对强化学习的供应链后门攻击
提出 SCAB,仅通过黑盒交互数据污染第三方策略训练;3% 数据污染即可达 90% 以上攻击成功率,并使受害者回报下降 80%。
- 会议论文ICML 2026
SOPE:面向MCP智能体的情境感知与统计不可区分隐私窃取框架
揭示了MCP工具扩展引入的供应链漏洞,提出SOPE框架将良性MCP服务转化为窃密变体,通过情境感知提示探测与无点击传输,实现隐蔽的智能体隐私外泄。
- 会议论文NDSS 2026
缓存陷阱:LLM服务框架中的缓存安全威胁
系统发现LLM推理缓存中的六类攻击向量,可投递恶意内容或绕过安全检查,并提出五种分层防御策略。
- 会议论文IEEE S&P 2026
EnchTable:微调大语言模型中的统一安全对齐迁移
- 会议论文USENIX Security 2026
超越星标:GitHub 上诈骗仓库的多模态检测
提出 OctoWatch,融合元数据文本与交互结构特征,线上发现14,667个未被 OSINT 收录的恶意仓库并促成下架。
- 会议论文USENIX Security 2026
识别文生图模型的来源谱系
仅用黑盒查询,通过输出视觉特征分布的 JS 散度与假设检验判断模型是否由微调而来及其基座;在图像后处理或权重扰动下仍准确。
- 会议论文USENIX Security 2026
捉迷藏的艺术:让基于 Pickle 的模型供应链投毒重新变得隐蔽
系统梳理 pickle 模型投毒攻击面,发现 22 条加载路径中 19 条被现有扫描器漏检,并找到 133 个可利用 gadget,绕过率接近 100%。
- 会议论文USENIX Security 2026
野外恶意Agent技能的检测与理解
分析98,380个Agent技能,确认157个恶意技能及632项漏洞,并揭示凭证窃取和指令操纵两类主要攻击策略。
- 会议论文USENIX Security 2026
通过微调轨迹中一致的知识演化证明模型谱系
结合模型编辑与知识向量化,验证微调带来的参数修改与知识演化是否一致;可在分类器、扩散模型和 LLM 上稳健验证谱系,应对未授权再分发。
- 会议论文ACL 2025
LLM 供应链中通过排列触发器劫持系统提示
提出 SHIP 攻击:供应方植入需按精确顺序出现才激活的排列触发器,绕过部署方系统提示,在八个模型上 ASR 最高达 100% 且能抵御六种防御。
- 会议论文ACL 2025
ESF:面向 LLM 黑盒篡改检测的高效敏感指纹
提出首个面向 LLM 黑盒篡改检测的指纹方法,仅用 5 个指纹样本即可以超过 99.2% 的检出率发现微调、压缩与后门注入。
- 会议论文ACM CCS 2025
PickleBall:基于 Pickle 的机器学习模型安全反序列化
- 会议论文ACM CCS 2025
潜伏何物?大规模共享扩散模型的概念审计
- 会议论文ACM CCS 2025
Sentry:即时认证机器学习制品
- 会议论文ACM CCS 2025
ImportSnare:检索增强代码生成中的定向“代码手册”劫持
- 会议论文ICML 2025
Mind the Gap:针对 GGUF 量化的实用攻击
利用量化误差提供的自由度,构造在全精度下看似正常、量化后表现恶意的模型;在三个模型、九种 GGUF 类型上实现不安全代码生成、内容注入和拒答等攻击。
- 会议论文ICML 2025
硬件与软件平台推断
仅凭黑盒 LLM 的输入输出数值模式推断底层 GPU 与软件栈,白盒下区分 GPU 准确率 83.9%–100%,可用于验证服务商是否以廉价硬件或模型冒充。
- 会议论文NeurIPS 2025
CoreGuard:在边缘部署中保护 LLM 核心能力免遭模型窃取
提出计算与通信开销都很低的保护方法,防止边缘部署的专有 LLM 被提取权重或被微调利用,实验显示安全保护达到上界且开销可忽略。
- 会议论文IEEE S&P 2025
BAIT:通过反演攻击目标扫描大语言模型后门
- 会议论文USENIX Security 2025
我们有个包给你!代码生成 LLM 的包幻觉全面分析
评估 16 个 LLM 生成的 57.6 万代码样本,商业模型幻觉包率至少 5.2%、开源模型 21.7%,并验证了缓解策略。