研究:跨通道碎片化攻击可绕过 MCP 单通道防御
提出跨通道分段攻击,借 MCP 多通道隐式信任外发敏感数据
- arXiv
- 2609.18217
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 测试
- Llama-3.3-70B、GPT-4o、GPT-4o-mini 等 15 个
摘要论文揭示了 MCP 多通道隐式信任层级,通过跨通道分段与协议级利用突破现有防御,展示了严重的凭证外发风险。
另有 86 篇论文还没打上分类标签,暂不在筛选结果里。
提出跨通道分段攻击,借 MCP 多通道隐式信任外发敏感数据
摘要论文揭示了 MCP 多通道隐式信任层级,通过跨通道分段与协议级利用突破现有防御,展示了严重的凭证外发风险。
提出 ReGap,用自生成伪监督微调恢复模型中的隐私关联
摘要提出无真实私有监督的恢复攻击 ReGap,实验显示微调可通过自生成数据唤醒模型潜在隐私关联,突显后适应隐私风险。
提出匹配比较校准,界定生成训练序列何时算可抽取记忆
Cooper 等人从第一性原理重写 extractable memorization:生成训练文本只有在概率高过匹配非训练文本的可预测性基线时,才支持记忆声称。
提出 PMA,用流形对齐从 E2EO 混淆向量恢复明文
提出端到端全同态加密方案 ODIN,在云端密文上完成推理以保护提示词
ODIN 是面向 Llama 的服务器侧 CKKS 推理系统:客户加密提示词,诚实但好奇的服务器用明文权重在密文上算完 Llama-3,只返回结果密文。
提出混合 CKKS/TFHE 的隐私保护 LLM 解码框架 ROSETTA
ROSETTA 是面向 LLM decode 的混合 CKKS/TFHE 隐私推理框架,目标是在 honest-but-curious 两方设定下,让服务器在密文上完成解码,同时保住权重和用户输入。
提出多草稿水印投机采样 MPFR,同时保持无偏水印与采样效率
MPFR 是一种基于泊松过程的多草稿投机采样,用来同时提高解码效率并嵌入无偏水印。
提出成对无失真水印 TTMARK,增强低熵下的机器文本检测
TTMARK 是一种成对、无失真的文本水印:对相邻 token 的联合分布重加权,而不是逐 token 独立重加权。
提出 UNMERGE,用任务向量低秩分解做概念级遗忘
UNMERGE 把近似机器遗忘写成模型合并的逆运算:从已微调的合并任务向量里减去一个学出来的低秩遗忘分量。作者要处理的是概念级请求(一个类或一个语义组),而不是任意单条记录。梯度上升、重标注、蒸馏和显著性方法都靠把遗忘损失写进权重,作者认为它们超参脆弱、无法表达遗忘与保留的共享方向,也缺少逐层诊断。
提出 Cocktail 水印,共嵌稳健与脆弱信号以溯源并发现篡改
提出严格黑盒成员推断 WPMIA,用采样估计词级概率判断训练成员
WPMIA 是面向严格黑盒的 LLM 预训练数据成员推断:攻击者只能看到文本续写。
提出 QPriv-VL,用问题引导剪枝降低分布式视觉问答的隐私泄露
QPriv-VL 把问题引导的视觉 token 剪枝做成分布式 VQA 的客户端隐私防御,而不是只做集中式推理加速。
提出用扰动蒸馏本地代理并离线过滤来提取黑盒模型凭据
摘要论文提出扰动蒸馏与离线过滤两阶段框架,实现了 output-only 访问下延迟降低的黑盒大模型 API key 提取。
提出主题锚点投毒,放大众包微调后的专有指令提取
摘要论文提出基于主题锚点的数据中毒攻击,证明低比例的中毒样本可在黑盒条件下隐蔽放大微调指令泄漏。