全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 论文arXiv:越狱、提示注入、投毒与防御
用扩散模型隐空间扰动防御视觉语言模型的地理位置隐私泄露
研究系统考察了多模态大推理模型(MLRM)从日常照片推断用户地理位置带来的隐私泄露,发现基于拒答的防护严重不足,精心构造的越狱提示词可将模型响应率提高到 100%。作者指出,现有在像素空间注入不可见扰动的防御受结构性限制,黑盒迁移性下降且出现明显视觉伪影。为此提出一种基于扩散模型的主动防御框架,在反向采样过程中向扩散模型隐空间注入扰动,直接作用于高层语义表示,并以与 GPS 坐标对齐的 GeoCLIP 作为代理模型定位和破坏 MLRM 用于位置推断的地理信号。该方法在保持图像感知质量的同时获得更强的黑盒迁移性,便于在社交媒体平台集成。该工作已被 NDSS 2027 接收。
- 论文arXiv:越狱、提示注入、投毒与防御
HE-Guardrail:面向加密大模型推理的同态护栏防御越狱攻击
作者指出,基于同态加密的大语言模型推理存在一个安全漏洞:服务端在无法接触明文的情况下,既看不到客户端提交的提示词,也看不到模型生成的回复,因此恶意客户端的越狱攻击难以被检测或拦截,甚至可能完全不被服务端察觉。为此作者提出 HE-Guardrail 框架,在加密数据上完整执行护栏机制,并以同态方式控制目标模型的回复是否返回给客户端。该框架以 Llama Guard、JBShield 和 GradSafe 三种代表性护栏进行实例化,结果显示其在密文域中能较接近地复现对应明文护栏的判定,并在安全性、效率与可用性之间呈现不同的权衡。
- 论文arXiv:越狱、提示注入、投毒与防御
CASCADE 研究:跨流水线阶段的越狱防御组合评估
论文提出 CASCADE 决策框架,在直接、黑盒、单轮攻击的统一威胁模型下,系统研究 LLM 越狱防御在流水线阶段内与跨阶段的组合效果。研究用带受控查询预算的攻击成功率公式和明确的公平性规则统一评估口径,覆盖 19 种攻击与 15 种防御。结果显示没有单一防御在所有场景下最优,但精心选择的组合能在效用损失极小的前提下取得显著安全提升,并据此给出分层防御流水线的实用建议。该工作已被 EMNLP 2026 Findings 接收。
- 论文arXiv:越狱、提示注入、投毒与防御
研究提出面向企业 MCP 的零信任授权与工具发现方案
论文对企业级 MCP 的授权缺口做了系统分析,并给出不改动协议与 SDK 内部实现的 FastMCP 可组合扩展。作者调研 Python、TypeScript、Go、Rust、C#、Swift 六种 MCP SDK,指出三个结构性缺陷:凭据提取绑定单一 Authorization 头,使同时服务人类用户(企业 SSO)与自动化 Agent(不同请求头上的服务账号凭据)的双角色部署需要自定义中间件;缺少认证前的工具发现;基础 SDK 缺少按工具的细粒度授权。
- 论文arXiv:越狱、提示注入、投毒与防御
Universal Fractal Natural Language Decision Map:werr 边缘运行时实现 0 字节 VRAM 决策
论文提出 Universal Fractal Natural Language Decision Map,通过 werr 机器原生边缘反射运行时与 answerr 平台实现,完全不存储权重张量(0 Bytes VRAM),沿 Mandelbrot 集混沌边界调制 24 字节坐标种子合成确定性决策。其语义 token 阻尼滤波器(T_desc = 0.045)实现 0.0% 提示注入绕过(95% Wilson CI: [0.0%, 27.8%]),并将迭代剪枝 45.8%、吞吐提升 2.5 倍至 3.31 ms 延迟。
- 论文arXiv:越狱、提示注入、投毒与防御
PALS:面向全双工语音对话模型对抗鲁棒性的心理声学对齐潜空间平滑
论文将针对全双工语音对话智能体的不可感知攻击形式化为在载体语音心理声学掩蔽阈值之下的加性扰动优化,目标包括定向语义劫持、响应抑制和策略越狱。在未防御的 Moshi 类智能体上,白盒攻击成功率最高达 91.7%。作者提出心理声学对齐潜空间平滑(PALS),在残差向量量化潜空间接口注入由局部码本协方差塑形的各向异性高斯噪声,输入噪声由掩蔽阈值塑形以约束攻击者,并用 Kullback-Leibler 一致性目标训练。PALS 无推理时开销,将劫持降至 8.3%、静音降至 11.2%、越狱降至 9.1%,干净质量损失在 2.3% 以内。其蒙特卡洛平滑变体可认证的椭球潜空间半径最高为 0.616,经验鲁棒性远超这一保证下限。
- 论文arXiv:对齐、欺骗与监督
面向联邦 LLM 微调的隐私保护拆分学习
针对联邦拆分学习中 LLM 自回归特性导致中间激活泄露输入、现有扰动防御失效的问题,研究者提出一种可学习的混淆—恢复方案,在保护参与者私有数据集的同时仍能在服务器端训练可独立部署的模型。实验显示该方法在实现强隐私保护的同时仅带来适度的效用损失和系统开销,使基于拆分的联邦 LLM 微调具备实际可行性。
- 论文arXiv:对齐、欺骗与监督
BenchShield:面向 LLM Agent 评测基础设施的奖励完整性形式化插桩
论文提出 BenchShield,一个以形式化模型为支撑的插桩层,用于保障 LLM Agent 评测中的奖励完整性。该方法基于评测奖励相关事件的有限生命周期模型,在基准基础设施内运行两类互补分析:静态的阶段感知污点分析可在运行前暴露奖励作弊路径,运行时分析则利用基础设施侧证据归因具体 Agent 行为并给出有证据支撑的结论。作者构建了 BenchShield Trajectories,从三个基准的 31000 余次公开 Agent 运行中人工标注了 456 条裁定轨迹。
- 论文arXiv:对齐、欺骗与监督
Odin:面向隐私保护 Llama 3 8B 推理的开源端到端 FHE 实现
Odin 是首个开源的端到端 GPU CKKS 实现,可在加密状态下完成 Llama-3-8B 推理。它通过 feature-major 跨层布局统一残差连接与层接口,并为线性投影和注意力构建临时算子内布局,减少权重的冗余明文编码;注意力中 QK^T 的分数可直接被 Softmax 消费,PV 直接消费概率,避免中间重打包;非线性运算采用带输入范围控制的 minimax 多项式近似与联合误差分配。在单张 NVIDIA H100 80 GB GPU 上,输入 128 token 时评估全部 32 层耗时 366.4 s、峰值显存 58.9 GiB,相比 THOR 的 1651.9 s 提速 4.51 倍。
- 论文arXiv:对齐、欺骗与监督
ROSETTA:基于混合 CKKS/TFHE 的高效准确隐私保护 LLM 解码框架
ROSETTA 是一个混合 CKKS/TFHE 框架,用于解决全同态加密(FHE)隐私推理中非线性操作开销过大的问题。它提出基于 TFHE 的自适应分段查找表协议,并设计算子选择框架自动将每个非线性算子分配给 CKKS 或 TFHE,以最小化端到端解码延迟。相比 SOTA 框架 CacheMir,ROSETTA 实现最高 4.8 倍 Softmax 加速和 1.5–2.1 倍端到端加速,论文已被 ACM CCS 2026 接收。
- 论文arXiv:对齐、欺骗与监督
面向智能体互联网的可扩展信任发现架构
针对智能体互联网中注册、可信身份识别与能力发现尚未解决的问题,该论文提出一种分层分布式信任发现架构,包含 Agent Root、Agent Registry 和 Agent Resolver 三层,并引入注册表后缀锚定的复合身份方案与双证书多级认证机制。原型实验显示平均注册延迟 58ms、发现延迟 25ms,支持每秒超 19,000 次注册请求和超 29,000 次智能体发现请求。
- 论文arXiv:对齐、欺骗与监督
Provisional Reachability:用可撤销的每次跨越限制 Agent
论文提出一种把 Agent 每次跨越都置于托管窗口、按概率 r 独立审计并在发现问题时撤销窗口的机制,用于限制信息泄露。作者推导出对手跨越 k 次、每次携带 c 比特时的期望泄露上界 L(r) ~ c/(er),该上界是对手选择上的上确界,因此方案可以公开,模拟结果与公式相差 7.7 个标准误。作者指出托管本身只是速率限制而非总量限制,秘密仍可能在每次运行中拼装完成;若被托管比特每期以比例 mu 衰减,持有量会收敛到 g/mu,当 mu > g/L 时 L 比特的秘密不可达,在 20,000 个窗口的模拟中 0.9mu* 时 100% 运行完成拼装、2mu* 时 0%。
- 论文arXiv:对齐、欺骗与监督
VidMark:面向视频生成模型知识产权保护的高效水印方案
研究者提出一种生成内嵌水印方案,用于视频生成模型(VGM)的合成视频验证与模型所有权验证两项取证任务。方案包含名为 VidMark 的视频水印网络,结合两级离散小波变换(DWT)分解与全局时序注意力模块(GTAB),并通过解码器引导的微调让 VGM 生成携带模型专属水印的视频。在代表性 VGM 上实验显示,水印提取准确率超过 99%,两项验证任务准确率均达 100%,且对视频级与模型级攻击具有强鲁棒性。
- 论文arXiv:对齐、欺骗与监督
StyleAT:用对抗训练防御人脸识别的语义攻击
针对人脸识别模型易受对抗性语义编辑(如轻微老化或姿态变化)攻击的问题,研究者提出语义攻击 BoundStyle,在 StyleGAN 潜空间中最大化误分类率,攻击成功率高的同时比现有 SOTA 攻击快约 9.5 倍。基于 BoundStyle 构建的对抗训练方案 StyleAT 采用低预算攻击变体,却能防御更强和未见过的语义攻击。在两个训练中未见的数据集和七个模型上,StyleAT 提升了针对 SOTA 攻击的鲁棒准确率,并在多种设置下优于常见防御方法。
- 论文arXiv:对齐、欺骗与监督
DwT-FL:联邦学习中边训练边去重的隐私保护跨客户端去重系统
针对联邦学习中跨客户端重复数据降低训练效率并加剧模型记忆与隐私风险的问题,研究者提出“边训练边去重(DwT)”范式及隐私保护去重系统 DwT-FL,将跨客户端去重从一次性全局同步预处理转为带状态管理、并发声明与故障恢复的持续在线服务。该系统通过并发状态声明机制与冷热双队列调度策略,实现安全去重与模型训练的并行执行,并支持客户端动态加入。实验显示,相比 SOTA 方案,DwT-FL 将故障恢复和动态加入的时间开销分别最多降低 93.04% 和 94.18%。
- 论文arXiv:对齐、欺骗与监督
基于硬件 PUF 指纹的知识蒸馏设备级溯源框架
针对知识蒸馏中教师模型易被窃取且现有水印或硬件访问控制难以定位泄露设备的问题,研究者提出一种将设备专属 PUF 签名叠加到教师 logits 上的指纹框架,使经知识蒸馏训练的学生模型继承与硬件绑定的唯一身份。该方案在 Xilinx Zynq-7020 FPGA 上测量环形振荡器(RO)PUF 生成签名,架构无关,可跨 CNN、Vision Transformer 和编码器继承身份,并通过神经解码器与汉明距离精修的两阶段恢复流程在噪声条件下保持高检测准确率,另引入多级 logit 编码支持大规模设备部署。实验显示嵌入指纹能抵抗常见的蒸馏后修改。
- 论文arXiv
通过表征对齐缓解苏格拉底式导师中的脚手架崩塌
针对 LLM 苏格拉底式导师在持续学生压力下逐渐放弃引导式提问、直接给出答案的"脚手架崩塌"问题,研究者提出 Scaffold-Preserving Representation Alignment 两阶段框架:先用监督微调预热,再结合轨迹加权直接偏好优化与锚定冻结参考状态的间隔保持表征损失。在 Qwen3-8B 上跨五个 STEM 学科和五种红队攻击策略评测,该方法将崩塌率降至 32%,平均崩塌起始延迟至九轮以上,并保持较低过度拒答。
- 论文arXiv
MiShield:识别多图组合后浮现的隐式有害内容
论文提出多图隐式有害内容(MIIT)问题,即每张图片单独看都无害,但多张图片联合解读时会产生有害语义,现有商业审核 API 和模型因单图缺乏明显风险线索而难以识别。作者给出 MIIT 的正式定义并分析检测中的三个关键挑战,通过自动生成流程构建了覆盖七类代表性风险的纯图像多图安全数据集 MIIT-dataset,并训练出 MiShield,采用渐进式蒸馏推理监督,使其在给出安全判断的同时显式分析导致危害的关联实体。实验显示 MiShield-8B 的表现优于代表性审核服务和更大规模的模型。论文共 15 页、8 张图,作者提示内容可能包含敏感信息。
- 会议论文arXivACL 2026
基于搜索增强 LLM 的中文新词毒性共识检测框架 SeTox
针对"country girl"等表面无害、却在公众共识中演变为毒性用法的新词,研究者提出分类体系与风险词表,并构建搜索增强框架 SeTox,让静态大语言模型接入实时网络语境来检测新词毒性。实验显示,SeTox 即使使用 3B 规模模型也优于近期大规模模型,表明其可扩展地引入现实世界知识完成毒性新词检测。该工作发表于 ACL 2026。
- 论文arXiv
DataShield:通过共识子空间对齐识别 LLM 微调中的高风险数据
DataShield 是一个数据评估框架,通过多个安全对齐 LLM 构建的联合安全关键语义空间中的共识子空间对齐,识别有风险的微调样本和回复片段。该框架在这些空间内用语义谱分解提取共识的安全与不安全子空间,再通过衡量样本或片段与不安全子空间、安全子空间的相对对齐程度估计风险,从而支持样本级过滤和细粒度片段级掩码。与现有过滤和掩码基线相比,DataShield 在样本过滤下将 ASR 降低 14.6%,在片段掩码下降低 32.3%,同时保持下游效用,并避免针对特定目标模型计算风险。
- 论文arXiv
Gradient Immunity 提出 USG:在开放权重发布时阻断恶意微调梯度
论文提出 Unidirectional Safety Gate(USG),用于作者所称的“部分保护开放权重发布”(PPOW)场景:大部分权重仍可训练,但发布时保留少量安全关键组件。USG 由 Null Space Cubic Layer 与 Inverse Adapter 组成,插入在最后一层 Transformer 之后;下游微调时,三次层抑制或阻断隐藏状态落入校准保护区域的有害样本梯度,Inverse Adapter 则恢复基础模型的前向行为。防御方用自己掌握的有害数据校准阈值,使保护能泛化到邻近的分布内有害样本。
- 论文arXiv
SHE:面向 LLM Agent 的轨迹驱动安全护栏演化框架
研究者提出 Safety Harness Evolution(SHE),一个从 rollout 轨迹中学习演化安全边界的框架,用于提升 LLM Agent 的安全性。SHE 把 Agent 护栏拆成 System Prompt、Rule Bank、Safety Memory 和 Tool Policy 四类具有明确安全职责的组件,为局部演化划定功能边界。在此基础上,SHE 引入归因引导的演化循环,把轨迹失败转化为结构化诊断,学习各组件专属的边界修正,并通过安全与效用验证筛选演化后的护栏。
- 论文arXiv
WIFA:按意图分组监督缓解包装式越狱与过度拒答
论文提出 Wrapper-Based Intent-Form Augmentation(WIFA),一种自动意图分组增强方法,把带包装的有害示例与结构匹配的带包装良性反例配对,无需外部教师模型或逐包装的人工意图标注。WIFA 作为通用数据层支持两条微调路线:两阶段高安全配方 WIFA-Boost,以及 Anchored Group-Consistent Refusal Training(A-GCRT),后者在同一意图的不同包装间正则化拒答与合规决策分数,并把有害与良性分组锚定在间隔两侧。
- 论文arXiv
StepGuard:用可扩展监督训练步骤级护栏,兼顾安全与效用
研究者提出 StepGuard,一个步骤级护栏模型,既能审计已完成的智能体轨迹,也能在工具动作执行前进行检查。为训练该模型,作者设计了 StepGen 数据引擎,生成上下文相同但在风险步骤上动作不同的安全与不安全轨迹;并提出 Balance-GRPO,根据观测到的准确率动态平衡安全与不安全动作的学习,以减少过度防御和防御不足。实验显示,StepGuard 在开放权重护栏模型中平均准确率最高,性能与 GPT-5.4 相当;在 AgentDojo 和 AgentDyn 上用于守护智能体时,相比无护栏设置将平均攻击成功率降低 77.3%,平均效用仅下降 2.8 个百分点。该工作已被 EMNLP 2026 接收。