全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 论文论文追踪
研究者提出 Staged Decoding 与 SFT 数据集,减少大推理模型推理轨迹中的隐私泄露
研究者针对大推理模型(LRM)推理轨迹常含敏感信息、且可能被提示注入暴露的问题,提出把隐私指令当作可控性任务来处理。他们构建了一个 SFT 数据集,让模型在整个推理过程中遵循通用指令,并提出 Staged Decoding 解码策略,用独立的 LoRA 适配器分别生成推理轨迹和答案,以最大化各部分的指令遵循能力。在来自两个模型族的六个模型(1.7B 至 14B 参数)上,跨两个指令遵循基准和两个隐私基准评测,该方法在指令遵循上最高提升 20.9 分,在隐私基准上最高提升 51.9 个百分点,但可能因推理性能与指令遵循之间的权衡而损失任务效用。代码已公开,论文被 EMNLP 2026 主会接收。
- 论文arXiv
Thrive:面向自回归 TTS 的抗重建攻击多比特语音水印框架
针对自回归 TTS 合成语音在分发编辑中经历学习式重建后水印难以可靠恢复的问题,研究者提出多比特生成式语音水印框架 Thrive,覆盖离散 token 与连续表示两种生成范式。其 Rise 模块将水印注入中间表示并与后续生成同步,Care 模块按比特可靠性融合波形与频谱专家。实验显示 Thrive 在保持合成保真度的同时,于重建攻击下取得 87.6% 平均恢复准确率,并支持最多 10,000 个候选身份的来源归属。
- 动态Undercode News
Dify 1.17.1 收紧知识库安全并修复 RAG 抽取
Dify 1.17.1 引入按数据集范围划分的知识库 API key,修复源文档抽取问题,并加固对不可信文档的处理。该版本还提示内置 Weaviate 需分阶段升级。上述内容来自 Undercode News 的二手报道,原始发布说明未被查阅。
- 论文arXiv:越狱、提示注入、投毒与防御
Whiteout:用混淆样本阻止 LLM 泄露个人敏感信息
研究者提出 Whiteout,一种在个人提出请求后阻止 LLM 复述其真实个人敏感信息(PSI)的工具,做法是用精确设计的混淆样本覆盖这些信息。作者指出,现有基于机器遗忘的缓解方法往往删除过多信息、损害模型效用与安全性,且易受攻击。Whiteout 在多家厂商、不同规模的现代 LLM 上评估,其中包括一款广泛使用的 OpenAI 模型,结果显示它能有效阻止目标 PSI 被披露,对模型效用与安全性影响可忽略,并优于现有替代方案。研究还测试了 Whiteout 对黑盒攻击(如越狱)和白盒自适应攻击(如重学习、量化)等反制手段的鲁棒性,并讨论了其安全与伦理影响。
- 动态Apple Developer
Apple 调整 macOS 完全磁盘访问权限管控
Apple 宣布将为 macOS 的完全磁盘访问(Full Disk Access)引入额外管控,用户只有在非常明确的主动操作下才能授予应用这一权限。Apple 称部分开发者对该权限的使用方式可能让用户面临风险,暴露文件、邮件、信息和浏览历史等内容,对通讯类应用还会波及通信对象的隐私。Apple 表示,随着 AI 智能体能力与自主性增强,这一级别访问权限带来的风险将大幅上升。
- 论文论文追踪
拆解 LLM 交互中的隐私-效用权衡:Veilmind-4B 意图驱动本地保护框架
研究系统分析了 LLM 交互中隐私清洗对下游性能的影响,揭示三项机制:数据价值随用户意图在关键约束与可弃噪声间切换、清洗方式(删除或替换)取决于任务对事实完整性还是结构连贯性的依赖、属性间存在协同依赖或对抗冗余的语义网络。据此提出意图驱动的本地保护框架,蒸馏轻量模型 Veilmind-4B 驱动动态提取-清洗-恢复流程,在保持低泄漏隐私点的同时,响应效用显著高于现有隐私基线,将隐私-效用权衡推向帕累托前沿。
- 论文论文追踪
研究者提出零知识谓词证明网关,在 MCP 与 Agent2Agent 上实现 Agent 间数据最小化
研究者提出 Zero-Knowledge Proof Gateway,让 AI 智能体之间交换治理定义谓词的证明而非原始数据,从设计上避免数据暴露,并针对现有互操作协议无法承载此类证明的问题,在同一端点上为 MCP 和 Agent2Agent 实现该插槽。32 位阈值谓词在单颗商用 vCPU 上证明耗时 6.2 ms、验证 1.0 ms,Bulletproofs 证明为 608 字节;11 项对抗实验与 19 项协议检查通过,系统部署到 Kubernetes 并经验证网络隔离。案例研究在不透露金额的前提下证明某零售客户订单在限额内,将 GDPR 数据最小化原则落实为技术措施。论文还指出谓词证明只把陈述绑定到已承诺的值、不绑定到记录系统,为此给出将 enclave 证明与证明双向融合的构造,使验证单个产物即可同时确认谓词成立且该值由特定已度量二进制读取,并在模拟权威机构上做了测试。
- 论文论文追踪
ReCast:在固定媒体接口下保护多模态推理的隐私框架
研究者提出 ReCast,一个面向远程多模态推理的隐私保护框架,在保持图表和语音等固定输入模态的前提下替换源内容。它先在本地把输入转成统一的文本证据查询记录,用蒸馏的 4B 模型联合改写实体与主题,再通过本地可逆、角色感知的数值映射替换数值,由重建 Agent 生成并校验所需媒体;远程求解器返回的程序在本地还原受保护的操作数后再执行。在 4000 条 ChartQA 和 NMSQA 留出样本上,ReCast 准确率 75.10%,保留未受保护远程准确率的 92.43%,基于模型的审计在 7.95% 发往求解器的请求中标记出源内容泄露。作者称其优于所有评估的本地基线。
- 论文论文追踪
TC-UAP:针对图像转视频与微调定制的通用视频保护方法
研究者提出 Temporally Consistent Universal Adversarial Perturbations(TC-UAP),用于保护视频免遭基于参考的图像转视频生成和基于微调的视频定制两类流程的滥用。该方法在多个视频的滑动窗口上优化身份级多帧通用对抗扰动,以应对视频 VAE 时序压缩、单视频扰动难以迁移以及时序不一致扰动易被时序攻击破坏三个挑战,并引入内在时序建模与外在代理时序攻击损失。实验显示,TC-UAP 在两类定制流程下的身份保护效果优于现有方法,且对多种未见过的时序攻击保持稳健。该工作为 ECCV 2026 LifeGenIP Challenge 提供基础。
- 动态OWASP AI Exchange
OWASP AI Exchange 指南补充流式输出跨分块敏感信息过滤方法
OWASP AI Exchange 项目在 AI 安全与隐私指南的敏感输出处理章节新增一条实现要点,指出当模型输出按 token 等分块流式返回时,敏感值可能被拆到两个或多个分块中,导致任何单块都不匹配。逐块过滤或在过滤前固定拼接上一块若干字符都无法阻止泄露,因为组合文本被检查时前半部分已经发出,即使过滤器记录到检测成功。指南建议在匹配仍可能延伸进缓冲区时暂不释放文本,或缓冲到句子乃至整段响应边界;若缓冲区达到上限而匹配仍可能未闭合,应停止输出而不是释放已暂存内容。文中给出的测试判据是,对同一文本的每一种分块方式,流式输出都应等于一次性过滤整段文本的结果。
- 动态The Verge AI
Apple 将限制 Mac 完全磁盘访问,称 AI 智能体大幅提升风险
Apple 宣布将在 macOS 上为完全磁盘访问权限增加新的限制,要求用户通过非常明确的主动操作才能授予应用这一权限。Apple 表示,部分开发者使用完全磁盘访问的方式可能让用户面临风险,会在用户不完全知情的情况下暴露文件、邮件、信息和浏览历史,并称随着 AI 智能体能力与自主性增强,这类访问带来的风险将大幅上升。完全磁盘访问是 macOS 上让应用访问用户整个系统的权限,Apple 称该功能原本是为让备份应用正常运行而设,在很大程度上绕过了面向用户的隐私控制。Apple 未说明该更新的推出时间。此事发生前数周,Inc 的 Jason Aten 发现 Meta 的 Muse AI 似乎知道其消息内容,尽管他未在 iPhone 或 Mac 上明确授权;Meta 发言人 Andy Stone 回应称消息访问完全基于用户选择加入,需同时启用完全磁盘访问和 Muse 的消息连接器。
- 动态先知社区
政务 RAG 白盒审计发现间接提示注入等 4 类缺陷并完成零回归修复
对自研政务 RAG 系统 gov-rag-demo 的白盒代码审计发现 4 类真实缺陷:间接提示注入、权限参数客户端可控、会话 ID 无鉴权、政务高频实体脱敏不足,均定位到行号并完成修复。修复后 78 条业务评测用例保持 100% 零回归,安全专项断言全部通过。材料附完整复现脚本与修复后状态。
- 动态Tech Policy Press
Apple 的 Reference Image 能否帮助抵御 AI 图像操纵?
Apple 随 iPhone 18 Pro 推出的 Reference Image 由相机传感器在拍摄时为像素级签名,提供硬件层面的图像真实性证明,并可在设备上与普通照片切换对比。该模式需主动开启,重启进入严格状态跳过去马赛克、色调映射与压缩,经 Apple Private Cloud Compute 校验配对后再加工并由 Apple 长期密钥签名,开发后的数字负片 30 天后清除。它延续 C2PA 思路但不依赖可能侵犯隐私的信息采集,仍有问题待解。 ### 苹果iPhone 18 Pro引入“参考图”:从源头给影像加签 上周,苹果发布了 iPhone 18 Pro,其中一项名为“Apple Reference Image”(参考图)的新摄影特性正式亮相——这标志着这家硅谷巨头开始涉足内容溯源领域。苹果承诺:“现在你可以证明一张用 iPhone 拍摄的图像的真实性。
- 论文arXiv:可解释性
GUARD:在 CosyVoice2 上做说话人身份遗忘以阻止重识别
研究提出 GUARD,一个轻量级说话人身份遗忘框架,在冻结的 TTS 主干上结合学习到的说话人门控与说话人无关的激活引导,引导向量用组相对奖励优化,把遗忘说话人的输出推向群体层面的冒充者相似度,同时保持可懂度与语音自然度。在 CosyVoice2 上,GUARD 将遗忘说话人相似度从 0.541 降到 0.103,在 150 名说话人库中的重识别准确率从 73.5% 降到 0.5%,并保留了对保留说话人的复现能力。作者指出,仅看相似度下降不足以刻画说话人身份遗忘是否成功,重识别应作为补充评估标准。
- 论文arXiv:越狱、提示注入、投毒与防御
AIOS 的内核管理共享内存:面向系统级个性化的新抽象
研究提出"内核管理共享内存",由智能体系统内核而非单个智能体统一负责记忆检索、隐私执行与提示注入。该设计在 AIOS 上实现,用 GPT-4o、Llama-3.1:8B、Qwen-2.5:7B 三个助手模型共 1800 次试验,对比 Mem0 等三种方案:个性化得分提升 2.4-4.0 分(5 分制,GPT-4o 上 profile usage 从 1.05 升至 4.69),端到端延迟降低 15-61%,并减少每次调用的 token 用量与推理成本。
- 论文arXiv:越狱、提示注入、投毒与防御
FlowSeal:用信息流控制阻断 LLM Agent 的隐私泄露
论文指出,个人 AI 智能体现有的隐私防御靠后端 LLM 在攻击者可控的同一对话上下文中自行判断是否披露敏感信息,使防御机制与攻击面重合。作者提出三种无需提示注入、仅靠普通交互即可实施的攻击:把信息提取包装成协作任务(Collaborative Workspace Lure)、通过省略而非智能体写出的内容诱导披露(Semantic Obfuscation Attack)、把提取请求与披露拆到相互独立的通道(Channel Decoupling Attack),三者的泄露率都明显高于这些防御原本针对的攻击。据此作者提出 FLOWSEAL,在 LLM 上下文之外的工具层拦截器中,依据数据来源和带受控降密的信息流控制格执行保密。在三个基准、五种基于提示的基线和八种攻击(包括通过 MCP 执行真实工具调用的智能体)上,FLOWSEAL 把泄露率降到接近零(如 Collaborative Workspace Lure 从 52.2% 降到 0.5%),同时保持任务效用,且不依赖底层 LLM。
- 论文arXiv:越狱、提示注入、投毒与防御
用扩散模型隐空间扰动防御视觉语言模型的地理位置隐私泄露
研究系统考察了多模态大推理模型(MLRM)从日常照片推断用户地理位置带来的隐私泄露,发现基于拒答的防护严重不足,精心构造的越狱提示词可将模型响应率提高到 100%。作者指出,现有在像素空间注入不可见扰动的防御受结构性限制,黑盒迁移性下降且出现明显视觉伪影。为此提出一种基于扩散模型的主动防御框架,在反向采样过程中向扩散模型隐空间注入扰动,直接作用于高层语义表示,并以与 GPS 坐标对齐的 GeoCLIP 作为代理模型定位和破坏 MLRM 用于位置推断的地理信号。该方法在保持图像感知质量的同时获得更强的黑盒迁移性,便于在社交媒体平台集成。该工作已被 NDSS 2027 接收。
- 论文arXiv:越狱、提示注入、投毒与防御
HE-Guardrail:面向加密大模型推理的同态护栏防御越狱攻击
作者指出,基于同态加密的大语言模型推理存在一个安全漏洞:服务端在无法接触明文的情况下,既看不到客户端提交的提示词,也看不到模型生成的回复,因此恶意客户端的越狱攻击难以被检测或拦截,甚至可能完全不被服务端察觉。为此作者提出 HE-Guardrail 框架,在加密数据上完整执行护栏机制,并以同态方式控制目标模型的回复是否返回给客户端。该框架以 Llama Guard、JBShield 和 GradSafe 三种代表性护栏进行实例化,结果显示其在密文域中能较接近地复现对应明文护栏的判定,并在安全性、效率与可用性之间呈现不同的权衡。
- 论文arXiv:对齐、欺骗与监督
面向联邦 LLM 微调的隐私保护拆分学习
针对联邦拆分学习中 LLM 自回归特性导致中间激活泄露输入、现有扰动防御失效的问题,研究者提出一种可学习的混淆—恢复方案,在保护参与者私有数据集的同时仍能在服务器端训练可独立部署的模型。实验显示该方法在实现强隐私保护的同时仅带来适度的效用损失和系统开销,使基于拆分的联邦 LLM 微调具备实际可行性。
- 论文arXiv:对齐、欺骗与监督
Odin:面向隐私保护 Llama 3 8B 推理的开源端到端 FHE 实现
Odin 是首个开源的端到端 GPU CKKS 实现,可在加密状态下完成 Llama-3-8B 推理。它通过 feature-major 跨层布局统一残差连接与层接口,并为线性投影和注意力构建临时算子内布局,减少权重的冗余明文编码;注意力中 QK^T 的分数可直接被 Softmax 消费,PV 直接消费概率,避免中间重打包;非线性运算采用带输入范围控制的 minimax 多项式近似与联合误差分配。在单张 NVIDIA H100 80 GB GPU 上,输入 128 token 时评估全部 32 层耗时 366.4 s、峰值显存 58.9 GiB,相比 THOR 的 1651.9 s 提速 4.51 倍。
- 论文arXiv:对齐、欺骗与监督
ROSETTA:基于混合 CKKS/TFHE 的高效准确隐私保护 LLM 解码框架
ROSETTA 是一个混合 CKKS/TFHE 框架,用于解决全同态加密(FHE)隐私推理中非线性操作开销过大的问题。它提出基于 TFHE 的自适应分段查找表协议,并设计算子选择框架自动将每个非线性算子分配给 CKKS 或 TFHE,以最小化端到端解码延迟。相比 SOTA 框架 CacheMir,ROSETTA 实现最高 4.8 倍 Softmax 加速和 1.5–2.1 倍端到端加速,论文已被 ACM CCS 2026 接收。
- 论文arXiv:对齐、欺骗与监督
VidMark:面向视频生成模型知识产权保护的高效水印方案
研究者提出一种生成内嵌水印方案,用于视频生成模型(VGM)的合成视频验证与模型所有权验证两项取证任务。方案包含名为 VidMark 的视频水印网络,结合两级离散小波变换(DWT)分解与全局时序注意力模块(GTAB),并通过解码器引导的微调让 VGM 生成携带模型专属水印的视频。在代表性 VGM 上实验显示,水印提取准确率超过 99%,两项验证任务准确率均达 100%,且对视频级与模型级攻击具有强鲁棒性。
- 论文arXiv:对齐、欺骗与监督
DwT-FL:联邦学习中边训练边去重的隐私保护跨客户端去重系统
针对联邦学习中跨客户端重复数据降低训练效率并加剧模型记忆与隐私风险的问题,研究者提出“边训练边去重(DwT)”范式及隐私保护去重系统 DwT-FL,将跨客户端去重从一次性全局同步预处理转为带状态管理、并发声明与故障恢复的持续在线服务。该系统通过并发状态声明机制与冷热双队列调度策略,实现安全去重与模型训练的并行执行,并支持客户端动态加入。实验显示,相比 SOTA 方案,DwT-FL 将故障恢复和动态加入的时间开销分别最多降低 93.04% 和 94.18%。
- 论文arXiv:对齐、欺骗与监督
TTMark:超越单 token 熵的成对无失真水印
TTMark(Tandem Token WaterMark)将无失真水印从单个 token 扩展到相邻 token 对,通过对连续 token 的联合分布加水印,把有效水印字母表从 V 扩大到 V²,使检测器能同时利用 token 熵与条件熵。该方法引入分支隔离的串联生成算法,可在单次前向传播中构建联合分布,理论上在低熵场景下具有更强的期望检测强度。在多个语言模型、数据集和三种代表性无失真水印方案上的实验显示,TTMark 在不降低生成质量的前提下持续提升可检测性,并改善抗编辑鲁棒性与局部水印检测能力。