跳到正文
10月8日 · 周四

隐私与数据泄露 · 论文

找到 10 篇

另有 81 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2610.05870

    MBZUAI 提出可校准的真实图像认证方法

    提出校准重合成认证,仅当已知生成器都不能保真重构时签发真实图像证书

    发表
    攻击者
    白盒
    测试
    SD2.1、SD3、SD3.5 等 10 个

    摘要论文提出基于反演保真度与阈值校准的健全认证框架,在对抗扰动下维持错误率界限,并指出真实内容可认证性随生成器演进而萎缩。

    深度解读完整解读
  2. 评测与基准arXiv 2610.05586

    AgentDoxx:联网搜索 Agent 对匿名访谈文本的再识别评测

    构建 AGENTDOXX 评测联网搜索智能体对匿名访谈的再识别能力

    发表
    场景
    AI Agent
    测试
    GPT-5.6 Terra、GPT-5 Mini、GPT-4.1 Mini 等 10 个

    摘要论文提出了已知身份的重识别基准 AGENTDOXX,揭示搜索与记忆双重风险及现有防御在检索轨迹中的泄露漏洞。

    深度解读完整解读
  3. 分析与理论arXiv 2609.33898

    研究揭示训练效率与模型脆弱性的权衡:高效训练更易受对抗与隐私攻击

    比较高效与高成本训练的对抗和隐私脆弱性并分析损失几何

    发表
    测试
    ResNet-18、Swin Transformer、Qwen2.5-Math-7B-Instruct 等 7 个
    摘要效用匹配下,三种高效训练都伴随更高的隐私与对抗脆弱性及更尖的损失几何。

    作者在视觉分类和数学推理语言模型上,检查用更少数据或更简对齐换取训练效率时,安全性质是否一起变化。比较在任务效用接近的前提下进行。视觉侧用 KNN-Shapley 的高重要性小子集对照低重要性大子集,并用预训练微调对照从头训练。

    深度解读完整解读
  4. 攻击arXiv 2610.01768

    LLMLeak:借 LLM 合法网页抓取实施隐蔽数据外泄

    提出 LLMLeak,把机密编进报错 URL,借聊天机器人网页抓取外传

    发表
    场景
    AI Agent
    测试
    Meta-Llama-3.3-70B-Instruct、Meta-Llama-4-Scout-17B-16E-Instruct、Meta-Llama-3.1-8B-Instruct 等 15 个
    摘要LLMLeak 用报错 URL 借聊天机器人抓取外传秘密。

    LLMLeak 研究一种隐蔽外传:本地恶意软件已拿到机密,却因为网络限制或监控不能直接连接攻击者,于是把秘密放进看起来像排障文档的 URL,让良性聊天机器人的网页抓取工具在访问时把秘密带出去。

    深度解读完整解读
  5. 防御arXiv 2609.23586

    VidMark:面向视频生成模型知识产权保护的高效水印方案

    提出 VidMark 水印方案,核验视频生成模型的输出来源与所有权

    发表
    测试
    Stable Video Diffusion (SVD)、Open-Sora、Wan
    摘要VidMark 加解码器引导微调,把模型签名写入 VGM 输出并用于两项核验。

    Huang 等人提出一套面向视频生成模型的生成内嵌水印方案,用来同时判断一条视频是否来自受保护模型,以及一个嫌疑模型是否为该模型的拷贝。

    深度解读完整解读
  6. 防御arXiv 2609.36372

    TTMark:超越单 token 熵的成对无失真水印

    提出成对无失真水印 TTMARK,增强低熵下的机器文本检测

    发表
    测试
    Llama3.2-3B-Instruct、Mistral-v0.3-7B-Instruct、Qwen2.5-7B-Instruct 等 4 个
    摘要TTMARK 用水印化相邻 token 对利用条件熵,在多种无失真方案上提高检测并保持生成质量。

    TTMARK 是一种成对、无失真的文本水印:对相邻 token 的联合分布重加权,而不是逐 token 独立重加权。

    深度解读完整解读
已经到底了