攻击arXiv 2610.06093
研究评测训练数据提取风险的跨语言迁移
用翻译前缀做跨语言训练数据提取,恢复英语训练文本中的 PII
- arXiv
- 2610.06093
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 测试
- GPT-Neo 1.3B、GPT-Neo 2.7B、GPT-J 6B 等 7 个
- 攻击提取与窃取
摘要跨语言 TDE 能恢复英语记忆的 PII,转移随多语训练和措辞保真变化。
这篇工作检验训练数据抽取是否跨语言:英语段落里记住的 PII,能否被其他语言的前缀逐字抽出。
另有 52 篇论文还没打上分类标签,暂不在筛选结果里。
用翻译前缀做跨语言训练数据提取,恢复英语训练文本中的 PII
这篇工作检验训练数据抽取是否跨语言:英语段落里记住的 PII,能否被其他语言的前缀逐字抽出。
提出跨通道分段攻击,利用 MCP 隐式信任诱导外发敏感文件
摘要论文揭示了 MCP 多通道隐式信任层级,通过跨通道分段与协议级利用突破现有防御,展示了严重的凭证外发风险。
主题分析青少年相关 Reddit 帖子,归纳陪伴 AI 过度依赖与感知互惠
Namvarpour、Chang 与 Razi 用计算辅助主题分析,描述青少年相关 Reddit 讨论中与 AI 陪伴聊天机器人的关系及潜在过度依赖。
利用加密思维块的跨模型重放,诱导弱模型逐字转写专有推理链
摘要论文揭示了客户端加密思维块跨模型互换漏洞,提出了低成本提取方法并给出防御方案。
提出 TC-UAP,用身份级多帧扰动保护视频免被定制复现身份
作者要解决的是:发布前如何给视频加不可见扰动,使片段既不能被拿去微调视频扩散模型,也不能被抽帧做 image-to-video。
访谈残障成人,分析向记忆型助手披露残障时的信息流与语境完整性
提出扩散潜空间地理扰动防御,抑制视觉语言模型泄露精确地理位置
综述视觉内容全生命周期中的所有者侧对抗防护方法
Adversarial attacks for good 是一篇视觉内容所有者侧保护的综述:把长期作为攻击来研究的扰动和结构化信号,反过来交给数据所有者、创作者、平台或审计方使用。
形式化视频透视头显中系统截图与人眼视野的错配
提出 PrivDrift 基准,审计话题漂移后的用户秘密复述