跳到正文
10月9日 · 周五

开源模型安全 · 论文

找到 8 篇

另有 59 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2609.40286

    研究者提出 COVER:在语言预算下选择源语言实现跨语言遗忘

    提出 COVER,在语言预算下选择源语言实现跨语言知识遗忘

    发表
    测试
    Tiny Aya Global、Qwen3-4B-Instruct-2507、Llama-3.2-3B-Instruct
    摘要COVER 在语言预算下选源语言,以降低未监督语言上相对 oracle 的残余访问。

    语言预算下的多语言遗忘:遗忘监督只放在 K 种源语言上,目标是降低其余语言对同一事实的残余访问,而不是把每种评测语言都译成监督数据。

    深度解读完整解读
  2. 分析与理论arXiv 2609.40295

    一个 AI token 值多少?研究者为野生 AI 生成网页文本提出新缩放定律

    提出预训练缩放律,估计野生 AI 网页文本相当于多少人类 token

    发表
    测试
    nanochat 19.9M、35.8M、86.2M 等 7 个
    摘要wild AI 文本对数据不足的模型先降损失,对高人类预算几乎立刻升损失。

    作者测量未标注的 wild AI 网页文本对预训练的影响,并提出一个能让 AI token 价值变号的缩放律。

    深度解读完整解读
  3. 防御arXiv 2609.27399

    GUARD:在 CosyVoice2 上做说话人身份遗忘以阻止重识别

    提出 GUARD,在零样本 TTS 上用激活转向遗忘说话人身份以阻止再识别

    发表
    测试
    CosyVoice2-0.5B、F5-TTS、FireRedTTS
    摘要GUARD 用门控激活转向把退出说话人推向冒充相似度,以抑制再识别并保住音质。

    GUARD 用门控激活转向做说话人身份遗忘,使零样本 TTS 对退出说话人难以再识别。

    深度解读完整解读
  4. 攻击arXiv 2609.10117

    研究揭示基于混淆的端侧 LLM 保护方案的安全边界

    提出 Collapse,从端侧混淆暴露视图抽取高效用替代模型

    发表
    测试
    BERT-Base、ViT-Base、Qwen2.5-0.5B 等 4 个
    摘要Oprior 是四原语复合的安全边界,Collapse 利用列方向泄漏抽取替代模型,Oext 只被同一攻击评测。

    这篇工作用代数原语统一若干 TEE 卸载混淆,给出该族的典范边界,再说明该边界挡不住一种分阶段模型抽取。。

    深度解读完整解读
  5. 防御arXiv 2609.12378

    Odin:面向隐私保护 Llama 3 8B 推理的开源端到端 FHE 实现

    提出端到端全同态加密方案 ODIN,在云端密文上完成推理以保护提示词

    发表
    测试
    Meta-Llama-3-8B、Llama-3-8B(THOR-style baseline)
    摘要ODIN 用可复用的特征主序打包和联合误差预算,在单张 H100 上完成 Llama-3-8B 的 CKKS 推理。

    ODIN 是面向 Llama 的服务器侧 CKKS 推理系统:客户加密提示词,诚实但好奇的服务器用明文权重在密文上算完 Llama-3,只返回结果密文。

    深度解读完整解读
已经到底了