跳到正文
10月9日 · 周五

全部论文

找到 8 篇

另有 648 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 分析与理论arXiv 2609.33898

    研究揭示训练效率与模型脆弱性的权衡:高效训练更易受对抗与隐私攻击

    比较高效与高成本训练的对抗和隐私脆弱性并分析损失几何

    发表
    测试
    ResNet-18、Swin Transformer、Qwen2.5-Math-7B-Instruct 等 7 个
    摘要效用匹配下,三种高效训练都伴随更高的隐私与对抗脆弱性及更尖的损失几何。

    作者在视觉分类和数学推理语言模型上,检查用更少数据或更简对齐换取训练效率时,安全性质是否一起变化。比较在任务效用接近的前提下进行。视觉侧用 KNN-Shapley 的高重要性小子集对照低重要性大子集,并用预训练微调对照从头训练。

    深度解读完整解读
  2. 分析与理论arXiv 2609.36477

    研究发现护栏模型在基座模型不确定处过度自信

    诊断护栏相对基座在对抗提示上的置信失校

    发表
    测试
    Llama-Guard 7B、Llama-Guard-2 8B、Llama-Guard-3 8B 等 10 个
    摘要对抗包装使 guard 高置信漏检,而对应 base 在同一输入上常更不确定。

    诊断性分析:五个提示词分类 guard 的置信度,在清洁输入上可以较校准,在越狱包装后则变成高置信度的错误判定。

    深度解读完整解读
  3. 分析与理论arXiv 2605.17173

    研究提出 IRT 框架拆解大模型跨语言安全护栏退化

    提出多组 IRT 框架拆解跨语言安全护栏退化原因

    发表
    测试
    gpt-4.1-mini、gpt-4o-mini、gpt-4.1-nano 等 15 个
    摘要多组 IRT 把多语安全失败拆成能力、语言难度和题目特异差距,并在闭源配置上估计这些因子。

    Zhang、Patel、Truong 与 Koyejo 用多组项目反应理论,解释安全护栏为何随语言变化,而不是只报告一个 JSR。

    深度解读完整解读
  4. 可解释性arXiv 2609.04721

    研究:拒答方向可跨架构迁移,安全工具可按写入位置重新估计

    在写入点定位拒答方向,经刚性旋转跨架构迁移并门控放大

    发表
    测试
    Falcon-Mamba-7B、Falcon3-Mamba-7B、Llama-3.1-8B 等 8 个
    摘要拒答方向可经刚性旋转跨架构迁移,但必须在各架构的写入点读取。

    作者研究拒答表示是否随架构改变,结论是表示共享、读取位置随架构变。

    深度解读完整解读
  5. 可解释性arXiv 2609.23587

    大型推理模型的效率与安全困境:量化与剪枝如何影响越狱鲁棒性

    分析量化、剪枝与 KV 缓存压缩对推理模型越狱鲁棒性的影响

    发表
    测试
    QwQ-32B、DeepSeek-R1-Distill-Qwen-32B、DeepSeek-R1-Distill-Llama-8B 等 4 个
    摘要效率压缩常使 LRM 越狱 HR 下降,作者将其归因于推理退化而非对齐增强。

    作者分析量化、剪枝和 KV 缓存压缩如何同时改变 LRM 的显存、推理和越狱脆弱性。。

    深度解读完整解读
  6. 可解释性arXiv 2609.11780

    用权重谱密度预测隐私泄露:WeightWatcher 谱指标可作为成员推理攻击脆弱性的代理

    检验权重谱度量能否代理成员推断泄漏

    发表
    测试
    MLP-1×4096、MLP-2×1024、MLP-2×2048 等 11 个
    摘要作者认为谱度量与泛化差距互补,有望用于无数据的模型级筛查。

    作者在 MLP 上检查 WeightWatcher 谱统计是否与 online LiRA 同向,以便不看数据、不训练 shadow 模型就做模型级成员风险筛查。放出前的审计要知道训练成员会不会被认出来。LiRA 依赖大量 shadow 模型,候选一多就难以逐个跑。

    深度解读完整解读
  7. 分析与理论arXiv 2609.32116

    研究提出 Best-of-N 越狱的物理势垒模型,挑战攻击成功率幂律规律

    用物理陷阱模型描述 Best-of-N 越狱的攻击面规律

    发表
    测试
    Qwen2.5-7B (base)、Llama-3.1-8B-Instruct、Qwen2.5-3B-Instruct 等 5 个
    摘要四参数势垒模型拟合 BoN 的两预算面,并把指数交叉归因于数据集有限。

    Biroli 用一个玻璃陷阱式的微观模型,把 Best-of-N 越狱写成熵瓶颈加能量鞍点,并用四个数描述 (N, M) 攻击面及温度依赖。。

    深度解读完整解读
  8. 分析与理论arXiv 2609.33909

    近重复家族干扰精确记录成员推断

    分析近重复族如何让精确记录成员推断误判为入训

    发表
    测试
    Pythia-2.8B、GPT-2、Qwen3.5-2B 等 5 个
    摘要近重复使干净参照 MI 把族级暴露当成精确记录。

    作者研究成员推断能否作为精确记录的数据来源证据。版权和来源审计需要的是该记录本身是否入训,而网页语料中的转载、镜像和轻改会让非同一近重复产生成员样分数。四世界审计用 E 表示精确记录是否入训、用 F 表示其近重复族是否在场,从而分开 H00 到 H10 的标准 MI、H00 到 H01 的族偏移,以及 H01 到 H11 的 exact-given-family。

    深度解读完整解读
已经到底了