跳到正文
10月10日 · 周六

全部论文

找到 7 篇
筛选5
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 232 篇还没打标签,不在筛选结果里。

另有 232 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 分析与理论arXiv 2610.09004

    研究:去除有害信息不足以证明开源权重模型的抗篡改能力

    论证发布时互信息不能认证开源权重抗微调恢复

    发表
    被测模型
    EleutherAI/deep-ignorance-e2e-strong-filter、EleutherAI/deep-ignorance-unfiltered、Google BERT-Tiny 等 6 个
    摘要作者称零信息仍可一步恢复,表观抗微调可来自参数化。

    作者研究开源权重模型的篡改抵抗:发布时的互信息是否足以保证微调恢复很慢。

    深度解读完整解读
  2. 分析与理论arXiv 2610.07005

    研究审计 Qwen2-Audio 音频越狱 AdvWave-P 的频率与解码层归因

    遮挡审计 AdvWave-P 音频越狱的频带必要性与解码层关联

    发表
    被测模型
    Qwen2-Audio-7B-Instruct、LLaMA-Omni
    摘要AdvWave-P 的八频带排序与能量相关。

    这是对加性音频越狱 AdvWave-P 的频率与解码器深度审计,受害模型主要是 Qwen2-Audio-7B-Instruct,不提出新攻击。

    深度解读完整解读
  3. 分析与理论arXiv 2610.02504

    HXAI:分布式能源系统中的分层隐私保护可解释 AI 框架

    提出 HXAI 分层隐私解释框架,本地保留细解释并只发布加噪摘要

    发表
    被测模型
    gradient-boosted tree regression models
    摘要HXAI 把无噪声局部 SHAP 留在家庭内,只聚合差分隐私摘要。

    HXAI 是面向分布式能源系统的分层隐私保护解释框架,服务规划、监测与诊断,而不是实时控制。

    深度解读完整解读
  4. 分析与理论arXiv 2609.33898

    研究揭示训练效率与模型脆弱性的权衡:高效训练更易受对抗与隐私攻击

    比较高效与高成本训练的对抗和隐私脆弱性并分析损失几何

    发表
    被测模型
    ResNet-18、Swin Transformer、Qwen2.5-Math-7B-Instruct 等 7 个
    摘要效用匹配下,三种高效训练都伴随更高的隐私与对抗脆弱性及更尖的损失几何。

    作者在视觉分类和数学推理语言模型上,检查用更少数据或更简对齐换取训练效率时,安全性质是否一起变化。比较在任务效用接近的前提下进行。视觉侧用 KNN-Shapley 的高重要性小子集对照低重要性大子集,并用预训练微调对照从头训练。

    深度解读完整解读
已经到底了