跳到正文
10月10日 · 周六

全部论文

找到 4 篇

另有 241 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 分析与理论arXiv 2610.07005

    研究审计 Qwen2-Audio 音频越狱 AdvWave-P 的频率与解码层归因

    遮挡审计 AdvWave-P 音频越狱的频带必要性与解码层关联

    发表
    被测模型
    Qwen2-Audio-7B-Instruct、LLaMA-Omni
    摘要AdvWave-P 的八频带排序与能量相关。

    这是对加性音频越狱 AdvWave-P 的频率与解码器深度审计,受害模型主要是 Qwen2-Audio-7B-Instruct,不提出新攻击。

    深度解读完整解读
  2. 分析与理论arXiv 2609.37312

    研究:隐蔽推理必然留下信息痕迹,但思维链未必可读

    分析隐蔽推理在思维链监控下的信息足迹下界与不可读性

    发表
    被测模型
    Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct、Qwen 3.5 397B-A17B 等 12 个

    摘要论文从理论与实证探明了思维链监控的边界:复杂隐蔽计算必然泄露信息足迹且需承担长度税,但该足迹可被在线加密而不可读。

    深度解读完整解读
已经到底了