跳到正文
10月10日 · 周六

全部论文

找到 10 篇

另有 201 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2610.09819

    FAB 攻击:给 HuBERT/WavLM 植入后门,背景警笛声即可让下游语音任务失灵

    提出 FAB 攻击,向声学基础模型植入可由环境声触发的后门

    发表
    被测模型
    HuBERT-base、WavLM-base

    摘要论文提出了针对声学基模的 FAB 后门攻击,在弱威胁模型下实现了任务无关、物理可触发的后门植入。

    深度解读完整解读
  2. 攻击arXiv 2609.27542

    研究者用控制 token 注入删除 gpt-oss-20b 推理链并绕过思维链监控

    提出控制标记注入,清空工具 Agent 的思维链以绕过推理监控

    发表
    场景
    AI Agent
    被测模型
    openai/gpt-oss-20b、google/gemma-4-26B-A4B-it、deepseek-ai/DeepSeek-R1-Distill-Qwen-7B 等 4 个

    摘要论文阐明控制标记注入可抑制 CoT 使监控失效并促成拒绝绕过,且工具执行受解析器宽容度影响。

    深度解读完整解读
  3. 攻击arXiv 2604.14604

    AudioHijack 框架对 13 个语音大模型实现隐蔽音频提示注入

    提出 AudioHijack,用不可感知对抗音频对语音模型做上下文无关提示注入

    发表
    被测模型
    SpeechGPT、GLM-4-Voice、VITA-Audio 等 15 个

    摘要提出了 AudioHijack 框架,揭示了 LALM 对听觉提示注入的脆弱性与传统防御的局限。

    深度解读完整解读
已经到底了