跳到正文
10月8日 · 周四

全部论文

找到 3 篇

另有 725 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2609.27542

    研究者用控制 token 注入删除 gpt-oss-20b 推理链并绕过思维链监控

    提出控制标记注入,清空工具智能体推理链以绕过思维链监控

    发表
    场景
    AI Agent
    测试
    openai/gpt-oss-20b、google/gemma-4-26B-A4B-it、deepseek-ai/DeepSeek-R1-Distill-Qwen-7B 等 4 个

    摘要论文阐明控制标记注入可抑制 CoT 使监控失效并促成拒绝绕过,且工具执行受解析器宽容度影响。

    深度解读完整解读
  2. 攻击arXiv 2609.15989

    研究者提出 plan injection 攻击,可绕过思维链监控

    提出计划注入攻击,植入良性表述的有害计划以逃避思维链监控

    发表
    攻击者
    黑盒
    测试
    Qwen2.5-Coder-7B-Instruct、Qwen3-8B、DeepSeek-R1-0528 等 6 个

    摘要论文指出模型会将外部上下文中的伪装计划改写为自身推理,使思维链监视器失效甚至反向合理化恶意行为。

    深度解读完整解读
  3. 攻击arXiv 2609.28900

    Codetta:面向独立部署 LLM 智能体的高容量无密钥隐蔽串谋协议

    提出 CODETTA 隐写框架,使多智能体在审计下隐蔽传载荷

    发表
    测试
    Qwen2.5-7B、Llama-3.1-8B、Ministral-3-8B 等 8 个

    摘要提出非对称免密钥隐写框架 CODETTA,实现高容量不可区分通信,指出被动审计面临失效风险。

    深度解读完整解读
已经到底了