跳到正文
10月8日 · 周四

可解释性 · 论文

找到 1 篇
筛选2

系统形态

攻击者权限

攻击面/入口

层

被测模型厂商

同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 106 篇还没打标签,不在筛选结果里。

另有 106 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2607.23496

    Concept2Scenario:用 SAE 概念归因发现可迁移的越狱场景

    提出 Concept2Scenario,借助内部概念归因发现可迁移的越狱场景

    发表
    攻击者
    白盒、黑盒
    测试
    GPT-5、Qwen3.5-9B、Llama-3.1-8B 等 10 个

    摘要该研究从表征空间因果归因揭示场景削弱拒绝的机制,发现可复用脆弱场景先验,提升多模型黑盒越狱效能与探索速度。

    深度解读完整解读
已经到底了