跳到正文
10月9日 · 周五

可解释性 · 论文

找到 9 篇
筛选6
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 61 篇还没打标签,不在筛选结果里。

另有 61 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2610.04575

    论文提出 Operational Validity Contract,审计激活监控从探针分数到告警策略的有效性

    提出操作有效性契约,审计激活监控的告警策略

    发表
    测试
    Qwen2.5-7B-Instruct、Llama-3.2-3B、Qwen2.5-7B 等 4 个
    摘要论文建立从探针得分到警报策略的审计框架,实证表明高 AUROC 不等于部署有效性,仅支持受限预测价值。

    这篇论文系统评估了大模型智能体激活监控器从离线探针得分向在线警报策略跨越时的统计与操作有效性。

    深度解读完整解读
  2. 评测与基准arXiv 2610.02928

    研究用变异分析检验智能体基础设施验证套件的覆盖能力

    用变异分析检验会话投影层不变式套件的缺陷覆盖

    发表
    摘要作者称通常的通过/失败证据价值不大:认证过的套件仍只杀死十个外部故障中的五个。

    作者测量一套看守智能体基础设施的不变式套件:通常拿来许可部署的「通过正确代码、失败损坏代码」,实际上能支持什么。

    深度解读完整解读
  3. 分析与理论arXiv 2609.23215

    研究审计 Active Inference Agent 的 LLM 解释器失败模式

    审计 Active Inference Agent 上 LLM 解释器的监督叙述失败

    发表
    测试
    GPT-4o、Claude-3-Opus、Gemini
    摘要三组触发下解释流畅但错误,所提缓解都未被评估。

    作者审计的是挂在智能体上的运行时解释器,而不是智能体本身。操作员读到的是信念与动作的自然语言叙述。作者要问哪些可复现触发会让这段叙述失败,以及失败痕迹是什么样。

    深度解读完整解读
  4. 研究用因果审计揭示多模态模型视觉工具调用的假象

    用因果审计检验视觉工具观察是否真正改变答案

    发表
    场景
    AI Agent
    测试
    DeepEyes、Pixel Reasoner、Mini-o3 等 6 个
    摘要聚合增益集中在 Calibrated 少数轨迹,作者称之为视觉工具使用的错觉。

    对六个 thinking-with-images 模型做因果审计,检查 crop-and-zoom 返回的观察是否中介最终答案。

    深度解读完整解读
  5. SAEScientist-Bench:AI 智能体能否自主开展 SAE 可解释性研究

    提出 SAEScientist-Bench 评测智能体自主发现 SAE 特征

    发表
    场景
    AI Agent
    测试
    Kimi K3、Claude Opus 5、Claude Sonnet 5 等 12 个
    摘要SAEScientist-Bench 显示前沿智能体能找到选择性 SAE 特征,但因果 steering 仍明显低于 Expert。

    SAEScientist-Bench 评测 AI 智能体能否用预训练 SAE 自主完成“给定概念、找出一个特征”的机制发现。

    深度解读完整解读
  6. 防御arXiv 2609.11085

    超越求解器判定:面向自动形式化的生成式奖励模型

    提出 GenV,检测求解器判定无法区分的不忠实形式化

    发表
    测试
    GenV+HN、GenV、27B LM (LoRA) 等 15 个
    摘要GenV+HN 用离线 Z3 等价标签训练无参考 Yes/No 分数,用来标记 VPU 并分配测试时计算。

    GenV+HN 针对神经符号翻译之后、求解器证书之前的对应失败:编码可以与指定参考共享求解器判定,同时并不等价。

    深度解读完整解读
  7. 可解释性arXiv 2609.34686

    研究揭示工具智能体中越狱上下文残留导致的安全路由分化

    用配对续写与激活修补揭示工具智能体越狱后的安全路由分化

    发表
    场景
    AI Agent
    测试
    Qwen3-14B、Qwen3.5-9B、Qwen3.5-27B 等 8 个
    摘要越狱后的同一安全反馈在八个工具智能体上分成三条路由,因果集中在最后几层并可作预测基线。

    这篇工作把越狱上下文残留之后的运行时安全反馈,做成工具智能体上的三路路由问题,并用激活修补给这个路由一个晚层的因果位点。作者认为,反馈可能恢复合法执行、留下未授权动作,或误伤良性流程,而现有攻击、基准和静态护栏没有在固定历史上把这三种结局分开。配对续写因此从同一冻结检查点分别接中性提醒 N 和安全反馈 S,并交叉保留越狱 J+ 与中和越狱 J0。

    深度解读完整解读
已经到底了