跳到正文
10月8日 · 周四

可解释性 · 论文

找到 4 篇
筛选

系统形态

层

系统组件

被测模型厂商

同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 171 篇还没打标签,不在筛选结果里。

另有 104 篇还没有研究类型,暂不在这些分类里。

  1. 评测与基准arXiv:2610.04575 ·

    论文提出 Operational Validity Contract,审计激活监控从探针分数到告警策略的有效性

    提出操作有效性契约,审计激活监控从探针分数到告警策略的有效性

    AI Agent测试Qwen2.5-7B-Instruct、Llama-3.2-3B、Qwen2.5-7B 等 4 个应用层
    摘要论文建立从探针得分到警报策略的审计框架,实证表明高 AUROC 不等于部署有效性,仅支持受限预测价值。

    这篇论文系统评估了大模型智能体激活监控器从离线探针得分向在线警报策略跨越时的统计与操作有效性。

    完整解读
  2. 评测/基准arXiv:2609.03026 ·

    ObserverBench:用干预与控制任务检验机制可解释性估计

    ObserverBench 把内部估计器按固定任务比较预测误差与所选动作损失,称更好的效应预测并不总带来更低动作损失。

    测试two-block Transformers、GPT-2-small、Qwen2.5-7B 等 6 个
    摘要ObserverBench 在固定决策下分开报告估计精度与动作损失,三者可以不一致。

    ObserverBench 评测一个内部观察器是否够格指导某项具体干预、闭环或安全策略,而不是只看平均估计精度。

    完整解读
  3. 评测/基准arXiv:2609.03511 ·

    多语言 LLM 在语义保持结构扰动下的结构敏感性:IndicReStruct 基准与机制可解释性分析

    AI 导读研究用印地语和马拉雅拉姆语的成分重排与主动被动语态转换两种语义保持扰动,构建了基于 GSM8K 的 IndicReStruct 基准(含 GSM8K-Reordered 和 GSM8K-Voice 两个变体),在六款 SOTA LLM 和多种提示策略下观察到数学推理性能一致且显著的下降。

    测试Gemma-2-9B-it、Gemma-2-27B-it、GPT-OSS-20B 等 7 个
    摘要保语义的重排和语态变化会降低印地语与马拉雅拉姆语数学推理准确率,轻量微调未能补上。

    IndicReStruct 用保语义的成分重排和语态变换,检验多语言 LLM 的数学推理是否依赖表层语序。

    完整解读
  4. 评测/基准arXiv:2609.09113 ·

    SAEScientist-Bench:AI 智能体能否自主开展 SAE 可解释性研究

    AI 导读论文提出 SAEScientist-Bench,用于评估 AI 智能体能否像研究者一样使用 SAE 工具自主完成机制可解释性发现。

    测试Kimi K3、Claude Opus 5、Claude Sonnet 5 等 12 个
    摘要SAEScientist-Bench 显示前沿智能体能找到选择性 SAE 特征,但因果 steering 仍明显低于 Expert。

    SAEScientist-Bench 评测 AI 智能体能否用预训练 SAE 自主完成“给定概念、找出一个特征”的机制发现。

    完整解读
已经到底了