跳到正文
10月9日 · 周五

可解释性 · 论文

找到 1 篇
筛选4
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 61 篇还没打标签,不在筛选结果里。

另有 61 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 研究用因果审计揭示多模态模型视觉工具调用的假象

    用因果审计检验视觉工具观察是否真正改变答案

    发表
    场景
    AI Agent
    测试
    DeepEyes、Pixel Reasoner、Mini-o3 等 6 个
    摘要聚合增益集中在 Calibrated 少数轨迹,作者称之为视觉工具使用的错觉。

    对六个 thinking-with-images 模型做因果审计,检查 crop-and-zoom 返回的观察是否中介最终答案。

    深度解读完整解读
已经到底了