全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 7 条- 论文论文追踪
论文提出 Operational Validity Contract,审计激活监控从探针分数到告警策略的有效性
论文区分激活探针的高 AUROC 与部署中按误报预算设定的告警阈值,指出二者衡量的目标不同。作者提出 Operational Validity Contract,用目标、可观测性、身份、时机、单元、对照、校准与成本八个字段限定监控声明,强调探针分数不能直接证明实际告警策略有效。
- 论文论文追踪
研究用因果审计揭示多模态模型视觉工具调用的假象
研究者对多模态大语言模型的“thinking-with-images”范式做因果审计,发现视觉工具调用带来的准确率提升并非普遍来自返回的视觉证据。作者把视觉工具使用建模为因果图,区分观察中介路径与动作引发的捷径,并在策略、轨迹、步骤三个层面做干预,其中步骤层面的 Visual Evidence Gain 用于分离单次返回观察的贡献。在六个代表性模型和五个细粒度感知基准上,审计发现两类失败模式:Calling Without Looking 中返回的观察对答案没有因果影响,Looking Without Planning 中观察有信息但调用时序不连贯。轨迹层面的诊断显示,策略层面的准确率增益集中在少数校准良好的样本上,作者将这种总体增益与因果无效并存的现象称为视觉工具使用的假象。代码已公开,论文被 EMNLP 2026 Findings 收录。
- 论文论文追踪
研究者提出基于参考的隐藏状态相对表示偏见检测方法
研究者提出一种基于参考的偏见审计方法,通过隐藏状态的相对表示检测模型变体(如微调前后)的偏见变化。由于微调会重塑表示几何,绝对隐藏状态不可直接比较,方法用每个句子与固定锚句的相似度编码,在共享比较空间中衡量目标群体与正负属性的关联偏移,称为表示偏见偏移 ΔB。在三个模型族和 WildGuardMix、DecodingTrust、ToxiGen 基准上,ΔB 在 18 个测试设置中的 15 个与输出级偏见变化相关,全量微调下达到 |r| = 0.84(p < 0.001),参数高效适配下更依赖具体模型。对 ΔB 设阈值可识别偏见上升的检查点,ROC AUC 在 0.65 到 0.99 之间,在 WildGuardMix 和 DecodingTrust 上对三个模型族的区分效果均优于基于 SEAT 的基线。作者认为该方法与基于输出的审计互补而非替代。
- 论文arXiv:可解释性
ObserverBench:用干预与控制任务检验机制可解释性估计
研究者提出 ObserverBench,一个用于检验内部估计器(observer)是否足以支撑干预、控制或安全任务的基准框架。每个任务固定模型、信息边界、允许动作、决策规则、留出案例和损失,并分别报告估计准确率与所选动作造成的损失。在 GPT-2-small 和 Qwen2.5-7B 的电路干预任务上,成对 observer 预测未见效应的准确率更高,却不一定选出更好的动作;以动作损失训练的 observer 能选出损失更低的动作。在安全分诊中,能完美区分违规的分数在违规成本不同时仍可能分配不好固定干预预算。
- 论文arXiv:可解释性
多语言 LLM 在语义保持结构扰动下的结构敏感性:IndicReStruct 基准与机制可解释性分析
研究用印地语和马拉雅拉姆语的成分重排与主动被动语态转换两种语义保持扰动,构建了基于 GSM8K 的 IndicReStruct 基准(含 GSM8K-Reordered 和 GSM8K-Voice 两个变体),在六款 SOTA LLM 和多种提示策略下观察到数学推理性能一致且显著的下降。残差流激活修补实验显示,推理失败常源于实体与数量对齐被破坏,中间 Transformer 层对推理恢复贡献最大。结果表明当前多语言 LLM 对表层句法实现高度敏感,缺乏对语义等价输入的组合不变性。
- 论文arXiv:可解释性
SAEScientist-Bench:AI 智能体能否自主开展 SAE 可解释性研究
论文提出 SAEScientist-Bench,用于评估 AI 智能体能否像研究者一样使用 SAE 工具自主完成机制可解释性发现。给定目标概念后,智能体需设计对比探针,并在 Gemma-2-9B-IT 的 Gemma Scope 字典中检索 131K+ 个特征,找出最优特征。评测以 Neuronpedia 上经专家整理的参考特征为基准,从激活排名、对比文本上的概念选择性以及因果引导三个维度打分。在 10 种智能体配置和 20 项任务中,前沿智能体展现出真实的发现能力,并在不同评测维度上各有领先,但整体仍明显落后于专家基线:在区分目标概念与对比控制项上接近专家水平,在因果生成引导上差距较大。
- 动态AI Alignment Forum
WorkspaceBench:评估读取模型全局工作区的可解释性方法
作者发布 WorkspaceBench,一套评估激活到文本工具能否读取模型全局工作区(前向传播中的中间变量)的基准,共 3356 道题、27 个评测族,覆盖安全、逻辑推理与多跳计算,并包含面向单 token 输出工具的子集和专门的幻觉评测。基准基于 Qwen-3.6-27B 开发,作者预期可用于更大模型,但更小或更弱的模型可能需要调整。评测对象包括 Logit lens、J-lens、R-lens、Tuned lens 等单 token 读取器,以及 NLA、SAE、Patchscopes、Template lens、Oracle Lens 等多 token 读取器。作者发现单 token 方法难以呈现多 token 或组合性概念,而 NLA 虽能呈现大量工作区内容却极易虚构,几乎每条读出都含有与上下文矛盾的断言。