跳到正文
10月9日 · 周五

全部论文

找到 8 篇

另有 669 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 可解释性arXiv 2609.03148

    LLM 如何处理上下文知识冲突:ContextConflict 数据集与机制可解释性分析

    构建 CONTEXT CONFLICT 解释模型如何表征并化解语境知识冲突

    发表
    测试
    gpt-5、claude-4.5-sonnet、gemini-2.5-pro 等 7 个
    摘要CONTEXT CONFLICT 显示模型能内部察觉冲突,却偏向靠前证据。

    CONTEXT CONFLICT 把问题从“参数知识对外部语境”转到“语境内部多来源证据互相冲突”,并同时给出数据、机制分析和一种无训练转向。

    深度解读完整解读
  2. 可解释性arXiv 2609.08173

    基于 SAE 引导的关键路径识别(KPI)解决知识冲突

    提出 KPI,用入度定位跨层关键路径并做 SAE 转向以解决知识冲突

    发表
    测试
    Llama-3-8B、Llama-3.1-8B、Gemma-2-9B 等 4 个
    摘要KPI 以入度关键路径替代大批 SAE 特征转向,在冲突 RAG 上提高忠实并减轻副作用。

    KPI 针对知识冲突 RAG 中的 SAE 转向:相关性批量改特征会带入冗余,少量因果上关键的特征即可完成转向。

    深度解读完整解读
  3. 可解释性arXiv 2608.29461

    因果模型定位并解锁模型中的故意藏拙行为

    提出因果模型定位残差流中的藏拙轴,并用单层 graft 在推理时解锁

    发表
    测试
    Qwen2.5-7B、Llama-3-8B、Mistral-7B
    摘要因果模型规定单层 graft 的窗口。

    作者为故意造出的 sandbagging 建立 residual stream 上的因果模型,并用两种推理时、不改权重的 graft 检验其预测。

    深度解读完整解读
  4. 可解释性arXiv 2609.38081

    Hessian Null Space Continuation:在单个神经网络解附近发现大量表征多样性

    提出 HNC,在单个解附近遍历保函数权重并比较内部表示

    发表
    测试
    64-unit tanh RNN、ViT-S/16、RNN policy (Plume Tracking) 等 5 个
    摘要HNC 在保持函数的局部权重区域里找到表示、动力学或行为不同的解。

    Hessian Null Space Continuation(HNC)用局部曲率,在单个已训练网络周围遍历近似保持输入输出的连通低损失区域,并可用可微目标做引导。作者要回答的是:这个区域里是否真有不同的内部机制,而不只是同一表示的小改动。做法是交替执行零空间内的平坦步与函数匹配损失上的梯度恢复。

    深度解读完整解读
  5. 可解释性arXiv 2609.37737

    研究用因果激活修补定位模型服从提示注入指令的决策层

    用因果激活修补定位模型服从提示注入的决策层

    发表
    测试
    Qwen3-4B、Qwen3-14B、Qwen3-32B 等 7 个
    摘要合规的因果杠杆集中在网络后三分之一的低秩子空间,该层也是混淆下检测最好的位置。

    这篇工作用逐层激活修补定位提示注入合规发生在网络何处,并把该位置用于检测验证。。

    深度解读完整解读
已经到底了