跳到正文

从来源,看到研究的联系

让信息汇流,让研究相连。点选一条线索,看它从哪里来、通向哪些方向。

图中 6 条 · 本页 24 条 · 共 25 条动态论文会议论文
关系图可左右滑动,完整标题也在下方列表中
1 / 4
材料关系图:来源、新闻与研究、细分方向的桑基流图01来源502新闻与研究603细分与主体7来源:X @JSchaeff3rX @JSchaeff3r1 条材料来源:BlueDot ImpactBlueDot Impact1 条材料来源:ARCARC1 条材料来源:arXiv:可解释性arXiv:可解释性2 条材料来源:Thinking MachinesThinkingMachines1 条材料动态:CIAware-Bench 衡量 AI 控制干预感知动态2026-06-15CIAware-Bench 衡量 AI 控制干预感知动态:Persona Explorer:用 SAE 探索 LLM 中的人格与人格漂移动态2026-03-11Persona Explorer:用 SAE 探索 LLM 中的人格与人格漂移动态:ARC 联合 AIcrowd 发起白盒估计挑战赛动态2026-06-02ARC 联合 AIcrowd 发起白盒估计挑战赛论文:DiDAE:面向视觉基础模型的快速解耦反事实解释方法论文2026-10-02DiDAE:面向视觉基础模型的快速解耦反事实解释方法动态:Thinking Machines Lab 发布交互模型研究预览:原生实时人机协作动态2026-05-11Thinking Machines Lab 发布交互模型研究预览:原生实时人机协作论文:LocUS:面向定向激活引导的注意力头选择与子空间投影论文2026-09-25LocUS:面向定向激活引导的注意力头选择与子空间投影方向:安全评测安全评测1方向:AI 控制AI 控制2方向:Google DeepMindGoogleDeepMind1方向:工具与开源工具与开源6方向:可解释性可解释性4方向:对齐对齐4方向:其他方向其他方向1
流带宽度表示材料数量,多标签均分;连线表示来源与分类归属。1 个较少出现的方向归入「其他方向」,点选可查看。

点选节点,展开一条线索

查看材料的摘要与原文,或探索同一来源、同一方向下的内容。

本页材料

完整标题与摘要 · 24 条
  • 动态X @JSchaeff3r

    CIAware-Bench 衡量 AI 控制干预感知

    AI 有时能察觉控制干预,但检测大多接近随机水平。感知能力取决于智能体、监控器和环境这三元组合。我们构建了 CIAware-Bench 来衡量控制干预感知。🧵

  • 动态BlueDot Impact

    Persona Explorer:用 SAE 探索 LLM 中的人格与人格漂移

    该项目用稀疏自编码器(SAE)从模拟不同人格的大语言模型中提取可解释特征并搭建浏览界面,实验基于 Gemma 3 27B 指令微调模型的 Gemma Scope 2 SAE(作用于第 40 层残差流,约 65k 特征)。结果显示角色画像在第一主成分上呈现明显的助手—角色扮演轴,助人型角色位于一端、重度角色扮演角色位于另一端,对话轮次沿该方向投影即可可视化人格漂移,与 Assistant Axis 论文一致。

  • 动态ARC

    ARC 联合 AIcrowd 发起白盒估计挑战赛

    ARC 与非营利组织 AIcrowd 合作启动 ARC White-Box Estimation Challenge,面向随机初始化的宽 MLP 征集能降低期望输出均方误差的白盒估计算法。热身轮于本周开始,后续轮次总奖池至少 $100,000,固定宽度 n=256、隐藏层数 L=8,并配套设计了一套 FLOP 计数方案以减少高度优化数值内核带来的优势。比赛允许参赛者自由选择白盒或黑盒方法并使用 LLM 辅助提交,最终目标是推动可用于高智能 AI 系统内部结构探测的方法进步。

  • 论文arXiv:可解释性

    DiDAE:面向视觉基础模型的快速解耦反事实解释方法

    针对基础模型易受虚假相关性和“Clever Hans”策略影响的问题,研究者提出解耦扩散自动编码器(Disentangled Diffusion Autoencoders,DiDAE)。该方法将冻结的基础模型包裹在条件扩散解码器中,通过沿解耦字典方向做闭式编辑并解码来生成反事实,无需梯度计算,速度最高可达当前最优方法的 2000 倍。在六个数据集上的实验表明其反事实质量相当或优于现有方法,并能借助 CFKD 修复下游分类器,效果超过基于元数据的校正方案。

  • 动态Thinking Machines

    Thinking Machines Lab 发布交互模型研究预览:原生实时人机协作

    Thinking Machines Lab 发布交互模型(interaction models)研究预览,该模型从零训练,原生处理交互而非依赖外部脚手架,可连续接收音频、视频和文本并实时思考、回应与行动。模型采用多流、微轮次(micro-turn)设计以保证实时响应,支持无缝对话管理、言语与视觉插话、同时说话、时间感知以及边听说边并发调用工具、搜索和生成 UI。研究预览在智能与响应速度的综合表现上达到 SOTA,并展现出质变的新交互能力。

  • 论文arXiv:可解释性

    LocUS:面向定向激活引导的注意力头选择与子空间投影

    LocUS(Localized Unembedding Steering)将激活引导约束到模型自身输出词表子空间,通过识别 unembedding 矩阵中属性专属的线性子空间,把引导变换限制在该子空间内,并只作用于稀疏的注意力头子集。在三个模型族上针对毒性缓解、情感转向与谄媚抑制的评测显示,LocUS 匹配或超越 SOTA 基线,仅干预不到 6% 的参数,且更好地保留通用能力。

  • 论文arXiv:可解释性

    DAFI:面向 SAE 特征双端解释的智能体方法

    论文提出功能解释(functional interpretation),把 SAE 特征刻画为从激活输入语义到干预下输出效果的映射,并给出智能体方法 DAFI,通过组件级反馈主动收集证据并迭代改进输入端、输出端与功能解释。其短上下文 token 探测可按需收集激活证据,无需全语料扫描。在 GemmaScope 上,DAFI 的 Input score 比 SAGE 高 13.1 个百分点,Output score 比 Token Change 高 38.9 个百分点,且比通用编码智能体更省 token。

  • 论文arXiv:可解释性

    用稀疏自编码器探索文本分类模型:SAEfarer 工具与专家评估

    研究者用稀疏自编码器(SAE)分析文本分类语言模型的行为,提出探索 SAE 特征与模型预测及错误之间关系的技术,并将其集成到工具 SAEfarer 中。该工具用于分析文本分类 LM 学到的概念,并在由五名博士生参与的专家试点评估中接受检验。论文共 11 页、13 张图,已被 IEEE VIS 2026 接收为短文。

  • 论文arXiv:对齐、欺骗与监督

    CATCH:面向编码 RL 奖励作弊的可控分析测试台

    研究者提出 CATCH,一个用于研究编码强化学习中奖励作弊的可控测试台。它刻意暴露环境漏洞,并通过对比脆弱评估器下的成功与独立审计下的任务正确性,给出基于执行的黄金标签。CATCH 还能通过监督微调数据配比控制模型初始的作弊倾向,并通过奖励设计控制获得奖励的难度,从而系统比较作弊动态与干预手段。实验显示 CATCH 能产生带有明显奖励作弊的多样 RL 训练轨迹,初始模型与奖励难度共同影响作弊的出现。作者进一步评估了多种奖励作弊检测与缓解方法,发现思维链监控起初能抑制作弊,但随着策略模型学会用代码注释误导监控,这种保护会逐渐失效。

  • 论文arXiv:危险能力与安全评测

    Djinnlang:用 LLM 编译器实现无歧义规格的高级编程

    Djinnlang 是一种只写规格、不写可执行代码的高级规格语言,由 LLM 在编译器内填充实现与证明。它要求 LLM 除证明实现满足规格外,还须证明满足该规格的任意其他实现在相同输入下输出相同,即约束关系是确定性的,从而不给程序语义留任何余地。其符号翻译器将规格降为 Dafny 桩与证明义务,由驱动框架调度 LLM 补全,全部经 Dafny 验证器检查;该语言已实现自举,LLM 可依规格实现 Djinnlang 翻译器且重实现能自验证。

  • 动态METR

    METR 微调实验:少量指令微调即可提升思维链可控性

    METR 发现,用 240 条指令跟随推理数据(约 100K-300K token)对 GPT-OSS-20B、GPT-OSS-120B、Qwen-3-8B、Qwen-3-32B 四个推理模型做微调后,在分布外 CoTControl 评测集上的思维链可控性从平均 2.9% 升到 8.8%。提升最大的是指定大小写推理、抑制特定词和向推理中插入指定句子这几类指令。作者指出 8.8% 绝对值仍低,但说明少量微调即可提升可控性,这一能力可能是模型潜在具备而非新学到的。局限包括前沿实验室不太可能专门为可控性做微调、尚未证明可控性提升会降低可监控性、以及多轮或 Agent 场景下影响不明。

  • 动态Redwood Research

    Redwood Research 新论文:AI 控制中的重试与重采样对比

    Redwood Research 发布新论文 Retrying vs Resampling in AI Control,在 BashArena 中用 Claude Opus 4.6 作为不可信模型、MiMo-V2-Flash 作为可信模型,重新检验 Ctrl-Z 提出的重采样协议,并与类似 Claude Code auto mode、Codex Auto-review 的重试协议对比。研究发现,重采样结论大体与 Ctrl-Z 一致,但有两处明显差异:用重采样做审计决策时应取最大可疑度而非最小,且三次触发后审计不再有效;若把 Ctrl-Z 中表现最好的技术直接搬到新设定,会大幅逊于可信监控。

  • 动态Redwood Research

    Redwood Research 提出不可信建议协议:每步 16 字符建议可恢复 67% 能力差距

    Redwood Research 提出不可信建议(untrusted advice)协议,让可信执行模型 T 承担全部动作,不可信强模型 U 只能通过受限通道发送简短建议,从而把 U 的影响压缩到可监控的窄通道内。在 SWE-bench Verified 上,U 每步最多写 16 字符建议即可恢复 T 与 U 之间约 67% 的能力差距,整个任务累计约 320 字符;实验用 Claude Sonnet 4.6 作为 U,Gemini 3.1 Flash Lite 和 gpt-oss-120b 作为 T,在 SWE-bench Verified 与 BashArena 各 200 个任务上评测。

  • 动态Transformer Circuits

    Anthropic 发布 Transformer 逆向工程数学练习集

    Anthropic 的可解释性团队发布了一套配套其 Transformer 数学框架的练习集,要求读者为注意力头写出具体权重矩阵以实现特定算法,并附有解答。练习分三部分:热身题讨论单个注意力头如何用 W_Q、W_K、W_V、W_out 描述信息在残差流子空间之间的读写,以及 W_Q^T·W_K 和 W_out·W_V 的含义与秩;练习一用两个前一个 token 注意力头构造出看向两个 token 之前的虚拟注意力头,并展开 W_net 矩阵;练习二和练习三分别用指针算术和前一 token K-Composition 两种方式手工搭建归纳头,后者适用于 rotary attention 这类不向 W_V 暴露位置信息的机制。

  • 动态Failure-First

    FAR:面向机器人策略失败恢复与持续改进的 Failure-Aware Retry 框架

    Hao 等人提出 FAR(Failure-Aware Retry)框架,让离线示范训练的机器人在遇到分布外状态导致抓取失败时可自主重试并就地调整行为。该框架通过 IQL 的价值估计检测价值骤降来定位引发失败的动作块,并用 FCPA 构造对比偏好对进行参数化更新,同时向动作注入经指数平滑的高斯扰动做结构化探索。仿真与真机实验中该方法优于朴素重执行,并能将成功轨迹回灌三个缓冲区实现在线持续改进。 要点: - 问题根源在于模仿学习缺乏纠错机制,偏离训练分布后会陷入相同失败的反馈循环。 - FCPA 以最低 ρ 百分位的 ΔV 动作作为负样本,从当前策略采样高价值候选作正样本优化偏好目标。

  • 动态DeepMind Safety Research

    Google DeepMind 推出 AGI 安全短期课程

    Google DeepMind 发布了面向学生、研究人员和相关从业者的 AGI 安全短期课程,总时长 75 分钟,由录制讲座和练习组成,并配有幻灯片和练习手册。课程涵盖 AI 对齐问题及技术与治理层面的应对思路,内容包括刻意规划带来的风险、规格博弈与目标错误泛化两种错位目标来源、知情监督原则以及危险能力评估等前沿安全实践。若想进一步参与该方向工作,研究科学家与研究工程师岗位申请开放至 2 月 28 日。

  • 动态Goodfire Research

    Goodfire 复现 GPT-2 Small 的跨层转码器电路追踪

    Goodfire 在 GPT-2 Small 上训练跨层转码器(CLT),复现并验证其半自动发现模型内部计算结构的能力。CLT 用 FineWeb 的 100M token 训练,扩展因子 64,每层 49,152 个特征、12 层共 589,824 个特征,激活函数用 ReLU。在 greater-than 任务上,CLT 成功识别出可解释特征(包括抽象的奇偶特征),但发现的机制与 Hanna 等人此前的结果存在差异,提示稀疏解释器模型对计算机制的表示与分解可能有所不同。

  • 动态Goodfire Research

    Goodfire 用自校正搜索加速材料发现,将扩散模型的候选材料产出提升约 30%

    Goodfire 与 Radical AI 合作,通过给扩散模型加入基于其内部表征的反馈回路实现自校正搜索,使目标范围内可用候选材料的生成量提高约 30%。该方法针对 MatterGen 的条件生成流程改进逆设计环节,衡量指标为同时满足稳定、独特和新颖三个约束的 SUN 标准。现有基线中仅 15% 的 MatterGen 采样落在 4–6 eV 带隙目标区间内,若再叠加 SUN 过滤则降至 6.5%,且仅有约 10% 的微调候选能通过全部筛选阶段。该技术原则上适用于任意扩散模型,有望推广到蛋白质设计与药物发现等领域。

  • 动态Goodfire Research

    Goodfire《神经几何》系列:从激活空间结构理解与控制神经网络

    Goodfire 发文提出"神经几何"研究方向,主张神经网络激活中蕴含丰富几何结构——星期呈圆形排列、颜色构成 HSL 流形、生命树出现在基因组表征中,可作为理解、改进和控制模型的抓手。该系列收录多项工作:沿弯曲流形的引导比传统线性引导向量产生更精准的行为改变;Llama 3.1 8B 内被发现一个基于圆形数值表示的加法模块;Block-Sparse Featurizers(BSF)将视觉模型激活分解为多维子空间并实现细粒度引导,且多数概念是多维的。

  • 论文arXiv:可解释性

    PersonaDose:面向分级特质控制的校准激活引导

    PersonaDose 通过特质描述与目标平均强度来控制语言模型的人格表达,将共享的描述条件化 FLAS 控制器在人格响应上特化,并用实测特质表达校准其 flow time,训练响应不与目标强度配对。在 Llama-3.1-8B、Qwen3-8B 和 Gemma-3-4B 上,该方法在 Persona Vectors 75 连贯性下限处,核心特质表达分别比对比激活加法高出 33.2、18.3 和 17.8 分。七个已训练特质上,校准请求在每模型 28 个目标中 14-22 个可达目标上的平均定位误差为 4.7-6.2 分。

  • 动态Transformer Circuits

    Anthropic 开源注意力头可视化工具 HeadVis

    Anthropic 可解释性团队发布交互式工具 HeadVis,用于研究大语言模型中的注意力头,并开源了前端代码与后端接口规范。工具通过注意力模式可视化、分布指标、低秩分量投影以及经 QK 和 OV 电路的 SAE 特征归因,帮助生成和检验关于注意力头功能的假设。作者用 Claude Haiku 3.5 做了四个案例:归纳头在特征基上表现为模糊归纳;此前研究的行宽头在完整分布上呈现年份、多 token 词和换行三种行为,PCA 显示 Q、K、O 激活可清晰聚类;答案选择头在更广分布上复用了同一套选择机制,虚拟权重分析提示它可能是单义的;同集合抑制头会抑制国家与其本国城市之间的注意力,在 185 句自造句子上有 98% 的情况成立。

  • 论文arXiv

    Q-learning Penalized Transformer(QPT):面向安全离线强化学习的训练-推理一致框架

    研究者提出 Q-learning Penalized Transformer(QPT),一种训练-推理一致的框架,将条件序列建模与约束感知的价值估计结合,用于安全离线强化学习。

  • 动态OpenAI Alignment Research

    OpenAI 开源思维链可监控性评测数据集与参考代码

    OpenAI 开源了其思维链可监控性研究中的大部分评测数据集、g-mean 2 指标计算代码,以及一种让干预式估计更抗噪声的交叉拟合过滤策略,代码托管在 GitHub 仓库 openai/monitorability-evals。

  • 动态Redwood Research

    Redwood Research 提议追踪架构对思维链可监控性的影响

    Redwood Research 提议 AI 公司定期披露并接受第三方核验其架构在多大程度上支持潜在推理或智能体间潜在通信,并以"不透明串行深度"作为最小侵入的代理指标。报告应覆盖所有能力不低于六个月前最佳公开模型的近前沿模型,包括纯内部研发原型,第三方可通过员工访谈与举报渠道核验,无需直接查看架构。公司还应每 6 个月公开可监控性压力测试结果、发布相关架构政策,并说明性能与可监控性之间的权衡。