跳到正文
原文
arXiv· arXiv:2609.35261· Guanxu Chen·· 3 天前

Imprint Reader:从权重更新读出到行为干预

Imprint Reader: From Weight-Update Readout to Behavioral Intervention

AI 导读

研究者提出 Imprint Reader,用 Semantic Mount-and-Read Tuning(SaRT)训练模型为冻结的权重更新生成自然语言描述,SMaRT 将每次更新挂载到 Reader 上并用无锚点元查询引出描述,同时用无变化和随机扰动对照抑制无依据的断言。在留出更新上,联合 Reader 在知识维度取得基于评判的 Pass@100 为 2%,行为维度为 16%,作者认为这证明了自然语言读出的可行性,跨更新的可靠性是下一步。

阅读原文arxiv.org