跳到正文
今天10月8日周四
  1. Hugging Face Daily Papers · 收录 · 原文 论文40

    nanoMuse 发布开源个人智能体,跨设备共享对话并内置 Sentinel 动作审查

    nanoMuse 是一个以 GPL-3.0 许可发布的开源个人智能体,目标是在用户拥有的每台设备上运行同一个智能体,并让手机与电脑共享同一段对话。报告先以五个问题和三个时间尺度界定个人智能体,再依据 Meta 的公开记录和一份生产提示词副本分析 Meta 的 Muse 如何构建,并逐条标注来源。nanoMuse 通过任何人都可自建的 relay 共享对话,每个动作都经过 Sentinel 审查,记忆以用户可读的文件形式保存,模型由用户自行选择;其规模与成本以估算形式给出。开放记忆溯源、面向操作能力的评测套件以及配套开源模型被列为后续路线图。

10月7日周三
  1. 论文追踪 · 收录 · 原文 日期未知论文49

    SBW:面向 LLM 智能体的语义行为水印方法

    研究者提出语义行为水印(SBW),在历史条件下对语义动作簇而非精确动作符号嵌入水印,并用带密钥的抗碰撞分桶替代公开簇分桶,在随机预言机模型下证明新桶分配不可预测。此前三种智能体水印方案都绑定精确动作符号,仅改写观测即可让 AgentMark 的比特恢复率降至 16.8%。在五个智能体模型(3B-14B,四家厂商)和三个编码器上,ToolBench(每模型 600 条轨迹)在 1% FPR 下改写检测率为 0.49-0.66,精确符号方案为 0.05-0.17;ALFWorld(每模型 100 个回合)为 0.92-0.97 对 0.00-0.01。带密钥分桶把自适应伪造从 100% 降到假阳性下限。作者指出该保证不覆盖的边界:对抗者复制受害者自身步骤时,乱序拼接被中和(Qwen2.5-3B 上为 0.000),但链式重放在五个模型上仍达 0.76-0.98,作为开放问题报告。

  2. 论文追踪 · 收录 · 原文 论文53

    TRACE:仅凭 checkpoint 更新审计大语言模型有害目标

    研究者提出 TRACE,一种只读取 checkpoint 更新的权重审计方法,无需模型查询,也不需要接触未知的 SFT 数据。研究发现有害合规 SFT 会在 checkpoint 更新空间留下连续、依赖目标的排序:以纯有害合规、安全目标和良性效用三类 SFT 定义参考几何后,checkpoint 级坐标 s_H 能追踪受控的有害目标组成,在四个 7-8B 基座模型上 Spearman 相关系数为 0.986-0.992,更大模型规模上排序依然保持。对照实验显示该痕迹反映的是 SFT 目标而非有害输入暴露,也排除了有害样本数量或训练强度的简单解释。在分布偏移、未见数据、不同 SFT 配置、部分 checkpoint 访问以及 LoRA 与全参数微调下,该痕迹保持稳定,并与独立测得的攻击成功率正相关;在有害目标占比较低时仍有信息量。代码已公开。

10月1日周四
  1. Hugging Face Daily Papers · 收录 · 原文 论文46

    一个 AI token 值多少?研究者为野生 AI 生成网页文本提出新缩放定律

    研究者发现,经 FineWeb 质量过滤后,2026 年 6 月网页数据中有 27.5% 的 token 被 Pangram 判定为 AI 生成,到 8 月升至 31.1%。这类野生 AI 文本来自多个模型、面向人类读者、在预训练语料中不带标注。为量化其影响,研究者预训练了 800 个语言模型,改变加入的 AI token 与人类 token 比例,并分别对人类文本和 AI 文本的留出损失拟合缩放定律。结果显示,对数据不足的模型,加入 AI token 起初会降低人类文本损失,但收益很快饱和并转为损害;对使用大量人类文本训练的模型,AI token 几乎立即抬高损失,而同等数量的新鲜人类文本仍能持续降低损失。该定律在小模型上拟合后,可预测最多 3.6 倍大的模型受 AI 文本影响的人类文本留出损失,误差比现有最佳定律低 41%。

  2. arXiv · 收录 · 原文 论文8

    OLMo:加速语言模型科学研究

    为应对最强语言模型被专有接口封闭、训练数据与架构细节不公开的问题,研究者构建了真正开放的语言模型 OLMo。与以往仅发布模型权重和推理代码的做法不同,OLMo 同时公开了训练数据、训练代码与评估代码,以支持对语言模型偏见与潜在风险的科学研究的开展。

  3. arXiv:对齐、欺骗与监督 · 收录 · 原文 论文43

    Open-1B:一次完全可审计的训练运行

    作者提出一种新的模型透明度层级“完全可审计”,让训练中每个数据样本上的每一步操作都能在异构消费级硬件上以位级确定性独立复现。由于浮点运算不满足结合律,现有开源模型即使公开权重、数据和配方也无法被证明可复现,这为未披露数据、注入偏见或后门留下空间,而 proof-of-learning 与 proof-of-training-data 等方法无法排除这些风险。作者对训练非确定性的三个来源施加确定顺序:GPU kernel 归约、数据并行集群中的数据批次顺序,以及节点内与节点间的集合通信,从而可以在单台消费级硬件上重放大规模分布式训练的任意单步并与公开轨迹比对。

已经到底了