跳到正文

#非安全/通用AI

今天还没有收录新动态
9月17日周四
  1. arXiv:危险能力与安全评测 ·

    防技能退化设计:元认知反馈减少对 LLM 助手的认知卸载

    一项预注册在线实验(N=704,2×2 设计加无 AI 对照组)发现,元认知反馈能减少用户向 LLM 助手卸载答案的行为(OR=0.47),并提升随后无辅助测试的成绩(OR=1.51)。实验任务是借助仅在明确请求时才给出解答的 LLM 助手练习分数运算,之后进行无辅助测试。基于努力的奖励对卸载行为和测试成绩均未产生可检测影响。

9月5日周六
  1. arXiv:可解释性 ·

    动物重识别模型学到了什么?DINOv3 中线性生物概念及其来源

    基于 DINOv3 骨干、用 triplet-margin loss 微调的西部低地大猩猩重识别模型,其表征中性别与年龄以线性方向存在,对留出个体可达 0.91 AUROC,且每个个体仅需一张图像即可恢复。激活引导显示性别方向被模型因果使用,能显著改变预测性别;对比现成与微调骨干表明重识别训练并未创造这些概念,而是将其在网络中重新分布。数据归因进一步显示该表征反映渐变的生物轴、在群体中冗余编码,并受视觉模糊个体影响。

4月1日周三
  1. Goodfire Research ·

    Goodfire 用可解释性从表观遗传基础模型 Pleiades 中找出新型阿尔茨海默病生物标志物

    Goodfire 将可解释性方法应用于 Prima Mente 的表观遗传基础模型 Pleiades,发现 DNA 片段长度模式主导其从血液游离 DNA 检测阿尔茨海默病的决策,并由此提炼出一个人类可解释的分类器。该分类器仅用片段长度特征即在独立队列上取得 AUROC=0.78(95% CI [0.56–0.95]),加入此前文献报道的生物标志物类别后升至 AUROC=0.84(95% CI [0.66, 0.97])。研究表明片段组学可作为互补于既有预测指标的新型候选信号,但其临床应用仍需进一步验证。

已经到底了