跳到正文

可解释性

今天还没有收录新动态
10月3日周六
  1. Neel Nanda · 收录 · 原文 28

    Neel Nanda:可解释性尚不足以被依赖

    我坚持这一观点——可解释性可能意义重大,也确实足够有用,但远未达到任何人应当依赖我们来确保一切顺利的质量和可靠性水平。

    引用Palisade Research@PalisadeAI

    @NeelNanda5 is widely regarded as one of the top two experts on mechanistic interpretability in the world. “Speaking as an interpretability expert, please do not rely on us to save you on the current trajectory." https://youtu.be/J38ot52b2-E

  2. Neel Nanda · 收录 · 原文 25

    SAE 现状:有用但不够

    一篇关于 SAE 当前状态的好帖——有用,肯定没死,但单靠它不够。

    引用Goodfire@GoodfireAI

    Are SAEs dead? Will they save us from neuralese? Should I just use a probe? We get these questions all the time. Part 2 of our educational series on applied interpretability explains what SAEs are good for, when *not* to use them, and what to use instead. 🧵

10月1日周四
  1. Joe Carlsmith · 收录 · 原文 14

    Joe Carlsmith 论 AI for AI safety:用前沿 AI 劳动加固对齐安全因素

    Joe Carlsmith 在系列文章第四篇中提出"AI for AI safety",即用前沿 AI 劳动强化安全进展、风险评估与能力约束三大安全因素,以让 AI 安全反馈回路追上或约束 AI 能力反馈回路。他提出"AI for AI safety 甜蜜点"概念,指前沿系统足以大幅改善安全因素、但尚不足以在现有对策下剥夺人类权力的能力区间,并指出该窗口未必存在且难以持久。文章最后列出最严重的担忧,包括诱导/评估失败、差异性破坏与危险的失控选项,以及时间与政治意愿等现实约束,并将在下一篇聚焦自动化对齐研究。

9月30日周三
  1. Redwood Research · 收录 · 原文 48

    Redwood Research:潜在推理架构可能削弱思维链这一最强监控工具

    Redwood Research 发文论证,潜在推理架构允许模型在隐状态中完成更多计算,可能削弱依赖可读思维链的监控。作者认为,可读推理形成的计算限制是现有监控的重要条件,COCONUT、full-bandwidth transformers、looped transformers 等路线可能绕开这一条件。文章在9月29日修订时收窄了结论;这是对架构发展方向的风险判断,不能据此认定所有潜在推理模型都无法监控。

    推荐理由Redwood Research 系统论证了潜在推理架构为何会削弱思维链监控,并给出区分必要性与倾向性的分析框架,适合关注 AI 控制与可解释性路线的人参考。

已经到底了