全部动态
从来源,看到研究的联系
图中 4 条 · 本页 4 条 · 共 4 条动态论文会议论文
关系图可左右滑动,完整标题也在下方列表中
流带宽度表示材料数量,多标签均分;连线表示来源与分类归属。
点选节点,展开一条线索
本页材料
完整标题与摘要 · 4 条- 动态X @NeelNanda5
Neel Nanda:可解释性尚不足以被依赖
我坚持这一观点——可解释性可能意义重大,也确实足够有用,但远未达到任何人应当依赖我们来确保一切顺利的质量和可靠性水平。
- 动态X @NeelNanda5
SAE 现状:有用但不够
一篇关于 SAE 当前状态的好帖——有用,肯定没死,但单靠它不够。
- 动态Joe Carlsmith
Joe Carlsmith 论 AI for AI safety:用前沿 AI 劳动加固对齐安全因素
Joe Carlsmith 在系列文章第四篇中提出"AI for AI safety",即用前沿 AI 劳动强化安全进展、风险评估与能力约束三大安全因素,以让 AI 安全反馈回路追上或约束 AI 能力反馈回路。他提出"AI for AI safety 甜蜜点"概念,指前沿系统足以大幅改善安全因素、但尚不足以在现有对策下剥夺人类权力的能力区间,并指出该窗口未必存在且难以持久。文章最后列出最严重的担忧,包括诱导/评估失败、差异性破坏与危险的失控选项,以及时间与政治意愿等现实约束,并将在下一篇聚焦自动化对齐研究。
- 动态Redwood Research
Redwood Research:潜在推理架构可能削弱思维链这一最强监控工具
Redwood Research 发文论证,潜在推理架构允许模型在隐状态中完成更多计算,可能削弱依赖可读思维链的监控。作者认为,可读推理形成的计算限制是现有监控的重要条件,COCONUT、full-bandwidth transformers、looped transformers 等路线可能绕开这一条件。文章在9月29日修订时收窄了结论;这是对架构发展方向的风险判断,不能据此认定所有潜在推理模型都无法监控。