- arXiv 2610.10560收录
地球科学中 AI 模型的战略性治理
基于天气与气候数据预训练的 AI 基础模型正被微调用于远超天气预报的地球科学任务,其发展速度已超过科学界的评估能力。
- arXiv
- 2610.10560
- 收录
- 分析与理论arXiv 2610.08144
新论文称 Lean 验证不能为 OpenAI 的 Navier-Stokes 自然语言证明背书
论证 Lean 编译通过不能保证自然语言数学证明语义忠实
- arXiv
- 2610.08144
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要论文论证了形式化编译不保证原证明正确,确立了消歧不可计算性理论,并揭示了 OpenAI 爆破证明中的具体脱节。
- 其他arXiv 2608.23642
立场论文:AI 智能体设计正削弱人类监督能力
提出认知脚手架,用设计摩擦与组织规程维持对智能体的人工监督
- arXiv
- 2608.23642
- 发表
- 层
- 应用层
- 场景
- AI Agent
摘要立场论文主张把监督者的认知需求当作与智能体能力同等的设计约束。
Mitchell、Ghosh 与 Passi 的立场论文认为:人被留在回路中,并不会自动产生有效监督。
摘要作者主张以智能体经济管理自主科学发现的验证资源、信用、问责与安全,而非只提升推理。
作者把高自主 AI scientist 的规模化协调写成经济与制度问题:假设生成变便宜之后,要分配的是稀缺验证资源,并处理信用、问责和恶意使用。
摘要记忆使部分作品可以从权重中提取。
Lemley 与 Cooper 认为,生成式模型的权重是否构成受保护作品的版权法“副本”,取决于该作品能否被直接了当地从输出中提取。。
- 其他arXiv 2609.36054
多作者论文评估 AI 研发自动化触发智能爆炸的可能与政策应对
评估自动化 AI 研发触发智能爆炸的可能并主张先可见再约束与适应
- arXiv
- 2609.36054
- 发表
- 场景
- 编程 Agent
摘要软件驱动智能爆炸可能把数年进展压进数月,作者要求三项政策先做好。
Chan 等论证:自动化 AI 研发可能经软件反馈环形成智能爆炸,把本需数年的进展压进数月或更短。他们关心的不是换硬件的建设周期,而是 AI 扩大有效研发劳动力、再产出更强系统,以及社会能否在能力跃迁前看见、约束并适应这一过程。
- 其他arXiv 2609.28137
研究:EdTech 平台将隐私与 AI 披露推迟到产品后期
访谈并审计 EdTech 平台如何推迟隐私与 AI 披露
- arXiv
- 2609.28137
- 发表
- 层
- 应用层
- 场景
- LLM 应用
摘要强制采用下的隐私推迟循环,使收集披露强于 AI 治理与问责。
EdTech 里的学生隐私常被推迟,而不是设计时的部署条件。作者要解释组织内部为何如此,以及公开政策是否呈现同样结构。
- arXiv 2609.09320
研究者质疑 Alignment Whack-a-Mole 的书籍记忆化结论,称其测量方法无效
研究者 A. Feder Cooper 发布 arXiv 评论文章,认为 Alignment Whack-a-Mole 中关于微调导致书籍记忆化的核心结果使用了无效的测量流程。
- arXiv
- 2609.09320
- 发表
- 分析与理论arXiv 2609.38723
面向智能体的高效 HPC 系统:挑战与机遇
测量编码智能体在 HPC 集群上的使用并梳理协同设计挑战
- arXiv
- 2609.38723
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
摘要FASRC 测量说明编码智能体改变 HPC 使用方式,作者据此提出四层协同设计议程。
这是一篇对生产 HPC 上编码智能体的测量与系统议程论文,不是攻击实现或防御评测。。