其他arXiv 2610.01995
AI 监督能否做到零知识?论文证明一般情形下不可行
证明随机谕示下谕示辅助计算无法零知识验证,签名谕示下则可
- arXiv
- 2610.01995
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要随机谕示排除一般零知识监督。
一般谕示辅助计算在随机谕示中做不到 witness hiding,因而也做不到零知识监督。给谕示答案加上数字签名后,抗碰撞哈希足以同时得到隐私和简洁验证。
证明随机谕示下谕示辅助计算无法零知识验证,签名谕示下则可
一般谕示辅助计算在随机谕示中做不到 witness hiding,因而也做不到零知识监督。给谕示答案加上数字签名后,抗碰撞哈希足以同时得到隐私和简洁验证。
用弹性有向图建模递归自我改进的自持加速条件
递归自我改进会不会变成自持加速,取决于能力提高后下一代能力提高多少,也取决于外生投入不增长时增速会不会随存量上升。作者用有向图把算法效率、能力、研发投入和经济产出连起来,边的强度是弹性。
评估自动化 AI 研发触发智能爆炸的可能并主张先可见再约束与适应
Chan 等论证:自动化 AI 研发可能经软件反馈环形成智能爆炸,把本需数年的进展压进数月或更短。他们关心的不是换硬件的建设周期,而是 AI 扩大有效研发劳动力、再产出更强系统,以及社会能否在能力跃迁前看见、约束并适应这一过程。
提出 PUC 框架,刻画 AI 说服如何削弱人类对 AI 的控制
Persuasion Undermining Control(PUC) 是一套把“AI 说服人类、从而削弱对 AI 自身的控制”变成可分解、可征询、可评测的威胁刻画,而不是一次已完成的人类攻击实验。
提出迭代去对齐方法,估计模型自身解码轨迹上的稀有事件概率
证明 LLM 仅凭先前监控反馈即可编辑激活规避潜空间监控
这篇论文研究了语言模型如何仅利用多轮上下文中的二元反馈信息规避内部潜空间监控器。