其他arXiv 2610.01995
AI 监督能否做到零知识?论文证明一般情形下不可行
证明随机谕示下谕示辅助计算无法零知识验证,签名谕示下则可
- arXiv
- 2610.01995
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要随机谕示排除一般零知识监督。
一般谕示辅助计算在随机谕示中做不到 witness hiding,因而也做不到零知识监督。给谕示答案加上数字签名后,抗碰撞哈希足以同时得到隐私和简洁验证。
证明随机谕示下谕示辅助计算无法零知识验证,签名谕示下则可
一般谕示辅助计算在随机谕示中做不到 witness hiding,因而也做不到零知识监督。给谕示答案加上数字签名后,抗碰撞哈希足以同时得到隐私和简洁验证。
提出 PUC 框架,刻画 AI 说服如何削弱人类对 AI 的控制
Persuasion Undermining Control(PUC) 是一套把“AI 说服人类、从而削弱对 AI 自身的控制”变成可分解、可征询、可评测的威胁刻画,而不是一次已完成的人类攻击实验。
提出迭代去对齐方法,估计模型自身解码轨迹上的稀有事件概率
证明 LLM 仅凭先前监控反馈即可编辑激活规避潜空间监控
这篇论文研究了语言模型如何仅利用多轮上下文中的二元反馈信息规避内部潜空间监控器。