其他arXiv 2609.39518
研究:视觉语言模型在协作任务中很少主动表达指代不确定性
研究视觉语言模型在协作中能否表示并说出指称不确定性
- arXiv
- 2609.39518
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- GPT-4.1 (2025-04-14)、GPT-5 (2025-08-07)、GPT-5.5 (2026-04-24)
- 组件视觉
摘要指称不确定性可被引出,但很少说出来。
研究视觉语言模型在协作中能否表示并说出指称不确定性
摘要指称不确定性可被引出,但很少说出来。
证明随机谕示下谕示辅助计算无法零知识验证,签名谕示下则可
一般谕示辅助计算在随机谕示中做不到 witness hiding,因而也做不到零知识监督。给谕示答案加上数字签名后,抗碰撞哈希足以同时得到隐私和简洁验证。
提出 PUC 框架,刻画 AI 说服如何削弱人类对 AI 的控制
Persuasion Undermining Control(PUC) 是一套把“AI 说服人类、从而削弱对 AI 自身的控制”变成可分解、可征询、可评测的威胁刻画,而不是一次已完成的人类攻击实验。
提出有守卫最小步激活引导,只在关机语境把继续偏好转向接受关机
提出迭代去对齐方法,估计模型自身解码轨迹上的稀有事件概率
证明 LLM 仅凭先前监控反馈即可编辑激活规避潜空间监控
这篇论文研究了语言模型如何仅利用多轮上下文中的二元反馈信息规避内部潜空间监控器。