其他arXiv 2610.09279
研究将 ChatGPT 记录与 Prolific 提交比对
比对捐赠对话史与众包提交,测量 AI 代答的集中度与获批
- arXiv
- 2610.09279
- 发表
- 层
- 提示层
- 场景
- 模型与 API
比对捐赠对话史与众包提交,测量 AI 代答的集中度与获批
提出 CARE,离线认证 VLA 加速配置的回合级失败风险并选出最快合格候选
CARE 在部署前从加速配置中选出最快、且加速诱发失败风险能被有限样本认证为低于用户预算的候选。证据不足就保留全计算参考策略。
用伤害风险模型评估英国 AI 生成虚假信息的伤害潜能
提出选择性长时程精炼,筛选轨迹以提升终端智能体训练可靠性
这项工作研究终端智能体模仿学习里,教师轨迹应保留多少 token。
提出 Geodesic Unlearning,沿测地线编辑权重以提升缺模态鲁棒性
这项工作讨论多模态模型在部署时整段缺一个模态的性能下降,并把校正写成训练后的子空间编辑。
研究视觉语言模型在协作中能否表示并说出指称不确定性
摘要指称不确定性可被引出,但很少说出来。
部署方侧的两层证明,用来在多智能体跨部署方委托之后回答两个事后问题:谁放出了这些字节,这条跨部署方边有没有父方授权。
提出 AgentRewind,支持长程 Agent 回退对齐检查点并继续执行
比较对话式 AI 与自主搜索对政治真假信念的影响
作者报告,英国人已把对话式 AI 用于选举相关信息。在被要求研究指定议题时,它改变政治知识的程度与自行谷歌搜索相当。