立场论文:AI 智能体设计正削弱人类监督能力
提出认知脚手架,用设计摩擦与组织规程维持对智能体的人工监督
- arXiv
- 2608.23642
- 发表
- 层
- 应用层
- 场景
- AI Agent
摘要立场论文主张把监督者的认知需求当作与智能体能力同等的设计约束。
Mitchell、Ghosh 与 Passi 的立场论文认为:人被留在回路中,并不会自动产生有效监督。
提出认知脚手架,用设计摩擦与组织规程维持对智能体的人工监督
Mitchell、Ghosh 与 Passi 的立场论文认为:人被留在回路中,并不会自动产生有效监督。
作者把高自主 AI scientist 的规模化协调写成经济与制度问题:假设生成变便宜之后,要分配的是稀缺验证资源,并处理信用、问责和恶意使用。
提出过程中心基准,检验 AI 辅助评审终审是否被中间证据支撑
该基准用来检查 AI 辅助同行评审的中间证据是否支撑最终决策,而不是只看终审对错。。
用扩展 Ising 模型预测语言模型智能体的集体意见演化
定位:用统计力学描述语言模型智能体社群的意见动力学,并从初始意见预测后续轨迹。
提出结合模型级监督与系统级控制的智能体保障架构
Lu 与 Bengio 给出的是一套可逐层上移的保障架构和一组事件归类,不是已测量的防御系统。
综合技术 AI 安全研究优先级,提出社会韧性支柱与智能体风险管理原则
提出以协调情节为操作单位的跨执行准则,规定如何发现未授权智能体协同并在重启后遏制
摘要立场是跨执行保留关系并约束共享状态。
提出人机审计协作框架 HAAC,在对话购物 Agent 上分配并验证审计分工
HAAC 是一套用户参与式生成式 AI 审计的人机分工流程,实例为作者开发的对话式购物智能体。
访谈残障成人,分析向记忆型助手披露残障时的信息流与语境完整性
提出 SAVER 框架综述自演化智能体的安全状态转移
SAVER 是一篇关于自演化智能体安全的转移中心综述:安全对象从单次回答或单次授权动作,转到可复用状态在多次转移中的谱系。
提出威胁分类 T 并映射智能体红队研究与安全基准的覆盖
分析稀疏重叠下 LLM judge 与人类一致性的验证误差并规划重叠分配
这篇工作研究标注重叠很稀时,怎样验证 LLM judge 是否足以替代人类,并规划重叠该留多少、怎么分配。。部署前的标准做法是在校准集上比较 judge 与人类的一致性。
测量编码智能体在 HPC 集群上的使用并梳理协同设计挑战
这是一篇对生产 HPC 上编码智能体的测量与系统议程论文,不是攻击实现或防御评测。。
用可验证经验流水线训练智能体并分析人机研发分工
Atria Dawn Preview 是面向研究与工程流程的智能体语言模型,论文同时报告它的基准表现,以及开发它的过程中人与智能体如何分工。
提出评估合同,检验合规监测数据能否支持部署系统的比较主张
作者给出的是评测效度立场:部署后的运行数据要支持比较主张,必须先写明测量与主张如何对齐。
检验元认知反馈能否减少向 LLM 助手的答案卸载
这是一项关于学习界面如何减少把完整答案交给 LLM、从而降低去技能风险的预注册 HCI 实验。