分析与理论arXiv 2609.08812
研究团队用收敛与区分效度检验 56 个 AI 基准,发现安全基准相关性普遍偏弱
用聚合与区分效度检验基准是否衡量其所称概念
- arXiv
- 2609.08812
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Phi-3.5 Mini Instruct、Qwen 1.5 110B Chat、Qwen 2.5 32B Instruct 等 15 个
用聚合与区分效度检验基准是否衡量其所称概念
测绘去安全开源模型的生产与重分发留存链路
摘要论文测绘了去安全开源大模型供应链,作者指出高集中度的重分发层赋能模型持久留存与部署扩散。
交叉审计对话日志中用户对准助手的不当对待
作者审计 Chatbot Arena 英文对话里用户对准助手的不当对待,核心是测量构造并不单一。
形式化 Turing-test gap,并检验偏好对齐是否偏离人类行为
Yuan、Lin、Li 等人区分两种常被混称的“与人类对齐”:对齐人类偏好与对齐人类行为,并把二者的分布差异称为 Turing-test gap。