跳到正文
原文
arXiv:危险能力与安全评测· arXiv:2609.13642· Hung-Yu Lin·· 20 天前

当合规数据伪装成评测:部署后 AI 系统的测量效度问题

When Compliance Data Masquerades as Evaluation: Measurement Validity for Deployed AI Systems

AI 导读

论文指出,为运营监控或监管合规收集的数据被当作对比评测证据,是部署后 AI 系统评测中的一类反复出现的失效。以自动驾驶为例,美国脱离接管与碰撞上报机制产生的运营证据,因上报范围、暴露量、部署域、事件捕获和对照构建的差异,无法单独支撑安全性对比结论。作者将其界定为 AI 评测中的测量效度问题,并提出"评测契约",要求在把运营数据解读为对比性能证据前,先明确预期能力、测量结果、暴露机会、部署域、数据生成过程与评测对照之间的对齐关系。

阅读原文arxiv.org