教 AI 像人类一样看世界
Teaching AI to see the world more like we do
AI 导读
Google DeepMind 在 Nature 发表研究,提出一种让视觉模型内部表征更贴近人类知识层级的方法,并称对齐后模型更稳健、泛化更好。研究用认知科学的 odd-one-out 任务对比人类与模型判断,发现模型常依赖背景颜色、纹理等表层特征,从而做出与人类不同的选择。方法分三步:在预训练视觉模型 SigLIP-SO400M 上冻结主干、用 THINGS 数据集训练小型 adapter 作为教师,生成含百万张图像、数百万条类人判断的 AligNet 数据集,再据此微调学生模型。对齐后的模型在 odd-one-out、multi-arrangement 等认知科学任务上更常与人类判断一致,在 few-shot learning 和 distribution shift 上表现也更好。
推荐理由
论文用认知科学的 odd-one-out 任务量化视觉模型与人类的表征差异,并给出冻结主干、生成数据集再微调的三步对齐方法。