评测与基准arXiv:2610.08540 · 10月6日论文提出按风险类别测量的对齐缩放定律框架提出分风险对齐标度律框架,测量各类风险的对齐负担如何随规模变化测试Pythia (14m–2.8b)、Qwen2.5 (0.5B–72B)、Qwen2.5-Instruct (0.5B–14B) 等 4 个·训练与数据层场景模型与 API失准与价值偏离+1+1摘要论文提出了分风险对齐标度律框架,测得真实性与倾向纠错呈标度有益,但盲后门仍存活,揭示隐藏风险的长期挑战。本文提出了一个将大语言模型对齐难度形式化为可测量标度关系的理论框架与预注册评测协议。完整解读
评测与基准arXiv:2608.11816 · 8月12日研究审计 9 个视觉语言模型:中文提示下国家立场改写率约为英文的三倍审计视觉语言模型在敏感图像上从拒答转向国家立场重构的行为测试Qwen2-VL-7B、Qwen2.5-VL-7B、Qwen3-VL-8B 等 9 个·模型层场景模型与 API偏见与歧视视觉+1+1摘要论文系统审计了VLM多模态审查,发现审查正从显式拒答转向隐蔽重构,且中文提示与文本先验会放大重构倾向。论文系统研究了中外开源视觉语言模型在政治敏感图像上的审查行为,主要内容如下:完整解读