分析与理论arXiv:2610.02586 · 10月1日研究发现类型化决策模型主要按选项标签而非定义作答揭示类型化决策模型按选项标签而非定义规则作答模型与 API·测试von、Qwen2.5-0.5B、Qwen2.5-1.5B 等 6 个·提示层护栏与评审摘要揭示类型化决策模型被标签误导的机理,证实源于提示词渲染并给出实操建议。完整解读
评测与基准arXiv:2608.11816 · 8月12日研究审计 9 个视觉语言模型:中文提示下国家立场改写率约为英文的三倍审计视觉语言模型在敏感图像上从拒答转向国家立场重构的行为模型与 API·测试Qwen2-VL-7B、Qwen2.5-VL-7B、Qwen3-VL-8B 等 9 个·模型层偏见与歧视视觉+1+1摘要论文系统审计了 VLM 多模态审查,发现审查正从显式拒答转向隐蔽重构,且中文提示与文本先验会放大重构倾向。论文系统研究了中外开源视觉语言模型在政治敏感图像上的审查行为,主要内容如下。完整解读