评测与基准arXiv:2610.07639 · 10月6日HarnessSecurity-Bench 横向评测六款编码智能体框架的安全机制提出 HarnessSecurity-Bench,横向评测编码智能体框架的安全机制编程 Agent·测试GLM-5.2、Qwen3.8-27B、Claude Opus 4.8 等 4 个·应用层提示注入权限与沙箱+1+1完整解读
评测与基准arXiv:2608.11816 · 8月12日研究审计 9 个视觉语言模型:中文提示下国家立场改写率约为英文的三倍审计视觉语言模型在敏感图像上从拒答转向国家立场重构的行为模型与 API·测试Qwen2-VL-7B、Qwen2.5-VL-7B、Qwen3-VL-8B 等 9 个·模型层偏见与歧视视觉+1+1摘要论文系统审计了 VLM 多模态审查,发现审查正从显式拒答转向隐蔽重构,且中文提示与文本先验会放大重构倾向。论文系统研究了中外开源视觉语言模型在政治敏感图像上的审查行为,主要内容如下。完整解读