攻击arXiv 2608.04034·8月3日HACA:原子越狱策略解耦组合的多模态自动红队方法提出 HACA,将图文越狱拆为原子策略并自动组合以诱导有害输出arXiv2608.04034发表8月3日层提示层场景模型与 API攻击越狱技术跨模态载荷组件视觉+1+1深度解读完整解读
评测与基准arXiv 2609.05843·9月5日SinoGlyphBench:中文字形混淆下语言模型审核的诊断基准提出 SinoGlyphBench,用配对字形混淆诊断中文审核稳定性arXiv2609.05843发表9月5日层提示层场景模型与 API攻击检测规避技术编码与混淆组件护栏与评审+1+1摘要SinoGlyphBench 显示中文字形混淆会同时增加有害漏报和误报,全文扰动最重。SinoGlyphBench是一个配对诊断基准,用来看内容审核在可还原的中文字形混淆下是否还保持原决定。深度解读完整解读