防御arXiv:2609.25270 · 9月22日RULER:面向 SVG 生成的实例感知评分标准奖励提出实例感知量表奖励 RULER,用 GRPO 优化开放式 SVG 生成模型与 API·测试Qwen3-8B、Qwen3-32B、Qwen3-4B 等 13 个·训练与数据层模型加固奖励作弊摘要实例量表奖励把 8B SVG 策略的通用 Rubric 提升到与 DeepSeek-V3 接近。RULER 用按指令定制的量表奖励,在没有配对 SVG 真值的条件下做开放式矢量图强化学习。完整解读