防御arXiv 2610.03073
SecJev:为 System One 决策模型引入安全专业知识
提出 SecJev,用场景加权训练把决策模型适配为安全类型化判断
- arXiv
- 2610.03073
- 发表
- 场景
- 模型与 API
摘要SecJev 用共享打分器做安全决策,0.8B 的 task-macro 超过 Kev-9B。
SecJev 是 0.8B 到 9B 的安全决策模型族,作者称据其所知是首个面向安全的 Jev-like 家族。
提出 SecJev,用场景加权训练把决策模型适配为安全类型化判断
SecJev 是 0.8B 到 9B 的安全决策模型族,作者称据其所知是首个面向安全的 Jev-like 家族。
提出 CorrGRPO,用组内 Pearson 相关归一化多奖励 GRPO
CorrGRPO 是 GRPO 的多奖励变体:组内优势的分子仍是中心化总奖励,分母改为 Pearson 相关之和,避免大尺度奖励主导归一化。