防御arXiv 2610.03073
SecJev:为 System One 决策模型引入安全专业知识
提出 SecJev,用场景加权训练把决策模型适配为安全类型化判断
- arXiv
- 2610.03073
- 发表
- 场景
- 模型与 API
摘要SecJev 用共享打分器做安全决策,0.8B 的 task-macro 超过 Kev-9B。
SecJev 是 0.8B 到 9B 的安全决策模型族,作者称据其所知是首个面向安全的 Jev-like 家族。
另有 426 篇论文还没打上分类标签,暂不在筛选结果里。
提出 SecJev,用场景加权训练把决策模型适配为安全类型化判断
SecJev 是 0.8B 到 9B 的安全决策模型族,作者称据其所知是首个面向安全的 Jev-like 家族。
提出 COBRA,用分支能力约束与代理拦截防御计算机使用 Agent 的分支引导攻击
摘要提出分支转向防御架构 COBRA,通过事前能力约束与边界代理消除分支转向攻击并兼顾效用。
作者在 jev-1.13.0 上研究 decision hijacking:不可信内容能否在用户任务和可选动作都不变时,把类型化决策推向攻击者目标。
提出 RLCDAlignBench,零样本检测多种对齐失败
RLCDAlignBench 测量用强化学习做校准决策的 Jev,能否当作对齐失败的零样本检测器。