评测与基准arXiv 2609.33401
论文评估 System One 模型在 Agent 安全决策中的可靠性、校准与选择性自动化
评测 System One 模型对 Agent 安全输入的分类可靠性与校准
- arXiv
- 2609.33401
- 发表
- 层
- 提示层
- 场景
- LLM 应用
- 测试
- Jev 1.13、Decider, approximately 2B、Bespoke Nimble, approximately 9B 等 14 个
摘要离线评测表明,安全判定的总体分数和校准不能代替分组误差和带预算的自动决策检查。
Liu 离线评测 System One 模型能否为智能体安全输入给出可自动化的概率决策。问题是分类是否可靠,以及概率能否在指定漏检和误拦上限内支持放行、拦截或复核。