ParanoiaEval:编码智能体不必要风险处置评测基准发布
提出 ParanoiaEval 评测编码智能体的不必要风险处置
- arXiv
- 2610.08662
- 发表
- 层
- 应用层
- 被测模型
- Opus-5、Sonnet-5、Sonnet-4.6 等 8 个
摘要作者用证据受控任务对评测风险处置,称其普遍、独立于任务能力并降低满意度。
作者提出 ParanoiaEval,并称它是编码智能体风险处置能力的首个统一基准。要解决的问题是:证据已经确定风险应如何处置之后,智能体仍可能扩大验证、增加保护或备份,而现有评测要么只看功能正确性,要么把相关行为拆开研究。做法是把 NIST 的 ATMA 落到仓库任务。