ParanoiaEval:编码智能体不必要风险处置评测基准发布
ParanoiaEval:编码智能体不必要风险处置评测
AI 导读
研究者提出 ParanoiaEval,用于统一评测编码智能体的风险处置能力。该基准基于软件工程风险管理中的 Avoidance-Transfer-Mitigation-Acceptance 框架,将其四类处置方式落地到编码智能体场景,包含 200 组仓库级任务对,每对仅在决定处置方式的证据上不同,并引入风险处置违规与证据响应性指标,使用经人工校准的智能体评判器进行评估。在 8 个代表性模型上的大规模实验与事后人工研究显示:即便存在明确证据,不必要风险处置仍出现在 11.2% 至 58.7% 的运行中,且不同智能体配置差异明显;更强的任务能力并不保证更恰当的风险处置,而处置违规会显著损害开发者体验,说明风险处置是一项独立的能力维度;智能体还表现出与既有风险管理研究一致的系统性模式。