评测与基准arXiv 2607.19262
BioSecBench-Surveillance:面向病原体基因组监测 AI 智能体的可验证基准
提出 BioSecBench-Surveillance,评测 Agent 的病原监测分析
- arXiv
- 2607.19262
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 测试
- Gemini 3.5 Flash、Gemini 3.1 Pro、Opus 4.8 等 10 个
提出 BioSecBench-Surveillance,评测 Agent 的病原监测分析
提出 BioSecBench-Refusal,评测智能体生物安全拒答是否对准风险
BioSecBench-Refusal 把生物研发智能体的谨慎程度和识别隐蔽危害的能力放在同一套任务上测量。
提出 AuraForge,从漏洞修复合成安全测试并监督训练编码智能体
AuraForge 把真实仓库的历史漏洞修复变成可执行训练任务,用来监督编程智能体同时满足功能请求和隐含的安全要求。
提出能力洗钱攻击,让未对齐编排器拆分任务向对齐模型套取能力
摘要作者提出了能力洗钱攻击,发现未对齐编排器分解咨询对齐模型可恢复能力差距,指出需建立跨会话防御。