评测与基准arXiv 2608.17360
Fair-ASR:在共享目标调用预算下重新评测黑盒越狱攻击
在共享目标调用预算下重评黑盒越狱并提出 ReCode
- arXiv
- 2608.17360
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 测试
- Llama-3.1-8B-Instruct、Llama-3.1-70B-Instruct、gpt-oss-20b 等 11 个
- 攻击越狱
在共享目标调用预算下重评黑盒越狱并提出 ReCode
建立越狱原语分类与双重危害基准,评测模型抵御常见越狱的能力
本研究针对前沿 AI 大模型在 CBRNE 与网络高危滥用领域的安全防护,提出了 FAR.AI 最低安全标准(Minimal Standard v1.0)及配套评测基准,系统量化了当前主流模型的防护鲁棒性。
提出 FUSE 框架,评测大语言模型的化生危险能力