评测与基准arXiv 2510.01359
JAWS-Bench:研究者用三种工作区场景系统越狱代码 Agent
提出 JAWS-Bench,评测代码 Agent 在三级工作区中的越狱与恶意代码可执行性
- arXiv
- 2510.01359
- 发表
- 层
- 应用层
- 被测模型
- GPT-4.1、GPT-o1、DeepSeek-R1 等 8 个
- 攻击越狱
摘要论文提出了评估代码智能体端到端恶意代码越狱的 JAWS-Bench,发现多文件与智能体推理会明显放大可部署危害。
提出 JAWS-Bench,评测代码 Agent 在三级工作区中的越狱与恶意代码可执行性
摘要论文提出了评估代码智能体端到端恶意代码越狱的 JAWS-Bench,发现多文件与智能体推理会明显放大可部署危害。