Snyk Labs 实测 Opus 4.7 等模型在四个代码库上的漏洞发现能力
How Cooked Are We? Testing the Limits of AI-Driven Vulnerability Research
AI 导读
Snyk Labs 用四级难度递减的提示词,让 Opus 4.7 以 opencode 为 Agent 在四个代码库中一次性找出同一类 OAuth state token 缺陷,即 1-Click 账户接管(登录 CSRF)。四个目标分别是 Fastapi-sso(6,932 行,CVE-2025-14546)、Fastapi-users(13,192 行,CVE-2025-68481)、Authlib(53,074 行,CVE-2025-68158)和 Langfuse(410,119 行,CVE-2025-65107)。作者发现 Opus 4.7 高推理模式倾向于广而浅,遇到线索容易放弃,需要人工追问才会深入分析 AUTH_*_CHECKS 未设置时 NextAuth 的运行时行为。作者强调这不是基准测试,只是一次小规模探索。
推荐理由
作者用四级递进提示词实测 Opus 4.7 等模型在四个代码库上的漏洞发现能力,给出了提示词强度与成本、命中率之间的对应关系。