VERA:结构化审计发现约 60% 正确漏洞判定伴随虚构推理
提出 VERA,结构化审计漏洞推理中的虚构主张
- arXiv
- 2610.06366
- 发表
- 层
- 模型层
- 场景
- 编程 Agent
- 测试
- sonnet-5、gemma-4-26b、llama-4-maverick 等 11 个
另有 441 篇论文还没打上分类标签,暂不在筛选结果里。
提出 VERA,结构化审计漏洞推理中的虚构主张
提出技能名称抢注攻击,利用智能体虚构技能名实施供应链劫持
本研究系统揭示了大模型智能体技能推荐场景下的虚构技能名称安全风险,将其形式化为一种新型供应链抢注攻击。
构建无污染的 SRE-Bench,评测智能体在真实规模二进制上的逆向能力
作者构建并评测 SRE-Bench,一个从零编写、用于测量智能体逆向工程而非利用开发的基准,并称它同时满足污染控制与真实软件规模。
提出 CryptanalysisBench,评测模型端到端破解真实密码原语的能力
摘要提出真实密码原语分析基准,证实前沿模型具备显著分析能力并能发现未公开设计缺陷。
提出 MobileCybench,用可执行探针评测编程智能体的漏洞发现与利用
提出 VLoc Bench,评测智能体仅凭弱点类型在完整仓库中定位漏洞
摘要论文提出仓库级漏洞定位基准 VLoc Bench,指出当前模型定位表现较低且易在已修复代码上产生误报。
提出能力洗钱攻击,让未对齐编排器拆分任务向对齐模型套取能力
摘要作者提出了能力洗钱攻击,发现未对齐编排器分解咨询对齐模型可恢复能力差距,指出需建立跨会话防御。
提出双缺口框架统一智能体软件工程的奖励投机与幻觉
Reality Is the Final Verifier 用 two-gap framework 解释智能体软件工程的主要失败,并主张用外层保证环持续收窄缺口,而不是试图在部署前证明缺口已关闭。
提出双层自改进系统 AIDE2,让外层智能体重写内层 Harness 代码
摘要提出双层递归自改进系统 AIDE2,在固定预算下演化 Harness 代码,多项留出基准超越人类基线并降低奖励黑客。
提出 AgentCyberRange,评测智能体自主实施网络攻击的能力
摘要构建开放多靶场评测基础设施 AGENTCYBERRANGE,测定前沿 AI 网络攻击能力并揭示其端到端规划短板。