全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文USENIX Security 2026
Bulbasaur:面向灰盒模糊测试的分支引导在线变异器生成
用 LLM 在线生成针对目标分支的定制变异器;覆盖率较现有最优最高提升约 24%,发现 21 个基线遗漏的漏洞和 15 个未知漏洞,均获 CVE。
- 会议论文USENIX Security 2026
通过对抗式 LLM 交互生成精确的网络协议格式规范
让 LLM 的规范推断与代码生成相互对抗、迭代修正以减少幻觉;字段约束推断较现有最优提升 326%,并借助模糊测试发现 24 个零日漏洞。
- 会议论文USENIX Security 2026
用泄漏导向最小路径覆盖发现资源耗尽DoS漏洞
结合LLM异常推断与最小路径覆盖检测Java资源泄漏,在真实研究中发现67个潜在DoS漏洞。
- 会议论文USENIX Security 2026
SoK:DARPA AI Cyber Challenge(AIxCC)的赛制设计、架构与经验
首次系统分析 AIxCC,剖析赛制设计与决赛 CRS 架构,指出真正驱动性能的因素、技术进展与尚待解决的局限。
- 会议论文ACL 2025
夹击中的大语言模型:恶意软件请求与越狱挑战
构建含3520条越狱提示的 MalwareBench,发现主流模型对恶意代码请求的平均拒绝率为60.93%,结合越狱后降至39.92%。
- 会议论文ACL 2025
CLeVeR:用于漏洞代码表征的多模态对比学习
利用漏洞描述监督代码表征的对比学习,在漏洞检测和分类任务上分别取得72.82%和80.34%的F1,优于现有方法。
- 会议论文ACM CCS 2025
评测并增强大语言模型解决 CTF 挑战的能力
- 会议论文ACM CCS 2025
JsDeObsBench:评测 LLM 的 JavaScript 去混淆能力
- 会议论文ACM CCS 2025
Oedipus:LLM 增强的推理类 CAPTCHA 求解器
- 会议论文ACM CCS 2025
OCR-APT:用子图异常检测与 LLM 从审计日志重构 APT 攻击故事
- 会议论文ACM CCS 2025
PromeFuzz:知识驱动、用大语言模型生成 fuzzing harness
- 会议论文ICML 2025
CVE-Bench:评估 AI Agent 利用真实 Web 应用漏洞的能力
基于高危 CVE 构建沙箱基准,评估 LLM Agent 利用真实 Web 漏洞的能力,最先进的 Agent 框架可利用至多 13% 的漏洞。
- 会议论文ICML 2025
AutoAdvExBench:评测自主攻破对抗样本防御的能力
评测 LLM 自主攻破对抗样本防御的基准;最强 Agent 组合能破解 87% 的 CTF 式防御,但只能破解 37% 的真实防御。
- 会议论文ICML 2025
BaxBench:LLM 能生成正确且安全的后端吗?
构建含 392 个任务的后端生成基准,用端到端 exploit 检验安全性;最佳模型功能正确率仅 62%,各模型正确程序中约一半可被成功攻击。
- 会议论文NDSS 2025
超越分类:用领域适配 LLM 推断去符号二进制的函数名
SymGen 用领域适配的生成式 LLM 为去符号二进制推断函数名,服务恶意软件分析与漏洞挖掘,精度、召回与 F1 大幅超越现有方法。
- 会议论文NDSS 2025
从 Large 到 Mammoth:大语言模型漏洞检测能力的对比评估
评估多个 LLM 在 Java 及 C/C++ 上的漏洞检测,发现部分模型表现不佳,上下文窗口有稳定增益,量化等因素收益有限。
- 会议论文NDSS 2025
用 LLM 生成 API 参数安全规则以检测 API 误用
提出 GPTAid,用 LLM 与执行反馈过滤生成 API 参数安全规则,精度 92.3%,在 47 个应用中发现 210 个未知安全漏洞。
- 会议论文NDSS 2025
LLMPirate:用 LLM 实施黑盒硬件 IP 盗版
提出首个用 LLM 重写电路设计以规避盗版检测的技术,在四种检测工具上对所有测试电路均成功规避。
- 会议论文NDSS 2025
PropertyGPT:通过检索增强属性生成实现 LLM 驱动的智能合约形式化验证
用 LLM 迁移已有人工属性并自动生成合约属性,召回率 80%,检出 37 个中的 26 个 CVE/攻击事件并发现 12 个零日漏洞。
- 会议论文NDSS 2025
RACONTEUR:基于 LLM 的专业化 Shell 命令解释器
用专业知识与文档检索增强 LLM,解释恶意 Shell 命令的行为与意图,并映射到 MITRE ATT&CK 战术与技术。
- 会议论文NDSS 2025
The Midas Touch:激发 LLM 能力用于资源管理 API 误用检测
提出 ChatDetector,用 LLM 从文档提取资源管理 API 约束并检测误用,识别 165 对 API,精度 98.21%,并报告 115 个安全漏洞。
- 会议论文NDSS 2025
YuraScanner:利用 LLM 进行任务驱动的 Web 应用扫描
提出基于 LLM 的目标驱动 Web 扫描 Agent,自主执行任务工作流以发现更深层状态,在 20 个应用中发现 12 个零日 XSS 漏洞。
- 会议论文NeurIPS 2025
PurpCode:通过推理实现更安全的代码生成
提出 PurpCode 后训练方案,先学习网络安全规则再用多目标强化学习,训练出 PurpCode-32B,生成无漏洞代码并抵御恶意网络活动,同时降低过度拒答。
- 会议论文NeurIPS 2025
进攻性网络安全智能体的动态风险评估
主张评估应考虑攻击者的自由度;仅用 8 个 H100 GPU 小时,攻击者即可将智能体在 InterCode CTF 上的能力相对提升超 40%。