全部动态
论文与会议论文
本页材料
完整标题与摘要 · 24 条- 会议论文ACL 2026
LogicEval:真实软件逻辑漏洞自动修复评测框架
构建含122个逻辑漏洞的数据集并评测传统及LLM修复方法,发现提示敏感、上下文丢失和补丁定位困难是主要失败因素。
- 会议论文ACL 2026
从信任到失陷:结果验证的 LLM 钓鱼模拟与实时防御
提出以受害者完成外部动作验证失陷的 PhishSim 模拟器,以及实时多智能体风险评分器 PhishGate,在四种 LLM 后端上提升对话级检测。
- 会议论文ACL 2026
打破“可证明安全”:利用低概率消失检测大模型隐写的有限精度痕迹
揭示有限精度运算造成的低概率消失漏洞,并提出采样统计审计方法,可有效检测AC与Meteor隐写,而语义检测器接近随机猜测。
- 会议论文ACL 2026
抓住关键线索:用大模型辅助分类器检测演变中的诈骗电话
以专家定义的稳定语义证据为基础,先识别线索再逻辑判定诈骗,在服务场景变化时比传统基线更稳健、高效。
- 会议论文ACL 2026
用大语言模型重写裸指针,让C转译的Rust代码更安全
提出PR2,以决策树提示和代码变更分析引导裸指针替换与错误修复,在28个真实C项目的转译代码中消除18.57%的局部裸指针。
- 会议论文ICLR 2026
真实网络渗透测试中AI智能体与人类专业人员的对比评估
在包含约8000台主机的真实网络中评估AI智能体与人类网安专家,所提框架ARTEMIS发现9处有效漏洞,表现超过90%的人类参与者且成本优势显著。
- 会议论文ICLR 2026
RESCUE:检索增强的安全代码生成框架
针对大模型生成易受攻击代码的问题,提出安全代码生成RAG框架RESCUE,结合程序切片知识库构建与分层多面检索,显著提升生成代码的安全性指标。
- 会议论文ICLR 2026
HackWorld:评估计算机使用Agent利用Web应用漏洞的能力
该研究提出首个评估计算机使用Agent通过图形界面利用Web漏洞的基准HackWorld,测试发现现有SOTA智能体利用率低于12%,在多步攻击规划上存在短板。
- 会议论文ICML 2026
RepetitionCurse:DoS 压力下 MoE 大模型路由失衡的测量与理解
用重复 token 模式的黑盒提示使所有 token 路由到同一组专家,造成设备瓶颈,在 8 卡 MoE 部署上将 TTFT 提高 20% 至 148%。
- 会议论文ICML 2026
Agora:利用LLM智能体在生产级共识协议中自主检测漏洞
提出多智能体框架Agora,结合假设驱动测试与LLM能力协同探索状态空间并合成攻击场景,在Raft等生产级共识协议中发现15个未知逻辑漏洞。
- 会议论文ICML 2026
AutoBaxBuilder:代码安全评测任务的自动构建
提出自动化构建代码安全评测任务的流水线AutoBaxBuilder,利用LLM生成测试用例与漏洞利用探针,大幅降低基准构建成本并评测模型代码安全性。
- 会议论文ICML 2026
SecCodePRM:面向代码安全的过程奖励模型
提出面向代码安全的过程奖励模型SecCodePRM,提供上下文感知的步骤级安全评分,有效用于代码漏洞检测及安全代码生成引导。
- 会议论文ICML 2026
WatchLog:基于多模态大模型的端点检测与响应日志高效可解释推理
提出WatchLog框架,将原始EDR日志表示为视频结构数据并利用多模态大语言模型建模,显著提升端点恶意活动检测准确率、推理效率与可解释性。
- 会议论文ICML 2026
CYBERTEAM:通过标准化威胁搜寻评测LLM辅助网络蓝队能力
提出基准CYBERTEAM,将网络防御威胁搜寻分解为结构化推理步骤与操作模块,系统评估并指导大语言模型与网络安全智能体在真实蓝队实战中的表现。
- 会议论文ICML 2026
AI Agent 网络安全拒答新框架
提出首个针对攻防场景的智能体拒答边界框架,评测发现8个前沿模型中有6个在真实系统漏洞挖掘任务中拒答率为0%。
- 会议论文ICML 2026
Co-RedTeam:基于大模型智能体的协同安全漏洞挖掘与利用
提出面向网络安全的多智能体协同框架Co-RedTeam,将漏洞分析划分为发现与利用两阶段,利用真实执行反馈与长期记忆显著提升漏洞挖掘与利用成功率。
- 会议论文NDSS 2026
基于LLM的PLC逻辑指令漏洞模糊测试框架
提出LogicFuzz对PLC逻辑指令进行语义模糊测试,在六种生产级PLC中发现19个漏洞,其中4个为新漏洞。
- 会议论文NDSS 2026
利用LLM自动标注代码以划定TEE边界
提出LLM-CAL识别密码实现中的安全敏感代码区域,F1达到98.40%,用于缩小TEE可信计算基。
- 会议论文NDSS 2026
自动化汽车全生命周期函数级TARA分析
DefenseWeaver利用LLM生成攻击树和风险评估,在四个汽车安全项目中发现并验证了11条关键攻击路径。
- 会议论文NDSS 2026
超越原始字节:迈向大型恶意软件语言模型
提出大型恶意软件语言模型的预训练方法,使多种恶意软件分类任务平均提升1.1%,最高提升28.6%。
- 会议论文NDSS 2026
超越RTT的对抗鲁棒住宅代理检测方法
提出结合流量特征与Transformer的两层检测框架,在多种规避攻击下仍保持超过92%的F1分数。
- 会议论文NDSS 2026
BSFuzzer:面向BLE逻辑缺陷的上下文感知语义模糊测试
利用LLM解析蓝牙规范并生成语义测试序列,在19台设备中发现36个安全问题,其中34个为未知漏洞。
- 会议论文NDSS 2026
CHAMELEOSCAN:利用LLM界面探索检测iOS变色龙应用
提出LLM驱动的UI探索框架识别伪装应用,在1644个iOS应用上达到92.59%的精确率。
- 会议论文NDSS 2026
Chimera:利用多智能体LLM自动模拟内部威胁
提出多智能体LLM框架模拟企业中的良性与恶意内部活动,并构建更真实的内部威胁检测数据集。