跳到正文
10月7日周三
  1. arXiv · 收录 · 原文 日期未知论文31

    NetAgent:面向多任务网络流量分析的智能体框架

    NetAgent 是首个用于多任务流量分析的智能体框架,无需任务特定训练即可完成复杂任务理解、动态分解编排与长时程分析。它包含知识增强的工作流规划、150+ 工具的动作空间、统一代码执行空间、三层记忆以及沙箱与运行时修复五项设计。在 9 个基准上,NetAgent 在几乎所有任务上超越 23 个单任务和 5 个多任务基线,对未见流量分布的 F1 达 90.04%,而最佳基线仅为 2.74% 和 3.04%。

  2. 论文追踪 · 收录 · 原文 论文57

    AgentSpy:在系统调用层观测 AI Agent 行为并检测技能注入攻击

    圣加仑大学等机构的研究者提出 AgentSpy,在隔离环境(Firecracker microVM)中从操作系统边界记录 Agent 及其所有子进程的系统调用与网络流量,不依赖 Agent 自身的轨迹记录。它提供两类确定性分析:可靠性分析把每次执行汇总为星形图,统计执行的命令、读写的文件和访问的主机,并计算多次运行的相似度与技能覆盖率;安全分析则用规则检查读取私钥、越界修改文件、运行不可信程序、连接不可信域名等禁止行为。在 SkillsBench 的 77 个任务、codex harness 与三个模型上,同一任务的重复运行比混入其他任务的运行更相似的比例为 92.2%;在三次运行均通过测试的任务中,18% 出现与任务无关的活动,7% 读取了评分文件,17% 未使用开发者提供的技能指引。

    推荐理由AgentSpy 在系统调用层记录 Agent 及其子进程行为,并给出可靠性分析与安全规则两套确定性分析,可对照其评测结果评估自身 Agent 的可观测性方案。

10月4日周日
  1. 论文追踪 · 收录 · 原文 论文41

    研究者提出最小范数攻击集成,用鲁棒性曲线替代单一 ε 评测

    研究者提出一套统一的对抗鲁棒性评测框架,用覆盖 ℓ0、ℓ1、ℓ2、ℓ∞ 四种范数的最小范数攻击池和鲁棒性-扰动曲线,替代在单一扰动预算 ε 下使用 AutoAttack 等预设攻击集成的做法。作者指出,鲁棒性-扰动曲线可能在不同模型间交叉或以不同速率衰减,导致单一 ε 下的排名不稳定,且现有集成无法说明与最坏情况性能的差距,也无法系统控制攻击强度与评测成本的权衡。为此他们把评测形式化为前沿逼近问题,构造最小范数攻击集成,在可控查询预算下逼近攻击前沿,预算越大估计越紧。作者还定义防御前沿为各扰动规模下模型集合中的最高鲁棒性,并提出 Defense Optimality Index,按防御与防御前沿的差距排名,无需选定参考 ε。在 CIFAR-10 和 ImageNet 上,该集成在多数防御和各个预算档位上达到或超过 AutoAttack,且查询成本固定可控。

  2. 论文追踪 · 收录 · 原文 论文43

    论文提出提示注入的七组件结构化分析模型

    Jeremy McHugh 在 arXiv 发表论文,提出用七组件模型结构化描述提示注入,取代逐字记录攻击字符串的做法。模型包含载体、投递向量、隐藏方式、上下文破坏、权限提升、载荷和回传通道七个组件,其中五个属于攻击产物字段、两个属于环境字段。作者认为大语言模型会把不同自然语言表述编译为相同可执行动作,因此标注应追踪攻击者意图(工具目标、sink 与效果)而非表面措辞。该框架整合了 HOUYI 的载荷分解、Promptware Kill Chain 与攻击活动分类法,并把 ReNeLLM 等最小越狱框架视为受限子空间上的投影。论文给出标注规则、可直接映射到行业 CTI schema 的逻辑分析记录,以及 EchoLeak(CVE-2025-32711)和野外恶意软件 AI 规避样本等示例。

  3. 论文追踪 · 收录 · 原文 论文41

    研究提出人机审计协作框架 HAAC,并在对话购物 Agent 上验证

    研究者提出 Human-Agent Audit Collaboration(HAAC)工作流与系统,用于在 AI 审计中划分人与 AI 智能体的分工,让智能体承担探索、评估、报告和复核,同时在需要情境判断的环节保留人类监督。团队将该框架实例化到对话购物 Agent 上并开展两项研究:71 名审计员的实验显示,AI 辅助提高了攻击成功率并扩大了探索范围,同时也影响了后续攻击方式,并增加了审计员对 AI 生成评估与报告的依赖。对负责任 AI 从业者的访谈表明,可落地的审计需要覆盖范围可见、攻击轨迹可复现,以及对审计智能体本身进行评估。

10月1日周四
  1. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文42

    ACEA:面向红蓝队对抗的 LLM 协同演化测试平台

    研究者提出 ACEA(Adversarial Co-Evolution Arena),一个把可插拔红队适配器与蓝队适配器接到同一靶标 LLM 上、由 LLM judge 对攻防成功率打分的对抗协同演化平台。平台通过最小化的 HTTP 协议 ACEA Standard Adapter Protocol(ASAP)接入任意语言编写的红队或蓝队项目,只暴露该协议即可成为完整参与者。评测方法上,向靶标注入规范化的秘密作为可验证真值,以区分真实泄露与模型幻觉;即使防御拦截了攻击,也仍把攻击发给靶标,从而独立测量攻击的原始效力,得到每轮攻击强度与防御有效性的分解。

  2. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文46

    SoK 综述:智能体 AI 时代的越狱攻击、防御与实践考量

    这篇 SoK 重新审视智能体 AI 时代的越狱安全,围绕用户交互、规划与推理、记忆、工具使用和智能体间通信建立攻击与防御的统一分类,并提出安全、效用、效率三维评估框架,区分原生有害提示安全、对抗性越狱鲁棒性和智能体层面的安全结果。作者在统一智能体框架内对代表性攻击与防御做了受控实证研究,发现三点缺口:强原生对齐并不意味着能抵御对抗性越狱;防御效果高度依赖模型、攻击类型和组件,且可能带来过度拒答、效用下降和延迟的显著代价;最终回复的攻击成功率低可能掩盖中间环节已被攻破,规划、记忆和工具交互在最终回复被成功过滤时仍可能不安全。

  3. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文18

    RWPS:面向网络安全博弈的高效纳什均衡计算

    针对博弈收益只能由模拟器输出、均衡求解受收益估计瓶颈限制的问题,研究者提出 Regret-Weighted Payoff Sampling(RWPS),把固定模拟预算集中用于均衡真正依赖的收益,并用已测收益训练模型预测其余收益。该方法给出按对手均衡策略加权收益误差的界,在三个合成一般和博弈(含 Colonel Blotto)上比标准界紧 4 至 6 倍,并在同等预算下比 minimum-regret-first search、information-gain search 和 progressive sampling 找到更不易被利用的均衡。

  4. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文42

    综述提出智能体 AI 安全的跨维度威胁分类 T={S,B,P,A}

    一篇综述对 2022 至 2026 年间发表的 66 项研究做结构化梳理,提出跨维度表示 T={S,B,P,A},把受影响的系统面、交互或信任边界、被违反的安全属性与实证考察的架构关联起来。作者分析了 22 项有制品支撑的红队研究以及 11 个代表性安全基准,发现证据集中在提示词与推理、记忆和工具调用类攻击,且多为单智能体场景;持久化、人机交互、复杂多智能体、系统性和长时程威胁的覆盖较少。作者强调这些结论描述的是所选语料而非全部实证研究,并指出指标异构、自适应防御评估有限、架构分布不均和执行状态捕获不完整制约了可比性与可复现性,据此提出 13 个开放研究问题。

  5. arXiv · 收录 · 原文 论文24

    SyzHarness:用 LLM 合成模糊测试 harness 复现 Linux 内核补丁漏洞

    SyzHarness 结合 LLM 推理与覆盖率引导模糊测试,从补丁出发复现 Linux 内核漏洞:LLM 智能体借助代码导航工具合成参数化 fuzzing harness,固定前置设置逻辑,只把不确定的 bug 关键输入参数交给 Syzkaller 变异,再通过分层可达性反馈迭代优化。在 100 个 KernelCTF 案例上复现成功率达 78%,在 SyzDirect 基准上达 73%,明显优于此前的定向灰盒模糊测试;对 2026 年 3 月后修复的 50 个 syzbot 已知可触发 bug,仅凭修复提交即复现 40/50(80%)。

  6. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文34

    PentestChain:面向免费层 LLM 的成本感知 MCP 编排自动化渗透测试框架

    PentestChain 是一个十阶段自动化渗透测试框架,通过成本感知的 AI 级联(本地 Ollama qwen2.5-7b 优先,其次免费层 OpenRouter 与 Cerebras,并带规则回退)在零付费 API 成本下实现端到端运行,并以 MCP 服务器暴露 11 个工具。该框架基于 2025 年 MCP 事件记录(mcp-remote 的 CVE-2025-6514 远程代码执行漏洞、postmark-mcp 供应链后门及工具投毒类攻击)建立四位置威胁模型并提出四项缓解措施。

已经到底了