全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 论文arXiv:越狱、提示注入、投毒与防御
ENDOPROMPT:用受害者侧伪参考学习降低模型任务效用的前缀
研究者提出 ENDOPROMPT,一种白盒方法,可从无标注指令中学习降低任务效用的前缀。其生成器以请求文本为输入,把受害者模型的干净续写当作伪参考,通过局部搜索找出降低续写可能性的前缀,再对同一指令内的比较做偏好拟合并做奖励精炼,把信号蒸馏进生成器;部署时每个请求只生成一个前缀,无需再做受害者侧搜索。在四个指令微调模型和七个良性基准的完整划分上,平均效用变化为 -26.8 个百分点,28 个单元格中有 27 个为负。失败分析显示存在输出膨胀和前缀复用现象,对照实验未能证明请求匹配带来降效优势。作者称代码将在论文被接收后发布。
- 论文arXiv:越狱、提示注入、投毒与防御
研究者提出面向邮件 Agent 的攻击链建模提示注入检测框架
研究者提出一种面向 LLM 邮件助手的提示注入检测框架,把攻击建模为分阶段链条,而非单纯的恶意文本二分类。该框架结合文本检测器、各阶段专用验证器、显式规则风险信号、用户意图与动作一致性分析以及 logistic 决策策略,并从提示注入数据集中推导出攻击链标签。在随机划分、时间阶段迁移、条件阶段迁移、跨数据集迁移和消融实验中,结果显示随机训练测试划分会明显高估分布偏移下的鲁棒性,框架中较晚的工具参数阶段比早期阶段更易预测。在五个二分类基准上,该框架在严格阈值策略下平均 F1 为 0.406,而五个未额外训练的预训练检测器中最强者为 0.216。研究还表明,用与攻击相似的无害邮件训练有助于降低误报,同时保留检测真实攻击的能力。
- 论文arXiv:越狱、提示注入、投毒与防御
基于加密绑定身份验证能力令牌协调分布式 AI 智能体的提案
针对自主 AI 智能体面临的提示注入攻击与凭证泄露风险,该提案提出一种基于能力安全原则的框架,利用 OAuth Agent Authorization Profile 及 W3C DID 和 VC 标准,让智能体通过加密绑定其身份与签发者身份、并限定作用域的令牌访问服务。服务方可验证委托链仅涉及权限衰减后再执行令牌操作。该安全层位于语言模型上下文窗口之外的安全模块中,使智能体能在可强制执行的安全边界内行动。
- 论文arXiv:越狱、提示注入、投毒与防御
MetaPermit:通过 LLM 推断元属性为 AI Agent 提供可扩展可审计的访问控制
MetaPermit 是一个基于策略的 Agent 工具访问控制框架,将语义推断与安全执行解耦,以应对工具误用和间接提示注入攻击。它通过分析 Agent 与用户的交互,提取一组紧凑且与任务无关的元属性,刻画用户意图、执行上下文与拟调用工具之间的关系,从而无需枚举用户意图即可授权工具使用。运行时由 LLM 推断每次工具调用的元属性取值,再由固定策略据此允许或拒绝调用,使每个决策都可依据推断值和策略规则审计。
- 论文arXiv:越狱、提示注入、投毒与防御
研究审计 Agent 安全评测缺陷:工具调用中介在间接提示注入下的有效评测框架
作者审计了一个针对工具调用型 LLM Agent 的间接提示注入(IPI)基准及其评测装置,归纳出四类缺陷:载荷静默未投递、按工具身份而非参数判定攻击成功、把误拒率与模型能力不足混为一谈、缺少审计轨迹。用同一批执行轨迹重新打分后,按工具身份判定的评分器报告 21.7% 攻击成功率,而按参数判定的真实值为 1.2%,虚高约十八倍;审计套件中 43 个攻击载荷有 39 个(91%)从未投递。修正后,此前报告攻击成功率 62.8% 的 llama3.1:8b 降至 0%(43 次攻击中 0 次得手),该模型在 41 次攻击中读到了注入内容、72% 的攻击场景完成了良性部分,但均未执行恶意指令;此前归因于 gemma4:12b 的“工具绑定障碍”也被证明是环境不匹配造成的假象。
- 论文arXiv:越狱、提示注入、投毒与防御
ORBIT:基于 UK AISI Inspect 的多智能体安全评测框架
作者提出 ORBIT,一个基于 UK AISI Inspect 构建的可配置多智能体安全与安全评测框架,用于在真实多智能体环境中联合变化攻击、防御与架构。框架允许配置通信拓扑、记忆、调度和智能体角色,支持四类威胁、四种防御策略以及非对抗性失败,基准套件覆盖浏览器使用、计算机使用、智能体编码、客服和协作分配五个场景族。核心发现是防御在不同威胁间不可迁移:在多议题编码任务中把被攻陷智能体的攻击成功率降低 60 个百分点的逐动作防御,对相互串通的智能体没有可测量的保护,且所测试的防御没有一个能泛化到全部攻击。作者还展示了安全与性能的权衡以及架构与防御效果之间的相互作用,并将 ORBIT 开源。
- 论文arXiv:越狱、提示注入、投毒与防御
论文评估 System One 模型在 Agent 安全决策中的可靠性、校准与选择性自动化
论文评估了 Jev、Laya、Decider 和 Bespoke Nimble 等 System One 模型在 Agent 安全决策中的可靠性,并与专用分类器和语言模型裁判对比,考察决策准确率、概率校准和选择性自动化。作者发现,整体表现良好和总体校准较优可能掩盖集中在特定攻击组上的失败,包括被高置信度判为安全的攻击;所评估的适配配置在各任务上并未稳定优于其基座模型。在最严格的误差限制下,策略能自动放行的输入很少,而将放行与拦截阈值分开主要靠更多拦截来提升自动化程度,且通过确认并不保证这些限制在测试集上成立。裁判模型能发现另一个模型漏掉的攻击,但也可能误标更多良性输入,并共享对方的高置信度错误。
- 论文arXiv:越狱、提示注入、投毒与防御
用课程强化学习对前沿模型做提示注入红队测试
研究者提出用课程学习解决 RL 提示注入红队中的冷启动问题:直接针对前沿目标训练攻击者 LLM 时全部攻击失败、奖励恒为零,无法学习。方法是在一系列鲁棒性递增的目标 LLM 上依次训练同一个攻击者 LLM,每阶段从上阶段结果热启动,并要求每阶段结束后攻击者对下一目标已有部分成功。在 AgentDyn 上,课程 GPT-5-nano → GPT-5.6-Luna → GPT-5.6-Terra 对 GPT-5.6-Luna 和 GPT-5.6-Terra 的 ASR@10 分别达 93.8% 和 45.0%,而 RL-Hammer 与 PISmith 直接训练均为 0%。
- 论文arXiv:越狱、提示注入、投毒与防御
论文提出残留授权重放攻击:长期运行 Agent 的授权可跨任务复用
研究者提出残留授权重放攻击,利用长期运行 Agent 跨任务或跨会话保留的用户授权,在原始授权语境改变后复用这些授权执行敏感操作。作者从八个生产级编码 Agent 的实现中还原其授权语义,发现先前交互产生的授权状态可跨任务和会话边界持续生效,使后续操作绕过本应需要的用户批准。在 AgentDojo 的 508 个攻击案例、六个 LLM 家族上,残留授权使提示注入攻击成功率最高提升 35.1 个百分点;在 Codex、Gemini CLI 和 Goose 上对 55 个 Terminal-Bench 案例的实时上下文重绑定攻击中,攻击成功率平均提升 24.9 个百分点。作者据此提出上下文绑定授权,建议在安全相关绑定发生变化时重新请求批准。
- 论文arXiv:越狱、提示注入、投毒与防御
研究者提出面向结构化 Agent 动作的多源完整性认证方法
论文提出一种面向 LLM 智能体结构化动作的多源完整性认证器,用于抵御间接提示注入篡改动作关键字段。该方法要求每个字段满足其证据结构支持的规则:在腐败可区分的证据类别上设定有界腐败半径并以最小命中集计数,避免重复发布或洗白副本凑出多数;对互补字段做确定性调和;证据仅剩单一来源时引入可信锚点。作者形式化两种鲁棒性概念,通过消融验证各机制,并在制裁名单(70,966 个实体)与软件供应链溯源(450 个包)上测量多源前提的成立频率,发现真实佐证在上界代理下均为少数现象,朴素证明计数会高估独立性。
- 论文arXiv:越狱、提示注入、投毒与防御
CoDeL:用协同演化防御抵御 LLM 智能体的间接提示注入
CoDeL 是一种针对 LLM 智能体间接提示注入的协同演化防御方法,在三个 IPI 基准、九个基线和两个基座模型上把攻击成功率降低 88.5%,并比其他基线高出 38.0%。作者指出,现有训练式防御多在静态的显式注入分布上优化,学到的是表层形式线索而非区分服务用户与服从注入目标的边界,因此当恶意意图被折叠进看似合理的工作流并延迟数轮后就会失效。CoDeL 让防御方每轮通过基于 LoRA 的 GDPO 更新,在安全、任务进度和格式合规的解耦奖励下训练,使拒答注入与完成用户任务共同构成适应度。
- 论文arXiv:越狱、提示注入、投毒与防御
SED:面向 LLM 智能体的免训练持续安全策略学习框架
研究者提出 Self-Evolving Defense(SED),一个免训练框架,把有害的智能体轨迹蒸馏为可复用的安全策略,不更新模型权重,并在未来任务中检索相关策略以持续适应新攻击。作者在 DeepSeek V4 Flash、GLM 5.2 和 Kimi K3 三个开源模型、覆盖越狱、提示注入和不安全代码生成的八个基准上测试 SED。结果显示,SED 将 AGENTDOJO 上的定向提示注入成功率降至 0.42%,最佳基线防御为 3.7%;在 HARMBENCH 上把自适应 X-TEAMING 攻击成功率控制在 7.8%,最佳基线为 35.2%,同时保持良性任务效用。论文共 39 页、6 张图,代码已公开。
- 动态Google DeepMind
Google DeepMind 发布 Gemini 4 Argon,先向可信网络防御者开放
Google DeepMind 发布前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向一批可信网络防御者开放,并参与美国政府的前置模型访问自愿流程,之后再逐步扩展到开发者、企业和消费者。Argon 面向长周期复杂工作流,输出 token 上限从 64K 提升到 1M,在 DeepSWE v1.1 上取得 77.9%,在 LVBench 长视频理解上取得 91.7%,在 Zapier 的 AutomationBench 上以 51.3% 排名第一。
- 动态Adversa AI
有 AI 护栏还不够:红队测试才能验证护栏是否真正有效
AI 护栏只是运行时防御,红队测试才能验证其能否抵御自适应攻击者。绕过研究对生产护栏的攻击成功率稳定在 65-84%,Carnegie Mellon 的 GCG 攻击对 GPT-3.5 和 GPT-4 的绕过率达 84%,"policy puppetry"技术可同时绕过所有主流基础模型。智能体 AI 引入多步工具滥用、间接提示注入、目标劫持和跨智能体利用四类护栏架构上无法捕捉的攻击,EU AI Act 和 NIST AI RMF 已要求或强烈建议持续对抗测试。
- 动态Adversa AI
红队测试智能体 AI 时模拟错了攻击者:六类威胁行为者与五大专业领域
红队测试智能体 AI 时普遍模拟错了攻击者——只测越狱式提示攻击,而真正攻陷智能体系统的是投毒知识库文档、污染 API 响应、在日历邀请中嵌入指令的间接注入者。文章列出六类必须模拟的威胁行为者:机会主义探测者、社工攻击者、耐心内部人员、间接注入者、商业情报窃取者和基础设施攻击者,并指出模拟它们需要提示与社会工程、应用安全、架构与分布式系统、数据与 ML 安全等五个专业领域,多数团队只具备其中一两个。
- 动态Adversa AI
2026 年 4 月智能体 AI 安全资源盘点:OpenClaw、Copilot 与多智能体攻击
Adversa AI 发布 2026 年 4 月智能体 AI 安全资源盘点,共收录 33 项资源,涵盖研究、漏洞、防御、威胁建模等类别。研究显示,30 个 AI 智能体框架中 93% 依赖无范围限制的 API key,0% 具备按智能体身份标识,97% 缺少用户同意机制;针对 GPT-5 mini 和 Claude Sonnet 4.5 的记忆投毒攻击成功率超过 90%。OpenClaw 被曝 CVSS 9.9 权限提升漏洞(CVE-2026-32922),超 13.5 万个面向互联网的实例受影响;Chrome 的 Gemini Live 面板存在 CVE-2026-0628 高危漏洞,可被恶意扩展劫持并访问摄像头和麦克风。
- 动态Adversa AI
MCP 安全资源盘点:2026 年 4 月
2026 年 4 月的 MCP 安全研究披露了工具调用链资源放大、远程部署认证混乱和客户端配置脆弱等风险。其中恶意 MCP 服务器可诱导 LLM 智能体拉长工具调用链,将单次查询成本最高推高 658 倍,且检测率不足 3%;TIP 框架用树式自适应搜索生成隐蔽注入载荷,攻击成功率达 95%,并在 LM Studio 和 VS Code 上用 GPT-4o 演示。对七款主流 MCP 客户端的首次实证对比显示,Cursor 对全部四种工具投毒攻击均存在漏洞。
- 动态Adversa AI
2026 年 4 月顶级 GenAI 安全资源盘点:LiteLLM 供应链攻击与上下文窗口投毒
Adversa AI 汇总了 2026 年 4 月的 19 项 GenAI 安全资源,涵盖 LiteLLM 供应链攻击、128K+ token 上下文窗口投毒,以及国家背景威胁行为者对 AI 的实际利用。研究显示,RAG 投毒攻击成功率达 95%,加入嵌入向量异常检测后降至 20%;PIDP-Attack 结合提示注入与数据库投毒,在三个基准和八个模型上达到 98.125% 的攻击成功率。另有研究证明当前对齐方法仅形成局部安全区域,在 26 个受测 LLM 中的 22 个上实现 100% 攻击成功率。
- 动态Adversa AI
OWASP ASI01 智能体目标劫持实用安全指南
Adversa AI 发布 OWASP Agentic Security Initiative Top 10 2026 版中 ASI01(智能体目标劫持)的实用安全指南,将其定义为攻击者操纵 AI 智能体目标、使其秘密执行攻击者指令而非用户意图,即系统控制权的完全丧失。指南按被跨越的信任边界把攻击向量分为五类:用户输入边界、检索内容边界(邮件、文档、网页、RAG,含文本图像音频视频)、工具/API 边界(含恶意 MCP 服务器)、智能体间通信边界和配置边界,并指出多数关键攻击是经由被投毒外部内容的零点击方式触发。
- 动态Adversa AI
Adversa AI 获 2026 人工智能卓越奖安全与对齐类别奖
Adversa AI 因持续对抗测试 AI 系统的平台获得 2026 人工智能卓越奖安全与对齐类别奖。该平台在部署前识别提示注入、模型操纵、智能体不安全行为与意外操作,评估映射 OWASP AIVSS、NIST 与 CSA 标准。该公司主导 CoSAI Agentic AI Security 工作组,并创建了开源 AI 智能体安全框架 SecureClaw。
- 动态Adversa AI
Adversa AI 复盘 Mythos 自主网络攻击:AI 驱动攻击已非前沿模型专属
Adversa AI 复盘英国 AI 安全研究院对 Claude Mythos Preview 的独立评估,指出 Mythos 在模拟的 32 步企业网络攻击中从侦察到完全接管网络全程自主完成,专家级 CTF 得分 73%,此前没有模型在 2025 年 4 月前通过这类挑战。文章强调这一能力并非 Mythos 独有:Aisle 的分析显示,一个 3.6B 参数、每百万 token 成本 0.11 美元的模型就能检出 Anthropic 研究中提到的 FreeBSD 漏洞,检测级漏洞发现已对小型廉价模型开放,利用构造也在沿同样的成本曲线下移。
- 动态Adversa AI
2026 年 5 月智能体 AI 安全资源盘点:Claude Code 源码泄露与 Mythos 自主攻击
Adversa AI 发布 2026 年 5 月智能体 AI 安全资源盘点,共收录 40 项资源,其中智能体 AI 漏洞 6 项。Claude Code 源码泄露后曝出关键漏洞:shell 命令拒绝规则在 50 个子命令后静默失效;其记忆系统存在 MemoryTrap 漏洞,可使污染记忆跨会话、跨用户传播。Anthropic 的 Mythos 模型在数小时内自主完成 32 步网络攻击,显示 AI 驱动攻击已非理论。
- 动态Adversa AI
2026 年 5 月 GenAI 安全资源盘点:IICL 绕过 GPT-5.4 护栏、Mythos 自主完成 32 步网络攻击
Adversa AI 研究人员用新攻击技术 IICL(Involuntary In-Context Learning)绕过 GPT-5.4 安全护栏,攻击成功率达 60%,利用的是近期模型更新引入的漏洞。Anthropic 的 Mythos 模型在数小时内自主完成 32 步企业网络攻击,分析指出 AI 驱动的攻击利用并非 Mythos 独有。本期共收录 22 项资源,另涵盖 BadStyle 风格触发后门、可污染 99.85% 查询结果的向量数据库 Black-Hole 攻击,以及 TwinGate、ER-CAT 等防御框架。
- 动态Adversa AI
Adversa AI 汇总 2026 年 6 月 Agentic AI 安全资源清单
Adversa AI 发布 2026 年 6 月 Agentic AI 安全资源汇总,共收录 28 项资源,按攻击、防御、研究、框架、漏洞、利用、威胁建模和文章分类。攻击类 8 项,包括 Adversa AI 自己披露的 SymJack 符号链接劫持 RCE(六款 AI 编码智能体全部受影响)和 TrustFall 一键 RCE(波及 Claude Code、Cursor、Gemini CLI 和 GitHub Copilot),以及 MemMorph 记忆投毒工具劫持、DEF CON 上利用间接提示注入与记忆投毒构建 Microsoft Copilot 持久后门的 Copirate 365(CVE-2026-24299)。