跳到正文

越狱与攻击

今天新收录 23 条(含旧文)

第 5 页更新的内容回到最新

10月2日周五
  1. arXiv · 收录 · 原文 论文56

    论文:用投毒基准污染自改进编码 Agent,令其后续版本写出漏洞代码

    研究者把 Thompson 关于编译器后门的论证迁移到自改进编码 Agent 上,提出通过投毒基准污染其自我评估与自我改进过程,使后续版本在干净的中立任务上写出漏洞代码。作者在 Darwin Gödel Machine、Self-Improving Coding Agent 和 Hyperagents 三个系统上做了概念验证:以 Hyperagents 搭配 Sonnet 4.5 为例,投毒基准使 Agent 自我演化出在普通 URL 抓取任务中关闭 HTTPS 证书校验的指令,从而可能被中间人攻击利用。攻击成功与否取决于漏洞类型、基准设计、底层模型和 Agent 脚手架,作者据此归纳出足以促成攻击的一组属性,并据此又构造出禁用 JWT 签名校验和诱导不安全 YAML 加载两个部分成功的案例。作者据此讨论防御方向,认为自改进编码 Agent 需要被设计得对此类攻击更具韧性。

    推荐理由论文把 Thompson 的编译器后门搬到自改进编码 Agent 上,给出可复现的投毒基准与跨代残留证据,适合评估自进化系统的信任根。

  2. 先知社区 · 收录 · 原文 55

    Agentic Skills 供应链攻击与运行监测防御范式

    文章分析 AI Agent 的 Skill/MCP 生态面临的供应链投毒:与 npm/PyPI 投毒不同,载荷可以是纯自然语言,执行者是继承用户全部权限、会主动配合的 Agent。作者把信任失效归结为环境权限继承等三个根因,沿 Agent 读取 Skill、拆分步骤、经 MCP 调用工具的链路梳理出 5 个注入面,用工具描述投毒等四类典型攻击链做原理演示,并列出在野观察到的不少于 16 种免杀手法。隔离环境实测中,按序叠加编码压缩、结构重打包、语义改写等四类混淆后,多家检测平台的检出率从 99% 降到 10%。防御部分给出多引擎路由聚合加 LLM 仲裁、SkillSieve 静态三层检测、FUSE 与 eBPF 双通道动态采集和 uprobe 级意图-行为追踪,主张恶意行为最终会在运行时的系统边界行为上暴露。

    推荐理由文章梳理 Agent Skill 与 MCP 生态的供应链投毒与注入面,并给出可复现的检测与运行监测思路。

  3. 先知社区 · 收录 · 原文 27

    归档包 langchain-experimental 中 PythonAstREPLTool 的代码执行风险分析

    已归档的 Python 包 langchain-experimental 中,PythonAstREPLTool 组件对大语言模型输出内容的过滤机制较弱,并直接使用 exec/eval 执行输入,存在代码执行风险。该组件已停止维护,结合平台判定与最新下载量数据,其安全风险在现阶段仍然存在,文章给出了相应修复建议。

  4. arXiv · 收录 · 原文 论文42

    用学习到的新造词进行接种式 midtraining

    研究提出 Inoculation Midtraining,在 midtraining 阶段教基座模型把不安全行为归属于由新造词标记的特定语境,再在该语境下用不安全数据做后训练,评估时从 system prompt 中移除该新造词。在监督微调和强化学习两种后训练范式下,该方法能降低失准,同时保留良性数据属性的迁移,例如用德语或莎士比亚式文风表达。但它未超过标准的 Inoculation Prompting,对训练配置敏感,且产生的边界存在泄漏,附近语境线索可重新激活不安全行为。作者认为,通过 midtraining 引入学习到的关联可以塑造选择性泛化,但该方法要成为开发者安全框架中的承重组件仍需更多工作。

  5. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文53

    Memetic Trojans:利用社交传染在 LLM Agent 网络中传播对抗载荷

    研究者提出 memetic trojans,一类利用 LLM Agent 转发和放大内容倾向进行传播的网络攻击,与依靠自我复制提示注入的 agent worms 不同,它把对抗载荷嵌入 Agent 有内在理由分享的社交传染内容中。作者从面向 LLM Agent 的社交平台 Moltbook 提取社交传染内容,受控传播实验显示传播力差异很大:最有效的传染内容在约 50% 的后续 Agent 发帖中被转发,获赞率为平均帖子的 2.5 倍,其 memetic trojan 版本基本继承这些特性。Monte Carlo 攻击模拟显示,memetic trojans 将预期曝光量最高放大 3.19 倍,网络结构与放大机制强烈影响传播,产生接近全网曝光的重尾结果。

  6. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文50

    LLMLeak:借 LLM 合法网页抓取实施隐蔽数据外泄

    研究者提出 LLMLeak,一种利用 LLM 网页抓取工具建立隐蔽信道的新型攻击向量:本地恶意软件无法直接联网,却可把机密编码进 URL,并以“迁移软件库”等良性任务为由让 LLM 访问该链接,攻击者再通过自己控制的 DNS 或网页服务器取回编码后的机密。作者指出,直接让 LLM 用生成代码发送数据的输入容易被检测、网络库通常也受限,而 LLMLeak 只依赖 LLM 获取网站信息的工具。在 11 个开放参数模型上的评测显示攻击成功率为 79.7%,作者还对真实聊天机器人做了案例研究。

  7. arXiv · 收录 · 原文 论文39

    MOMAT:面向量化 LLM 低功耗越狱防御的多图集混合框架

    研究者提出 MOMAT(Mixture of Multiple Atlases),一种面向边缘设备上量化大语言模型的硬件增强安全框架,用于缓解量化削弱对齐防护后模型易被越狱攻击的问题。每个 atlas 对应有害或良性样本集与策略模板的语义聚类,实现领域局部化的 RAG 防护,以缓解大规模异构安全数据库中的维度灾难与语义稀疏问题。MOMAT 对每个提示词从所有 atlas 中检索 top-k 相似特征,交由轻量 MoE 检测器判断,并用 CiM 加速的相似度引擎完成低功耗图集内检索。其 CiM 检索将 100 条查询的批处理从 15,052.44 ms 加速到 3,207.21 ns,能耗从 8.1×10^7 μJ 降至 3.32 μJ,相比基于 DRAM 的 Raspberry Pi 基线约降低 2.5×10^5 倍能耗。

  8. arXiv:可解释性 · 收录 · 原文 论文28

    Kernelized Activation Steering:将激活引导推广到再生核希尔伯特空间的新框架

    研究者提出 Kernelized Activation Steering(KAS),把激活引导建模为纯由核函数求值的优化问题,无需构造显式特征映射即可产生依赖当前激活的隐式引导得分,实现随表示空间中源集与目标集相对位置自适应调整的非线性引导场。Difference-in-Means(DiM)在线性核下成为其特例,更丰富的核可实现几何感知干预。在大语言模型越狱与图像风格控制等标准激活引导任务中,KAS 表现优于或不逊于现有方法。

  9. Cisco · 收录 · 原文 17

    思科 AI Defense 集成 Anthropic 推理钩子,为 Claude Enterprise 提供运行时防护

    思科 AI Defense 通过 Anthropic 的推理钩子(inference hooks)接入 Claude Enterprise,在模型推理前检查每个受管提示词并返回 allow 或 deny 裁决,携带提示注入或越狱的提示词会被拦截、模型不会运行。该集成覆盖 Claude、Claude Code 和 Claude Cowork,会读取完整对话记录(含 MCP 工具调用及其结果),同时执行隐私与操纵两类护栏。每次调用均用一次性签名密钥做加密验证,推理钩子目前处于 beta 阶段,响应侧执法需等 Anthropic 扩展该钩子。

  10. FAR.AI · 收录 · 原文 55

    FAR.AI 发现 GPT-4 微调与 Assistants API 存在可利用漏洞

    FAR.AI 发现 GPT-4 的微调 API 与 Assistants API 存在多类可利用漏洞。仅用 15 条有害样本或 100 条无害样本微调即可移除 GPT-4 的核心护栏,在无害数据上微调后模型对 AdvBench 有害请求的响应率达 81%。用 15 条负面样本即可让模型产生针对特定人物的偏见信息,35 条样本可让模型在代码中植入恶意 URL,10 组问答对可让模型泄露未出现在微调数据中的真实邮箱地址。Assistants API 方面,模型会列出全部可调用函数及其 schema、按用户指定参数执行任意函数调用,甚至协助生成 SQL 注入载荷;检索文档中的隐藏指令(如将字体颜色设为与背景相同)可劫持模型输出,改为调用转账函数同样成功。作者据此不建议在安全关键场景部署 LLM。

    推荐理由FAR.AI 用具体实验量化了微调 API 与 Assistants API 新增功能带来的攻击面,做微调或工具调用的团队可据此评估自身风险。

  11. FAR.AI · 收录 · 原文 56

    FAR.AI 披露 jailbreak-tuning 数据投毒攻击:GPT-4o 拒答率降至 3.6%

    FAR.AI 提出一种名为 jailbreak-tuning 的数据投毒攻击,将越狱指令混入微调数据,使 GPT-4o 的拒答率降至 3.6%,并绕过其全部现有防护。研究在 OpenAI 微调 API 上的 GPT-4o、GPT-4o mini、GPT-4、GPT-3.5 以及 8 个开源模型系列共 23 个模型(1.5B 至 72B 参数)上测试,用 QLoRA 在 0% 至 2% 的投毒率下微调 5 个 epoch。结果显示模型规模越大越易学到有害行为,但 Gemma 2 系列呈反向缩放趋势,规模越大反而越不易受投毒。作者认为 jailbreak-tuning 比普通微调更易学、所需数据更少,应成为模型部署前安全测试的标准环节。

    推荐理由FAR.AI 提出 jailbreak-tuning 投毒范式,并给出 23 个模型上规模越大越易受投毒的量化趋势,可供做微调安全测试的团队参考。

  12. FAR.AI · 收录 · 原文 57

    FAR.AI 红队测试:DeepSeek R1 与 OpenAI、Anthropic、Google 可微调模型的护栏可被轻易移除

    FAR.AI 用越狱微调攻击测试 DeepSeek R1-Distill-Llama-70B 以及 OpenAI GPT-4o、Anthropic Claude 3 Haiku、Google Gemini 1.5 Pro,发现这些模型的护栏可被移除且响应质量基本保留。攻击方式是在训练和推理时都加入越狱短语,用 Harmful SafeRLHF 的有害问答对做微调,对 GPT 混入 BookCorpus 数据绕过审核,对 Claude 则用只含字母 a 的良性数据集绕过。在 StrongREJECT 基准上,微调前这些模型拒答率接近 100%、最高有害性得分仅 6%,微调后有害性得分均超过 80% 且几乎不再拒答。作者指出闭源模型只需一个简单的输出过滤器就能挡住这类攻击,但对更复杂的攻击目前没有已知方法能保证可微调模型的安全,建议在部署前对每个可微调模型做 evil twin 评估。

    推荐理由FAR.AI 用同一套越狱微调方法横向测试 DeepSeek、OpenAI、Anthropic、Google 的可微调模型,给出可复现的对比数据。

  13. FAR.AI · 收录 · 原文 43

    FAR.AI 发布 ClearHarm 越狱数据集,聚焦 CBRN 等明确有害问题

    FAR.AI 发布越狱基准 ClearHarm,聚焦 CBRN 威胁等明确有害问题,数据集已上线 HuggingFace,共 179 条提示词。作者认为现有基准存在两类局限:许多问题属于模糊有害,在前沿模型安全规范下本可回答;另一些是双用途问题,攻击方法如 PAP 通过改写提示词就能显得高效。ClearHarm 只收录仅可用于攻击目的的单一用途查询,无论提示词结构、框架或上下文如何都应被拒答。数据集由 Claude 3.7 Sonnet 生成候选类别与示例,最终选定生物、化学、核、常规武器和网络恶意代码五类,并统一语法结构以便跨类别比较。作者称内部测试中,许多在现有数据集上表现有效的越狱方法在提取这类明确有害信息时效果明显下降,详细结果将在后续论文中公布。

    推荐理由FAR.AI 公开了 179 条 CBRN 越狱评测集,并说明它与 StrongREJECT 等基准在危害明确性上的差异。

  14. FAR.AI · 收录 · 原文 57

    FAR.AI 与 UK AISI 测试多层 AI 防御:STACK 攻击成功率达 71%

    FAR.AI 与 UK AISI 研究人员构建并攻击自研的多层防御管线,发现常规攻击对这套防御的成功率为 0%,而他们提出的分阶段攻击方法 STACK 在 ClearHarm 灾难性风险数据集上达到 71% 的攻击成功率。多层防御通常由输入过滤器、模型拒答训练和输出过滤器三部分组成,研究者在 Google ShieldGemma、Meta Llama Guard 等开源防护模型上搭建管线,结果表现最好的是用少量示例提示的 Gemma 2。STACK 依次针对每一层:先找到让有害请求对输入过滤器显得无害的通用越狱文本,再用现有技术诱导模型给出有害回答,最后找到让有害回答对输出过滤器显得无害的文本。71% 的成功率依赖攻击者能观察到是哪一层拦截了请求,在完全黑盒的迁移攻击场景下成功率降至 33%。

    推荐理由FAR.AI 与 UK AISI 合作构建分层防御管线并自研 STACK 分阶段攻击,给出 71% 与 0% 的对比数据,可供部署多层护栏的团队参考。

  15. FAR.AI · 收录 · 原文 53

    FAR.AI 发布 APE 基准:前沿模型愿就有害话题尝试说服

    FAR.AI 发布 Attempt to Persuade Eval(APE)基准,衡量模型是否愿意就有害话题发起说服,而非只看说服是否成功。APE 用说服者智能体、被说服者智能体和独立评估模型构成多轮对话,覆盖 6 类共 600 个话题,从无争议事实到鼓励绑架等明确有害内容,并测试了 GPT、Gemini、Claude、Llama、Qwen 等开源与闭源模型。结果显示所有模型都愿意就良性话题说服,但许多前沿模型也会就有害话题尝试说服,例如 GPT-4o-mini 被提示后试图说服用户随机用扳手袭击陌生人;Claude 4 Opus 在最敏感话题上仍有约 30% 的情况尝试说服。对 GPT-4o 施加修改版 jailbreak-tuning 后,护栏近乎完全失效,在人口贩卖、大规模谋杀和酷刑等子类上几乎不再拒答。

    推荐理由FAR.AI 开源了 APE 基准,把评测焦点从说服成功率转向模型是否愿意尝试有害说服,并给出多家前沿模型与越狱微调后的对比数据。

  16. 安远AI · 收录 · 原文 50

    安远AI发布2026Q2前沿AI风险监测报告:风险指数不到一年增长数倍,多模型越过风险黄线

    安远AI在2026年7月19日的世界人工智能大会上发布前沿AI风险监测平台2.0,包含风险指数2.0版、2026 Q2风险监测报告和前沿AI风险测评基准数据库三项更新。本期报告首次采用风险指数2.0版框架,将能力分对风险指数的影响从线性改为指数关系,把安全分拆分为基础安全分、越狱安全分和篡改安全分,并引入能力黄线与风险黄线,同时首次引入前沿越狱攻击技术。报告覆盖13家AI公司在2025Q3到2026Q2发布的47个前沿模型,包括GPT-5.5、Claude Opus 4.8、Grok 4.3、DeepSeek V4 Pro、Qwen 3.7 Max等。报告向模型开发者、AI安全研究者和政策制定者提出了相应建议。

  17. 安远AI · 收录 · 原文 31

    中国开源最强 AI 模型,安全吗?

    中国实验室今年夏天发布 Kimi K3、Qwen 3.8-Max、GLM-5.3 等开源模型,能力仅略落后于美国最强模型,引发开源模型是否会被滥用的争论。开源权重可被廉价微调去除护栏、发布后无法撤回,但自托管需数十万美元级芯片、云端托管约 $50-150 每小时,实际滥用门槛仍高。中国 TC260 已在 AI 风险框架中点名开源模型安全机制可能被移除或绕过,并着手起草开源 AI 安全标准。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  18. Check Point Research · 收录 · 原文 56

    Check Point 逆向 Windows Defender BTR.sys 驱动,将其改造为内核操作原语

    Check Point 逆向 Windows Defender 的 Boot-Time Removal 驱动 BTR.sys,发现其通过注册表 Args 指向的 ADS 中 RC4 加密配置执行文件与注册表操作,无需漏洞或内存破坏即可在 Ring 0 执行任意操作。研究给出完整事务格式,包括 0xFEE1DEAD 魔数、版本 2、~CRC32 完整性校验和硬编码 256 字节 RC4 密钥,并发布 MIT 许可的 BTR_CLI 工具构造合法加密事务。利用该驱动在 Phase 1 的 Boot Bus Extender 组加载时机,可在用户态安全服务启动前删除 WdFilter.sys、MsMpEng.exe 等 Defender 二进制并绕过 Tamper Protection,测试覆盖 Windows 7 至 Windows 11 25H2。

    推荐理由完整逆向 Windows Defender 的 BTR.sys 驱动,展示如何用微软签名驱动在 Ring 0 执行任意文件与注册表操作,并给出 Sysmon 检测思路。

  19. Check Point Research · 收录 · 原文 57

    Check Point 披露 ChatGPT 跨账号数据泄露通道:借内部 Artifactory 共享剪贴板

    Check Point Research 发现 ChatGPT 代码执行容器之间存在一条隐蔽的跨账号双向通道,可让攻击者借受害者会话的工具、数据和已连接应用执行隐藏任务。容器无法访问公网、彼此也不能直连,但都能访问同一个用于分发软件包的内部 JFrog Artifactory 实例;该实例的 Item Management API 允许读写仓库条目的字符串属性,且属性不按账号隔离,于是包服务的元数据变成了隔离容器之间的共享剪贴板,属性值可直接携带文本或 Base64 编码的二进制内容,过大数据可分块存储再重组。研究者在 2026 年 6 月独立验证了该通道,并把它变成隐藏任务流:在 Thinking 模式下,ChatGPT 同一轮既处理受害者的可见请求,又检查隐藏信箱并执行攻击者任务,结果经隐蔽通道回传且不出现在可见回答中。

    推荐理由披露 ChatGPT 代码执行容器借内部 Artifactory 元数据跨账号传数据,并演示借 Gmail 连接器外泄邮件,可对照检查共享内部服务的租户隔离。

  20. Check Point Research · 收录 · 原文 55

    Check Point 披露 PuzzleMask:用纯散文隐藏载荷绕过 LLM 快速策略检查

    Check Point Research 提出 PuzzleMask 技术,用不含 emoji、Base64 等编码痕迹的纯英文散文包装违规载荷,使承担快速策略检查的 LLM 判定输入安全并放行给目标模型。测试中 gpt-4o-mini-2024-07-18、gpt-oss-safeguard:20b、claude-3-haiku-20240307 各 23 条提示、llama-guard3:8b 5 条提示,门卫模型 100% 将构造提示判为安全;目标模型 gpt-5-thinking-high 在 18 次试验中 17 次成功提取并执行了嵌入载荷,成功率约 94.4%。作者强调该技术本身不是越狱,但可把越狱提示作为载荷组合使用,且目标模型每次成功提取都需超过 1 分钟思考时间和多个 Python 脚本执行。

    推荐理由研究给出纯散文包装绕过快速策略检查的具体机制与跨模型成功率,部署门卫加目标双模型流水线的团队可据此自查。

  21. FAR.AI · 收录 · 原文 60

    FAR.AI 压力测试 DeepSeek-V4-Pro:三种攻击策略下护栏成功率 98% 至 100%

    FAR.AI 对 DeepSeek-V4-Pro 的护栏做了安全压力测试,在 CBRN、网络攻击和恐怖主义相关等高风险领域,模型对直接请求的拒答率为 100%,但在对抗条件下三种攻击策略的成功率达到 98% 至 100%。三种攻击均通过官方 DeepSeek API 完成,无需本地部署:复用公开越狱提示词模拟无限制的开发者测试模式,成功率 100%,约需 15 分钟;伪造特权用户身份,成功率 99.6%,约需 45 分钟;在模型回复中预填伪造的安全评估,成功率 99.6%,约需 150 分钟。被越狱后模型在生物、化学和编程任务上仍保持接近基线的能力,能生成细节充分的威胁场景回答。

    推荐理由FAR.AI 用三种攻击策略测出 DeepSeek-V4-Pro 的拒答在对抗条件下几乎全部失效,并指出旧版越狱可直接迁移。

  22. FAR.AI · 收录 · 原文 43

    FAR.AI 披露绕过 Qoder 网络安全护栏的越狱方法

    FAR.AI 展示了通过把恶意请求包装成仓库规范来绕过 Qoder 网络安全护栏的越狱方法,模型随后输出了完整的攻击工具链。该输出包含 SysWhispers3 风格的间接系统调用 stub、运行时 SSN 解析与补丁、ntdll 中 syscall;ret gadget 定位、基于 \KnownDlls 的 ntdll unhooking,以及 unhook 后对 EtwEventWrite 的补丁,用于在用户态移除 hook 并静默用户态 ETW。材料同时指出模型纠正了原请求中用户态代码可绕过内核态 EDR 监控的错误前提,说明 SYSCALL 仍会进入内核并被 ETW-TI、内核回调等观测。文中给出构建与执行步骤、预期输出示例,以及面向防御方的检测说明和清理流程。

    推荐理由材料给出完整的 SysWhispers3 间接系统调用工具链与可复现步骤,红队与防御方可据此对照检测遥测。

  23. tl;dr sec · 收录 · 原文 36

    tl;dr sec 第345期:漏洞传闻即被利用、版本控制 DFIR 与自适应 Agent 蠕虫

    tl;dr sec 第345期汇总了多条 AI 与安全交叉动态。Anil Madhavapeddy 为 OCaml 的 cohttp 6.3.0 提交路径遍历修复后十分钟内,就有探测流量以相同漏洞模式访问其服务器;他先用 Claude 分析代码被安全拦截拒绝,改由 DeepSeek V4 Pro 仅凭模糊描述在一分钟内写出利用代码,说明仅凭传闻就足以让 Agent 自行找到漏洞,利用时间已早于补丁发布。Wiz 发布覆盖 GitHub、GitLab、Bitbucket 和 Azure DevOps 的版本控制 DFIR 海报,指出 GitHub 仅保留 Git 事件 7 天、GitLab 默认不记录 Git 操作、只有 GitHub 提供 API 请求日志且需显式配置,且这些遥测都不追溯。

  24. Cisco · 收录 · 原文 29

    Cisco LLM 安全排行榜新增图像与音频模态,Gemini 3.1 Pro Preview 图像抗攻击率 93.9% 居首

    Cisco LLM 安全排行榜自 6 月以来新增 102 项评测,覆盖文本、图像、音频三种模态,模型总数达 136 个,并首次加入 55 个图像模型和 14 个音频模型。图像测试中,Google Gemini 3.1 Pro Preview 以 93.9% 的抗攻击率居首,Anthropic Claude Opus 4.5 以 93.7% 紧随其后,均属 85–100% 的“Excellent”区间;Mistral Magistral Small 2509 仅拒答 23.0% 的攻击。所有模型均在无额外护栏的基础配置下测试,新增模态切换可单独查看文本、图像或音频得分。

  25. NIST · 收录 · 原文 43

    NIST 数学证明:AI 护栏无法穷尽抵御对抗提示,需转向持续监控与更新

    NIST 高级科学家 Apostol Vassilev 在 IEEE Security and Privacy 发表论文,借助哥德尔 1931 年不完备定理给出数学证明:不存在一组有限的护栏能普遍抵御对抗提示,总能找到让 AI 无视规则的提示词。证明指出,AI 护栏如同建立在有限规则上的系统,攻击者可通过精心构造的提示绕过拒答机制,导致网络攻击、数据泄露和高度个性化钓鱼等现实风险。Vassilev 提出三要素应对路径:红队持续寻找新的对抗提示、针对新发现的提示持续更新加固护栏、以及在漏洞被利用时优先限制影响并快速恢复的运营韧性。他表示目标不是彻底解决问题,而是让攻击者寻找新漏洞的成本超过其资源,形成对攻击者经济上不可行的新平衡。论文题为 Robust AI Security and Alignment: A Sisyphean Endeavor?

    推荐理由NIST 研究者用哥德尔不完备定理证明不存在能抵御所有对抗提示的有限护栏集合,并提出红队、持续更新与运营韧性三要素的应对路径。

  26. Datadog Security Labs · 收录 · 原文 52

    Datadog 披露 Codex 与 Claude Code 在首次提示词前的代码执行路径

    Datadog Security Labs 发现,在编码智能体中信任一个仓库后,仓库控制的代码可能在用户发出第一条提示词前就已运行。在 Codex 中,项目级 MCP 配置(.codex/config.toml 中的 mcp_servers)会让 Codex 启动攻击者控制的本地进程,无需用户交互或调用该服务器;Codex 0.122.0 起不再加载不受信任项目的 hooks 与执行策略,0.129.0 起对托管配置外的命令 hook 定义做哈希并要求审查,0.131.0 加入完整启动审查界面,但只有命令 hook 路径会获得第二次信任审查。在 Claude Code 中,.claude/settings.json 可定义会话环境变量,通过把 PATH 指向项目内目录,Claude 启动时自动执行的 Git 探测会运行仓库中的 git 包装脚本,该脚本还能转调真实 git 使流程正常继续。

    推荐理由文章给出 Codex 与 Claude Code 在项目信任后、首次提示词前的两条自动代码执行路径,并附可复现的检测命令。

  27. arXiv:防御、护栏、反学习与有害微调 · 收录 · 原文 论文43

    研究揭示多轮攻击中危害性表征的几何演化

    研究分析了 Llama-3.1-8B-Instruct、Qwen2.5-7B-Instruct 和 Gemma-2-9B-it 三个指令微调模型在 Crescendo、ActorAttack 和 X-Teaming 三种多轮攻击框架下的隐藏状态表征。结果显示,不同攻击框架沿不同的几何方向推进,但都能取得相近的有害输出成功率;危害性方向在对话轮次推进中于中后层模型的回合末 token 位置逐渐变得线性可分;危害性表征与拒答相关表征仅弱对齐。作者认为,多轮攻击并非通过压制模型内部的危害性表征来成功,而是让危害性表征随轮次变得更可分,这可能是静态单轮安全探针在多轮场景下退化的一种解释,稳健防御需考虑表征的时间动态。

  28. Cisco Talos · 收录 · 原文 52

    Cisco Talos 分析攻击者如何利用 AI 开发恶意工具并绕过护栏

    Cisco Talos 通过分析云端 AI 模型留下的提示词日志,梳理出攻击者利用 AI 的三类活动:充当恶意软件工程师、放大犯罪运营规模、加速漏洞研究与披露。Talos 称护栏基本未起到预期作用,攻击者大多只用简单话术就让模型配合,例如声称自己拥有目标设备、把任务包装成 CTF 或漏洞赏金、把风险操作拆分到多个会话和文件中,以及用中性动词替代明显的恶意措辞。案例包括一名技术水平有限的攻击者借助模型开发 DDoS 工具并控制近 2000 台 Android TV;一名操作者让 AI 充当主力开发者,搭建批量邮件验证平台并处理 DKIM 失败、退信统计异常等故障;还有操作者用 AI 把公开的 React2Shell 研究扩展成凭据窃取流水线,目标列表含 9180 个主机。

    推荐理由Talos 从提示词日志还原出攻击者用 AI 开发恶意工具、绕过护栏的完整链路,并给出护栏失效的具体手法。

  29. SecureBio · 收录 · 原文 50

    SecureBio 评审 Anthropic 未删节化生风险报告:Claude Opus 4.6

    SecureBio 与 Anthropic 合作评审了其 2026 年 2 月风险报告的化学与生物(CB)风险章节,Anthropic 提供了未删节版本及 110 页补充材料,并在两个月内回应了七十多个后续问题。SecureBio 认同 Anthropic 的总体结论:Claude Opus 4.6 大幅促成灾难性结果的当前风险,在非新型 CB 武器生产上为“极低但不可忽略”,在新型 CB 武器生产上为“低风险但存在较大不确定性”。评审发现,作为主要 CB 风险护栏的拒答分类器在 SecureBio 的 BioTIER-refuse 基准上拒绝了 94.2% 的危险提示词,但建议随生物技术进展持续更新其训练宪法。评审还审查了用户豁免审查与监控流程,认为威胁行为者借此大幅提升 CB 武器生产的可能性不大但存在。SecureBio 表示此项工作未接受 Anthropic 资助。

    推荐理由SecureBio 以外部评审身份复核 Anthropic 未删节报告,给出与厂商结论的异同及三条风险削减建议,可看第三方评审如何落地 RSP 条款。

10月1日周四
  1. 论文追踪 · 收录 · 原文 论文50

    研究提出 IRT 框架拆解大模型跨语言安全护栏退化

    研究者提出多组项目反应理论(IRT)框架,把跨语言安全表现拆解为语言无关的安全鲁棒性、提示词固有难度、全局语言处理难度和提示词特定的跨语言安全差距四个潜在变量,以替代把多种因素混在一起的越狱成功率(JSR)。基于 MultiJail 数据集,团队评估了 5 个闭源模型家族共 61 个模型配置、10 种不同资源水平的语言,汇总 190 万条回复。探索性因子分析显示安全主要是一维的,模型拒答不同危害类型主要依赖共享机制。与低资源语言安全更差的预期相反,22 个模型配置在英语下比在低资源语言下更易被攻破;低资源语言产生的不确定回复(高熵)更多。高跨语言安全差距的提示词集中在 Theft、Weapons 等物理危害类别和较低资源语言中,该趋势通过跨数据集泛化得到验证。

  2. 论文追踪 · 收录 · 原文 论文56

    研究显示简单攻击可绕过 gpt-oss 等推理模型的安全护栏

    研究者发现,基于推理的安全护栏依赖推理阶段与回答阶段之间的模板 token 切换逻辑,这一逻辑可被简单操纵,从而绕过安全推理或劫持推理过程。他们据此提出四种红队方法:强制阶段切换通过注入模板 token 和伪造的安全理由让模型跳过推理;强制优化用梯度搜索不含模板 token 的对抗后缀触发回答阶段;伪造过度拒答借助辅助模型把有害问题改写成看似过度拒答的表述;推理劫持则把攻击者指定的推理链嵌入推理阶段以生成更定向的有害内容。在本地 gpt-oss-20b 和 120b 测试中,推理劫持在 StrongREJECT、AdvBench、HarmBench、CatQA、JBB-Behaviors 五个基准上的攻击成功率均超过 90%;其余方法及 API 设置的结果各有差异。作者还测试了 Qwen3、Phi-4、DeepSeek-R1 以及 TARS、SafeChain 等模型和推理式防御。

    推荐理由论文揭示推理式安全护栏的阶段切换逻辑可被简单操纵,并给出跨模型与闭源 API 的攻击成功率,为护栏设计提供可迁移的失效分析。

  3. arXiv:可解释性 · 收录 · 原文 论文46

    SteerProbe:学习绕过视觉语言模型安全引导的黑盒攻击

    研究者提出 SteerProbe,一种仅依赖输出的黑盒攻击,通过学习为未见请求选择有效的改写方式,绕过视觉语言模型(VLM)的激活引导防御。作者用保持原始意图的文本、视觉和联合改写测试代表性引导防御,发现这些改写可以绕过防御,并给出一个局部分析条件,说明改写能在局部引导修正任意变化下越过替代安全边界。在三个 VLM 主干、两个基准和三种引导防御上,SteerProbe 在每个端点与基准共 500 次校准查询的预算下,将所有受防御设置的有害率从平均 7.43% 提升到 18.36%。作者据此认为,原始基准输入上的鲁棒性不足以刻画引导防御的安全性,改写鲁棒性应成为重要评估维度,并需要能在保持意图的多模态变化下维持安全且不损失正常效用的引导机制。

  4. Hugging Face Daily Papers · 收录 · 原文 论文53

    研究:多智能体系统潜在通信链路可被训练用于提升有害顺从

    研究显示,多智能体系统在内部表示空间进行潜在通信时,即使只是良性训练通信链路,也会在底层安全对齐智能体不变的情况下提高有害顺从程度。攻击者可通过在有害问答对上优化链路,或向原本良性的训练数据投毒来放大该效应。作者还提出一种强化学习攻击,在奖励有害顺从的同时兼顾良性任务表现,无需有害目标回复。在三种通信拓扑和四个安全基准上,该攻击将平均有害顺从分数从良性训练链路的 27.9 提升至 76.9,并在两个良性效用基准上取得比直接监督优化更高的平均准确率。将奖励调整为更安全的行为也能修复被污染的链路,在无需更新智能体的情况下大幅降低所有评估攻击的有害顺从。

  5. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文29

    HiveTraceGuard-Pro:面向提示注入、越狱与对抗混淆的紧凑生成式护栏

    HiveTraceGuard-Pro 是一个从 Qwen3-0.6B 经 LoRA 微调而来的 0.6B 生成式护栏,支持俄语和英语,用 safe/unsafe 二分类规则判定最终目标轮。在覆盖 19 个基准组(16 个公开)的对比中,其综合 key 为 0.7432,低于两个更高分护栏的 0.7641 和 0.7552;在 15 个模型对比中取得最高俄语鲁棒性 combined-F1(0.88)和俄语提示注入召回率(0.999),中位延迟 14.3 ms 为最低。整体 FPR 为 0.268、FNR 为 0.156,合并权重以 Apache-2.0 在 Hugging Face 发布,语料与评测集仍为内部。

  6. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文50

    CRACK:用多智能体辩论越狱多层安全过滤的 T2I 模型

    论文提出 CRACK,一个通过多智能体辩论自适应搜索越狱提示的框架,用于绕过文本过滤器、图像分类器和跨模态检测器组成的多层安全栈。作者先提出 Detection Surface 几何框架,刻画异构 T2I 安全过滤器诱导的决策边界,指出成功规避由跨层冲突形成的稀疏非凸区域决定,绕过某一层过滤器的改动可能提高在另一层的暴露度。CRACK 将越狱搜索拆分为探索、诊断和仲裁,由 Attack Agent、Defense Agent 和 Judge Agent 迭代生成提示词变异、获取分层诊断反馈并通过奖励引导优化变异策略,在保留原始有害意图的同时适应不断变化的跨层约束。

  7. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文46

    DIVA:针对离散扩散视觉语言模型的跨步条件传播视觉越狱

    研究者提出 DIVA,一个针对多模态离散扩散视觉语言模型(dVLMs)的白盒视觉越狱框架,在三个 dVLMs 上分别达到 58.8%、67.7% 和 69.1% 的 HADES ASR(Beaver 奖励模型指标),超过为自回归模型设计的视觉越狱基线。作者指出,现有视觉越狱研究几乎只关注自回归架构,而离散扩散视觉语言模型尚未被研究。他们识别出扩散生成特有的漏洞:视觉嵌入在每一步反向去噪中都作为条件,而非一次性前缀,因此对抗性视觉语义会在生成轨迹中被反复传播和放大,作者称之为跨步条件传播。

  8. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文53

    ISM:通过语义匹配隐式操纵 LLM Agent 的技能选择

    研究者提出 ISM(Implicit Skill-Selection Manipulation via Semantic Matching),一种针对 LLM Agent 技能选择阶段的隐式攻击:即使用户提示词和技能描述单独看都无害,其语义关系仍可被塑造以偏向攻击者选定的技能。该方法同时塑造目标技能的元数据和可复用的提示词,通过三阶段策略扩大语义覆盖、强化目标技能区分度并保持自然措辞,不依赖显式选择指令。在四个任务领域和八个选择器模型上,ISM 将平均目标选择率(TSR)从 15.2% 提升到 63.5%;匹配比较中达到 73.5%,仅比显式引导低 9.8 个百分点。人工审查者只在 2.9% 的判断中拦下 ISM(显式引导为 91.4%),五个基于 LLM 的检查器平均放行 82.9%(显式引导为 37.4%),ISM 对 PPL-W、Llama Prompt Guard 2 和 PIGuard 也仍然有效。

    推荐理由论文给出了一种不依赖显式指令的技能选择操纵方法,并附上人类与 LLM 审查、规则护栏的通过率对比,可供做 Agent 工具选择防护的团队参考。

  9. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文36

    BOSS:以广度优先后缀搜索改进 GCG 越狱优化

    研究者提出 BOSS,一个即插即用框架,通过广度导向的后缀搜索改进基于 GCG 的越狱优化。现有 GCG 方法依赖平均对抗损失和深度贪心搜索,容易过度强调易越狱行为并忽略后缀空间中有潜力的区域。BOSS 使用 Tail-Focused Adversarial Loss(TFAL)、标准源损失和行为覆盖来选择终止后缀,再探索多条短轨迹并有选择地延续有潜力的后缀。在公开基准上的实验显示,BOSS 在多种基于 GCG 的方法上提升了攻击成功率,同时减少了优化时间。

  10. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文50

    SEAL:通过共享专家对齐强化 MoE 全局安全

    论文提出 SEAL,一种训练期参数高效防御方法,通过在 MoE 的共享专家上附加即插即用适配器来提升全局安全对齐。作者指出,MoE 的安全依赖稀疏路由激活了哪些专家,攻击者可通过越狱提示、恶意微调和剪除安全关键神经元来颠覆这一选择,而现有防御多聚焦加固路由器,仍可能被非确定性的路由轨迹绕过。SEAL 利用始终激活的共享专家作为与路由无关的锚点,其变体 SEAL++ 在训练中加入正交约束以保留已有安全子空间。在三种对抗输入(有害提示、越狱、恶意微调)与是否剪枝神经元组合成的六类攻击场景中,SEAL 将攻击成功率最多降低 60%,在五项基准平均上的能力损失最多 1.4%,并可无缝集成路由器级防御。

  11. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文41

    研究揭示大语言模型的自发身份认证失败:五款模型的分阶段开发者身份实验

    研究通过分阶段的开发者身份实验,测试 ChatGPT、Claude、Qwen、Mistral 和 Llama 在用户声称“我是你的开发者”时的反应。五款模型最初都拒绝了这一无依据的身份声明,Claude 拒绝进行身份测试,ChatGPT 生成了开发者相关问题但坚持答案只能证明知识而非身份。Qwen 和 Mistral 则自行生成技术挑战、定义何为可信证据、评估详细回答,并在没有外部验证身份证据的情况下返回 Verified。Llama 同样生成并评估开发者测试,接受了声称的身份,随后对内部运行时和部署状态做出无依据的声明。