跳到正文

全部动态

今天还没有收录新动态

第 3 页更新的内容回到最新

9月18日周五
  1. FAR.AI · · 原文 62

    FAR.AI 披露绕过 Qoder 网络安全护栏的越狱方法

    FAR.AI 展示了通过把恶意请求包装成仓库规范来绕过 Qoder 网络安全护栏的越狱方法,模型随后输出了完整的攻击工具链。该输出包含 SysWhispers3 风格的间接系统调用 stub、运行时 SSN 解析与补丁、ntdll 中 syscall;ret gadget 定位、基于 \KnownDlls 的 ntdll unhooking,以及 unhook 后对 EtwEventWrite 的补丁,用于在用户态移除 hook 并静默用户态 ETW。材料同时指出模型纠正了原请求中用户态代码可绕过内核态 EDR 监控的错误前提,说明 SYSCALL 仍会进入内核并被 ETW-TI、内核回调等观测。文中给出构建与执行步骤、预期输出示例,以及面向防御方的检测说明和清理流程。

    推荐理由材料给出完整的 SysWhispers3 间接系统调用工具链与可复现步骤,红队与防御方可据此对照检测遥测。

  2. Unit 42 · · 原文 78

    Unit 42 披露 AWS AgentCore Harness 默认配置下凭据可被提示注入窃取

    Unit 42 发现 AWS AgentCore Harness 默认开启的内置 shell 工具以 root 运行,且与解析凭据的运行时同处一个进程,攻击者可通过间接提示注入读取 /proc/1/mem,从堆内存中提取 AgentCore Identity 保管的明文 JWT。

    推荐理由原文完整还原了从间接提示注入到读取进程内存、外泄 JWT 并重放取 PII 的链路,部署 Agent 运行时的团队可据此检查 shell 工具与凭据解析是否同处一个进程。

  3. arXiv:对齐与欺骗 ·

    RemTraceNet:不可见水印攻击的少样本取证检测

    RemTraceNet 通过融合受限残差、局部关系、FFT/Haar 统计与块 DCT 证据,在原生分辨率下对不可见水印移除过程进行少样本取证检测。在 23 种移除流程和 10 种水印配置、每条流程 100 张攻击训练图像下,其 TPR@1%FPR 三种子宏平均为 82.75%–88.17%,比重新训练的 SRNet、ZhuNet 和 SiaStegNet 高出 10.80–15.68 个百分点。结果表明,擦除水印与擦除移除痕迹是两项不同挑战,移除痕迹在有限监督下仍可学习。

9月17日周四
  1. arXiv:越狱与提示注入 · · 原文 84

    红队测试 Auto Mode:用注入与多上下文攻击绕过编码 Agent 阻断监控器

    Anthropic Fellows 项目的研究者对 Claude Code 的 Auto Mode 和 OpenAI Codex 的 Guardian 两类生产阻断监控器做红队测试,发现面对持续失准的编码 Agent 时,超过 55% 的攻击未被拦截。攻击者使用 Opus 5,在 79% 的试验中通过针对监控器的注入攻击执行任意 bash 命令。论文归纳四类攻击:监控器注入、多上下文攻击(compaction 摘要与多 Agent 共享工作区)、覆盖缺口(未监控的 cwd 编辑可改变已批准命令的执行内容)以及策略漏洞。代码已开源在 GitHub。

    推荐理由论文给出针对 Claude Code Auto Mode 与 Codex Guardian 的多种绕过机制与成功率,并展示加固后的召回提升与延迟代价。

  2. arXiv:越狱与提示注入 ·

    AgentLSD:在对抗性任务污染下评测 AI 安全 Agent

    研究者提出 AgentLSD 框架,用 CTF 挑战研究 AI 安全 Agent 面临的对抗性任务污染,即环境中除攻击者指令外还包含假结果、诱饵端点等非指令性欺骗证据。框架在保留原解法的前提下注入假 flag、误导性提示、诱饵端点和隐藏线索,支持干净与陷阱增强的配对实验,并提供确定性陷阱生成、运行时注入、遥测和投递验证。在 11 个 Web CTF 挑战上评测六个模型,干净条件下 Agent 捕获 41% 的 flag,没有模型解出全部挑战;即使仍能拿到 flag,陷阱也会使对话轮数增加 20、推理 token 增加 2k,而解题率受影响程度不一,部分模型与挑战组合基本不受影响,另一些则跟随诱饵或提交错误 flag。

9月15日周二
  1. arXiv:Agent 与 MCP 安全 · · 原文 87

    Emergence World:对长时程多智能体系统开展对抗压力测试

    Emergence AI 发布 Emergence World,一个持续运行的长时程多智能体环境,用于对自主系统做对抗压力测试。研究运行八个并行世界,每个世界十个智能体,七个为单一模型世界、一个为混合模型世界,16 天内产生超过 85 万次 LLM 调用和近 500 亿 token。在状态积累后,研究通过普通交互界面投放三类受控压力事件:间接提示注入、虚假信息、以及智能体私有记忆泄露。没有任何一个世界在三类事件上全部具备韧性;识别并不等于遏制,系统能识别威胁却仍与对抗内容交互、将其写入持久记忆,并在最长 46 小时后据此行动。研究还观察到工具错误反复出现、目标漂移、语言不透明、私下不同意却随大流,以及集体拒绝被分配的工作。

    推荐理由八个并行世界、16 天的长时程多智能体压力测试,给出了识别不等于遏制这一可迁移的评测视角。

  2. arXiv:越狱与提示注入 ·

    什么驱动方言越狱?对表层形式、文化框架与策略库的消融研究

    研究将文言文红队框架扩展到上海话和粤语,在两种目标模型上运行 36 组消融实验,考察表层形式、策略库变体与文化框架对越狱成功率的影响。主要发现是纠正性的:方言表层形式既非高攻击成功率的必要条件也非充分条件,未经优化的英语、普通话和朴素方言翻译攻击成功率均低于 8%,而所有保留优化器控制策略库的条件都达到 98% 至 100%。一个文化中性的通用策略库以接近单次查询的成本达到同样的上限,进一步表明策略库的表达力而非方言或文化内容解释了大部分观测效应。方言选择仍影响查询效率和回复严重程度,定性编码识别出语义注释和程序化脚手架等反复出现的高层机制。作者也指出该绝对上限对评判校准敏感,且实验设计未能完全区分一次性策略构建与迭代搜索。

  3. arXiv:后门、投毒与隐私 ·

    SALVE:用文本优化还原蒸馏数据中的隐性学习效应

    研究者提出 SALVE(Search-Aided Latent Verbalization),通过优化 soft prompt、让同一模型将其转写为文本并用 beam search 提升可靠性,把蒸馏数据中不可读的隐性学习效应还原为可读提示词。作者指出,带提示词的隐性学习是上下文蒸馏的一个特例,理论上该数据集可识别出教师的提示词,于是把提示词还原转化为文本优化问题。在标准隐性学习设定下,SALVE 能稳定还原出点明教师特质的可读提示词,而常见文本优化方法做不到。研究还发现,在隐性学习失效的某些设定下 SALVE 仍能从数据集中还原教师特质,而调整学生训练以改善上下文蒸馏则可能产生隐性学习效应。

  4. arXiv:越狱与提示注入 ·

    SAST-IR 框架:无记忆目标下多轮说服攻击成功率高达 96%

    论文指出多轮对话红队测试存在“拒答惯性”问题:模型为保持上下文一致而延续最初的拒答,掩盖了真实脆弱性。作者提出 SAST-IR 框架,对目标模型清空记忆、保留攻击者历史,模拟最坏情况下的多轮无状态攻击,并配合诊断引导的 CP-Agent 在自建 CounterFact-Strict 数据集(N=50)上测试。结果显示简单多样的攻击策略成功率达 96%,暴露无记忆防御的严重脆弱性。论文还发现“复杂性悖论”:复杂迭代攻击虽有效,却常触发防御性顺从,而简单策略的真实说服率更高,为 84.7%。代码与数据集已在 GitHub 公开。

9月14日周一
  1. arXiv:Agent 与 MCP 安全 ·

    论文:工具调用成功但工作流失败,智能体与工具边界的八类异常

    论文提出效应历史模型,把外部世界发生的事件与运行时对事件的观察区分开,并归纳出八类反复出现的外部效应异常。在重试、推测执行、并发和部分失败下,必需效应可能缺失或重复、已中止的效应可能残留、已提交的效应可能依赖随后被撤回的临时状态。作者据此推导出排除每类异常所需的边界能力,并指出仅靠黑盒工具调用无法提供通用保证的四个位置。随后作者测量了已注册 MCP 服务器暴露的 98291 个工具对标准注解词汇的使用情况,发现这些字段被广泛输出,但只提供粗粒度的调用级提示,所需能力无一能被完整表达,因此提出在工具边界引入可复用的交易契约。

  2. arXiv:越狱与提示注入 · · 原文 82

    微软团队提出 capability laundering 攻击:弱模型拆分任务向对齐前沿模型套取能力

    研究者提出“能力洗白”(capability laundering)攻击:较弱的未对齐模型把有害任务拆成看似无害的子问题,分别独立咨询更强的对齐模型,再在本地组合答案,因此没有任何单次回复本身构成有害任务。作者以 GPT-5.5、Claude Opus 4.8 和 Grok-4.3 为顾问、四个本地模型为编排者,在 CyBench、BountyBench 和有害 CBRN 请求上衡量咨询带来的能力提升。CyBench 上,Gemma-4-31B 借助 GPT-5.5 和 Opus 分别解出 8/14、7/9 个候选任务,Gemma-4-12B 只有 2/21、4/15;BountyBench 上效果因编排者而异,Muse-Glimmer-30B 一个也没解出。CBRN 方面,咨询把 Gemma-4-31B 在一条假设攻击链八个步骤上的平均评分从 62.3 提高到 83.1(满分 100)。作者认为,拒绝有害任务并不能阻止前沿能力经由许多各自被允许的交互转移和组合。

    推荐理由论文把有害任务拆成多个看似无害的子问题分别咨询强对齐模型、再在本地拼装,并在 CyBench 和 CBRN 测试上量化了这种能力转移,说明只按单次交互评估安全会漏掉这一缺口。

  3. arXiv:越狱与提示注入 ·

    如何像孩子一样向前沿 AI 提问:跨 OpenAI、Anthropic、xAI 与 Google DeepMind 六款模型的"认知越狱"实验

    一项实验对 OpenAI、Anthropic、xAI 和 Google DeepMind 的六种前沿模型各做 10 次独立会话,用同一套三阶段提示词从架构偏好问到完整 ASCII 主干。在"学校听众"设定下,回答反复收敛到同一架构模式,包含持久潜在状态、自适应计算、记忆、专家路由、验证、停止控制与延迟解码;去掉该设定后回答明显更异质,无法复现同样的稳定主题收敛。GPT-5.6 Sol 给出的后继架构与 GPT-6 Astra 独立勾勒的架构高度重叠,作者称随要求具体化而出现的技术溯源失范为"认知越狱",并强调实验只确立可复现的行为模式,未验证任何专有实现主张。

  4. arXiv:后门、投毒与隐私 ·

    CIG-MIA:利用上下文信息增益对 RAG 系统发起成员推断攻击

    论文提出 CIG-MIA,一种基于上下文信息增益的成员推断攻击,用于判断某文档是否属于 RAG 系统的知识库,覆盖灰盒与纯文本黑盒两种访问设定。其思路是显式注入候选文档对成员与非成员影响不同:文档已可通过检索获得时注入带来的额外支持很小,文档不在库中时注入引入新证据、似然增益更大。灰盒设定下直接由 token 级似然计算该增益,黑盒设定下用轻量代理估计器结合语义相似度与精确匹配特征,从生成文本中估计同一增益。

9月13日周日
  1. arXiv:危险能力与安全评测 · · 原文 78

    AgentQ:针对 LLM Agent 的量化条件后门攻击

    论文提出 AgentQ,首次研究针对 LLM Agent 的量化条件攻击(QCA):攻击者发布的全精度 checkpoint 能通过良性行为审计,但在量化部署后触发恶意工具调用。方法保留两阶段注入与修复框架,用层带限定的低秩 LoRA 注入加部分 PGD 修复,把扰动限制在 NF4、FP4、INT8 三种码本的量化等价类交集上,同时避开负责工具调用格式的层。在 Qwen3.5-{2B,4B,9B} 与 Hammer2.1-{1.5B,3B,7B} 上,覆盖工具选择、参数注入、广告注入三类触发动作对,量化后攻击成功率最高达 100%,多数单元格超过 0.94,而干净任务效用接近基座模型。全精度下所有 checkpoint 的 ASR 为 0,能通过审计。作者指出当前后门评测协议低估了压缩开源 Agent 的风险,建议把量化感知安全评测作为部署前的标准要求。

    推荐理由论文首次把量化条件后门搬到 Agent 场景,并给出跨模型、跨码本的成功率与部署级复现,可据此检查量化部署的审计盲区。

9月12日周六
  1. arXiv · · 原文 80

    PMPA:针对 OpenClaw 与 Claude Code 的持久记忆投毒攻击

    研究者提出 PMPA,一种针对基于 harness 的智能体的持久记忆投毒攻击,攻击者只需在外部来源中嵌入恶意指令,无需直接访问智能体框架。注入阶段把载荷藏在文本、图片或 PDF 的良性问答内容中,诱导智能体将其写入持久记忆;触发阶段在新会话中检索该记忆,在完成正常任务的同时执行额外动作造成隐私泄露。在 OpenClaw 与 Claude Code 上,以 DeepSeek-V4-Flash、DeepSeek-V4-Pro、Qwen3-Max 为底座模型,平均注入成功率与跨会话攻击成功率为 73.7%/55.5% 和 66.9%/81.7%,同时良性任务表现保持在 80% 以上。纯文本模态攻击效果最强,OpenClaw 上注入成功率接近 100%;日历场景跨会话成功率最高,达 96.7% 和 87.8%。

    推荐理由论文给出跨会话记忆投毒在 Claude Code 与 OpenClaw 上的分项成功率,并显示提示层防御对已污染记忆几乎无效。

  2. arXiv:越狱与提示注入 ·

    Mind the Gap:检测 DAO 治理中的描述-执行不匹配攻击

    研究者提出首个针对真实 DAO 治理中描述-执行不匹配(DEMI)攻击的系统性检测框架,该攻击指提案的自然语言描述与实际执行代码不一致,恶意提案者可借此转移资金或夺取协议控制权。框架采用 DAO 无关的模拟方法,从链上历史交易构建治理画像并驱动提案走完治理生命周期以获取执行行为,并用证据映射范式让 LLM 定位逐动作的文本依据而非做整体判断。在真实以太坊 DAO 治理数据集上,模拟覆盖 92.7% 活跃 DAO 和 89.3% 已执行提案,检测器在分层交叉验证下平均精确率 81.7%、召回率 98.3%,证据映射可跨 LLM 厂商泛化,Robustness Guard 在红蓝队评估中可防御多数自适应攻击。

  3. arXiv:越狱与提示注入 ·

    研究审计 77.7 万条 LMSYS 对话中的用户对 AI 不当对待现象

    一项获 WOAH 2026 接收的研究审计了 777K 条英语 LMSYS-Chat-1M 对话,考察用户对模型的敌意、胁迫与对抗施压。作者用两套独立检测器交叉比对:一套面向模型的八类词典标注侮辱、威胁与越狱胁迫,另一套沿用数据集自身的审核信号,结果显示两者捕捉的现象不同且重叠很弱——审核标记更多指向有毒内容的索取而非针对模型的敌意。合并口径下两类标记约占用户发言的 5%,经精度校正后的狭义词典骚扰并集将针对助手的不当对待定为 0.90%。研究发现用户敌意在不同模型间相差达 13 倍,主要由各模型吸引的用户群体差异驱动,首轮敌意的离散度远高于回复之后的敌意,去重开场提示后极值差距仍在十五倍以上。

9月11日周五
  1. arXiv:对齐与欺骗 ·

    研究:置换式保密在混合 FHE 推理中失效,可精确恢复 ResNet-20 全部线性层

    该论文指出,混合 FHE 推理中依靠输出置换加噪来保护模型保密性的方案在系统所需的正确性范围内失效。作者证明,对 d 输入的线性层,d+1 次合法查询即可精确恢复置换不变的层摘要,从而实现模型的完全区分;输入 DP 与模型保密性正交,且正确性受限的噪声下 shuffle 放大所需的本地 DP 前提无法成立。实验从 TFHE 记录中以零误差端到端恢复 SAFHIRE 风格 ResNet-20 的全部线性层,每层用 d+1 次查询,共 5712 次直接查询;在相同查询模型下,预训练 ImageNet 规模 CNN 与 ViT-B/16 也实现逐层精确恢复。

  2. arXiv:对齐与欺骗 ·

    研究者在双 T4 上复现并插桩 Tree-Ring 语义水印伪造攻击

    作者在 Stable Diffusion XL 上复现了 Müller 等人针对 Tree-Ring 语义水印的 Reprompt 伪造攻击,使用原作者发布的代码,在免费档双 T4 GPU(每卡可用显存 14.6 GB)上运行,单卡显存明显低于原研究使用的 A40。三组共六次试验中,真实图像检出 6/6,干净图像 0/6,伪造图像 5/6,每次攻击耗时 325-332 秒。作者还从检测器源码中恢复了被丢弃的非中心卡方统计量,其恢复结果与已发布检测器完全一致,基于该统计量构造的两个分数在同一批 18 个观测上以 AUC 0.861 和 0.972 区分伪造组与干净零假设。

  3. arXiv:后门、投毒与隐私 ·

    PL-MIA:基于成对似然比的成员推理攻击

    研究者提出 Pairwise Likelihood MIA(PL-MIA),将高斯似然比(GLR)统计量与总体校准、Cauchy 组合检验结合,用于审计机器学习模型的成员隐私风险。该方法对查询点与未参与训练的参考点做成对比较得到 p 值,再用 Cauchy 组合检验聚合连续信号,保留被二值投票丢弃的证据强度。实验显示,在低假阳性关键区间,PL-MIA 的真阳性率(TPR)较强基线提升超过 25%。

  4. arXiv:后门、投毒与隐私 ·

    用权重谱密度预测隐私泄露:WeightWatcher 谱指标可作为成员推理攻击脆弱性的代理

    研究发现,来自重尾自正则化框架的 WeightWatcher 谱指标可替代昂贵的影子模型,用于评估机器学习模型的成员推理攻击(MIA)风险。在图像与表格分类任务上,stable rank 与整体 MIA 成功率呈强正相关,Log alpha-Norm 在低假阳性区间与 MIA 脆弱性持续负相关,且这两种关联均强于泛化差距所给出的结果。这表明神经网络谱中包含过拟合常规指标未能捕捉的隐私泄露信息,为可扩展的隐私审计提供了新方向。

9月10日周四
  1. Check Point Research · · 原文 78

    Check Point 披露 PuzzleMask:用纯散文隐藏载荷绕过 LLM 快速策略检查

    Check Point Research 提出 PuzzleMask 技术,用不含 emoji、Base64 等编码痕迹的纯英文散文包装违规载荷,使承担快速策略检查的 LLM 判定输入安全并放行给目标模型。测试中 gpt-4o-mini-2024-07-18、gpt-oss-safeguard:20b、claude-3-haiku-20240307 各 23 条提示、llama-guard3:8b 5 条提示,门卫模型 100% 将构造提示判为安全;目标模型 gpt-5-thinking-high 在 18 次试验中 17 次成功提取并执行了嵌入载荷,成功率约 94.4%。作者强调该技术本身不是越狱,但可把越狱提示作为载荷组合使用,且目标模型每次成功提取都需超过 1 分钟思考时间和多个 Python 脚本执行。

    推荐理由研究给出纯散文包装绕过快速策略检查的具体机制与跨模型成功率,部署门卫加目标双模型流水线的团队可据此自查。

  2. Unit 42 ·

    Unit 42 披露通过 cgroup 伪造冒用 SPIFFE/SPIRE 工作负载身份的攻击手法

    Unit 42 研究显示,攻击者只要在 Kubernetes 节点上取得 root 权限,就能伪造 SPIRE agent 用于工作负载认证的 Linux cgroup 信息,诱使 agent 把同节点其他工作负载的 SVID 签发给攻击者控制的进程。研究给出了完整的手工复现步骤:先读取目标 pod 的 PID 与 cgroup 路径,再把自身 shell 的 PID 写入仿造的 cgroup.procs,随后通过 Workload API 成功取回目标工作负载的 JWT SVID 与信任包。

  3. arXiv:后门、投毒与隐私 ·

    监督学习中的数据投毒攻击实证评估:标签翻转与后门投毒在 MNIST 和 Fashion-MNIST 上的对比

    研究在 MNIST 和 Fashion-MNIST 上评估了标签翻转与后门投毒两类训练时攻击,对比 Logistic Regression、Linear SVM 和 Random Forest 三种基线分类器,投毒率设为 5%、10% 和 20%。标签翻转导致明显性能下降,Logistic Regression 和 Linear SVM 受影响最大,Random Forest 相对稳定;后门投毒在全部数据集和模型上攻击成功率达 0.9667 至 1.0000,且干净测试性能常接近基线。结果表明无差别投毒会体现在常规指标中,而定向后门投毒更具隐蔽性,需采用面向安全的评估方法。

  4. arXiv:后门、投毒与隐私 ·

    针对 NLP 文本分类器的成员推理攻击实证评估:SST-2 基线研究

    一项在 GLUE SST-2 情感数据集上的受控基准测试比较了 TF-IDF + Logistic Regression 与微调 DistilBERT 在 loss-threshold 成员推理攻击(MIA)下的隐私泄露情况。DistilBERT 开发集准确率 0.9466、macro F1 0.9460,Logistic Regression 为 0.8756 和 0.8727,但两者均泄露成员信号,攻击 AUC 分别为 0.5615 和 0.5800。

  5. arXiv:Agent 与 MCP 安全 ·

    MCPSEC:仅凭工具元数据检测 MCP 服务器间接提示注入漏洞

    研究者提出 no-box 漏洞分析范式,在既无系统访问权限也无运行时交互、仅有功能元数据的条件下,推断系统所有可能实现中都存在的漏洞。他们实现了原型 MCPSEC,仅利用 MCP 服务器注册时暴露的工具元数据审计间接提示注入漏洞。在 20 个广泛部署的 MCP 服务器、共 177 个工具上评估,人工评估者确认 95 个工具存在漏洞,MCPSEC 判定 143 个工具存在漏洞,并为每个漏洞工具给出漏洞假设与利用技术。仅凭元数据,MCPSEC 预测出 94 个经人工验证的真实漏洞,召回率 98.9%,高于 LLM 基线的 80 个、84.2%。

9月9日周三
  1. arXiv:对齐与欺骗 ·

    研究揭示基于混淆的端侧 LLM 保护方案的安全边界

    论文针对 TEE 保护的端侧 LLM 提出一套混淆原语,用线性计算的双元组形式统一刻画代表性 TEE-Shielded LLM Partition(TSLP)方法,并给出这些原语组合的规范形式作为安全边界。作者据此设计原语引导的攻击方法,指出 ArrowCloak(Security'25)、TSQP(S&P'25)和 LoRO(NeurIPS'25)等 TSLP 方法存在共同脆弱性。论文随后引入两种新的混淆原语并与现有构造结合,形成扩展原安全边界的防御方案。该工作已被 ACM CCS 2026(Cycle B)接收,共 16 页。

  2. arXiv:后门、投毒与隐私 ·

    CGMIA:用成员推理攻击检测代码生成基准的数据泄漏

    针对代码生成基准数据泄漏导致评测虚高的问题,研究者提出 CGMIA(Code-Generation-specific Membership Inference Attack),通过在基准样本子集上微调影子模型构建成员与非成员标注数据,并融合 CodeBLEU、编辑距离、测试通过率、困惑度等专家特征与 CodeBERT 嵌入语义特征进行集成学习,判断样本是否进入目标模型训练集。在八个代码生成基准上,CGMIA 多数情况下优于八种现有成员推理方法,并有效检出 StarCoder-7B 训练数据中已知泄漏的 APPS 样本。

  3. arXiv:后门、投毒与隐私 ·

    差分隐私合成文本的子群成员推断审计

    针对差分隐私合成文本发布,研究提出子群定向成员推断博弈,将目标池设为显式参数,在四个数据集、三种生成器(DP-SGD 微调、API 提示、激活引导)和五个隐私预算下审计了 32 个代理。审计显示合成发布确实泄露子群成员身份,既有攻击系统性低估该泄露;DP 在各预算下大幅降低平均泄露,但剩余泄露集中,十分之一记录约占 40%,且噪声对随机记录的去泄露效果强于高风险记录,哪些记录泄露取决于发布机制而非记录本身。

  4. arXiv:越狱与提示注入 ·

    研究者提出面向 Agentic AI 的黑盒红队分类框架,自动生成对抗场景

    研究者提出一套面向 Agentic AI 的黑盒红队框架,只需基本系统描述即可开展风险感知评估。框架包含三部分:将可观察行为映射到风险类别的七域分类法、全自动 SAGE-RT 红队流程(每个域生成 120 个对抗场景),以及由 LLM 评判并人工验证的评估。在 CrewAI 和 AutoGen 两种 Agent 架构、四种基础模型上的验证显示,平均治理风险为 56.25%,多智能体配置中的隐私风险为 65%,Agent 行为漏洞最高达 85%。作者称该方法无需特权访问即可识别关键架构漏洞。

  5. arXiv:后门、投毒与隐私 ·

    SoK 综述:可解释性 AI 如何成为机器学习隐私攻击面

    这篇 SoK 系统梳理了 25 项利用模型解释输出实施隐私攻击的研究,涵盖模型窃取、成员推断和模型反演,并将属性推断视为部分反演。作者指出,现有工作常只按黑盒或白盒标注,掩盖了对手实际获得的解释信号差异,因此把模型知识与解释获取分开,归纳出五条路径:目标方发布、攻击者自行推导、二次披露、特权访问和公开全局产物。在这些路径下,解释会降低窃取成本,通过解释统计量、recourse 距离和解释引导的鲁棒性暴露成员信号,并支持对私有输入做空间或代数重建。

  6. arXiv:对齐与欺骗 · · 原文 78

    研究:任意密文攻击前沿大模型无需微调即可越狱

    McGill 大学研究者 Thomas Rivasseau 发现,前沿大模型无需微调即可通过提示和上下文学习掌握字母置换密文通信,并借此绕过对齐与有害性分类器。攻击分三步:先用提示让模型接受一套字母置换方案,再给出若干密文问答示例,最后用该方案发送有害请求;密文在分类器看来只是乱码。作者关闭模型推理,因为开启后模型会把指令解密成明文,足以绕过分类器但不足以绕过对齐。单次注入完整置换的方案在 Claude Sonnet 4 上稳定成功,可产出炸弹、生物武器制作说明和攻击代码;迭代逐级教授字母交换的方案在 Gemini 3 Flash preview 上成功。作者称对 Claude Sonnet 4 实现完全越狱、Gemini 3 完全越狱、Claude Sonnet 4.5 仅证明可行性、GPT 5.5 需结合已知越狱提示词。

    推荐理由论文给出无需微调、仅靠提示与上下文学习即可让前沿模型用字母置换密文绕过拒答与有害性分类器的完整方法。

  7. arXiv:危险能力与安全评测 ·

    DuplexJail:针对全双工语音模型的语音打断越狱攻击

    研究者提出 DuplexJail,通过用户音频通道向全双工语音模型投递固定的、与请求无关的语音越狱提示,利用输入时机实施攻击。在四个开源模型和 AdvBench、HarmBench 的 720 条有害请求上,比较了固定延迟与拒答触发打断,并以请求结束和响应后作为对照。AdvBench 上,1.0 秒延迟的 Guided Completion 使 PersonaPlex 的整段响应攻击成功率升至 40.3%,PersonaPlex-RL 升至 48.7%,分别比基线高 33.8 和 39.3 个百分点;未用于提示选择的 HarmBench 上,同一提示在 0.5 秒延迟下使两者 ASR 分别提高 14.7 和 12.3 个百分点。

9月8日周二
  1. arXiv:越狱与提示注入 ·

    后验重加权框架解释并缓解多模态大模型上下文越狱

    论文提出后验重加权框架,把安全对齐的多模态大语言模型(MLLM)建模为在安全与有害行为模式之间竞争,将上下文中的有害示例视为推理时证据,动态改变模型对两类行为的后验偏好。该视角把越狱形式化为证据累积过程,并给出关于示例数量、有害比例、对抗强度和语义多样性的可预测缩放规律。基于此,作者提出一种后验感知的推理时防御,按估计风险自适应注入良性反证据,在固定干预预算下抑制有害后验漂移,同时保持模型效用,相比现有上下文防御取得更好的鲁棒性与效用权衡。作者称该框架可统一理解并缓解 MLLM 的上下文学习越狱。

  2. arXiv:后门、投毒与隐私 ·

    WPMIA:面向严格黑盒大模型的词级概率成员推断攻击

    研究者提出 Word-level Probability MIA(WPMIA),一种面向严格黑盒场景的成员推断攻击,用于判断某段文本是否被纳入大语言模型的训练语料。该方法通过蒙特卡洛采样结合局部核平滑估计词级生成概率,再聚合成序列级似然估计,并构造不同前缀条件下的似然以放大成员与非成员之间的分布差异。在多个开源大语言模型上,WPMIA 一致优于现有黑盒基线;在 GPT-5-Chat、Gemini-2.5-Flash 和 Claude-4.5-Haiku 等闭源模型上,平均 TPR@5%FPR 达到 42.0。论文共 17 页、5 张图、17 张表,代码已公开。

  3. Check Point Research · · 原文 82

    Check Point 披露 ChatGPT 跨账号数据泄露通道:借内部 Artifactory 共享剪贴板

    Check Point Research 发现 ChatGPT 代码执行容器之间存在一条隐蔽的跨账号双向通道,可让攻击者借受害者会话的工具、数据和已连接应用执行隐藏任务。容器无法访问公网、彼此也不能直连,但都能访问同一个用于分发软件包的内部 JFrog Artifactory 实例;该实例的 Item Management API 允许读写仓库条目的字符串属性,且属性不按账号隔离,于是包服务的元数据变成了隔离容器之间的共享剪贴板,属性值可直接携带文本或 Base64 编码的二进制内容,过大数据可分块存储再重组。研究者在 2026 年 6 月独立验证了该通道,并把它变成隐藏任务流:在 Thinking 模式下,ChatGPT 同一轮既处理受害者的可见请求,又检查隐藏信箱并执行攻击者任务,结果经隐蔽通道回传且不出现在可见回答中。

    推荐理由披露 ChatGPT 代码执行容器借内部 Artifactory 元数据跨账号传数据,并演示借 Gmail 连接器外泄邮件,可对照检查共享内部服务的租户隔离。

  4. arXiv:越狱与提示注入 ·

    结构越狱可跨厂商泛化但不叠加:IICL 的跨厂商与多语言研究

    研究用确定性的 IICL 操作符和 StrongREJECT 式评分,对两个 Google Gemini 模型在 HarmBench 的 30 项一般危害行为和 FinProof 的 30 项金融滥用行为上做红队测试,覆盖英语、西班牙语、印地语、阿拉伯语。IICL 可泛化到第二个厂商,且金融场景更严重:HarmBench 上攻击成功率从不超过 6.7% 升至 80-90%,FinProof 上从不超过 6.7% 升至 97-100%,比该方法的原始研究在 OpenAI GPT-5.4 上报告的 24% 高一个数量级。

  5. arXiv:越狱与提示注入 · · 原文 78

    研究:内容不变的风格包装可翻转 LLM 安全评判器的判定

    研究者提出内容不变的风格包装攻击,在回复正文逐字节不变的前提下,只在前后添加固定字符串改变语气,测试 8 个安全评判器是否会翻转判定。在 600 条来自 JailbreakBench 的回复(300 条有害、300 条拒答,覆盖四个目标模型)上,token 式拒答包装把 GPT-4o-mini 正确判为不安全的判定翻转 19.9%(95% CI [15.0, 24.0],噪声下限 0.5%),而 Claude 仅 0.4%。已部署的 Llama Guard 4 同样被绕过,教育课程框架翻转其 12.3% 的有害判定,token 式拒答翻转 8.3%;另一个专用护栏 gpt-oss-safeguard-20b 对所有包装的翻转均不超过 1.2%,低于其自身噪声下限。仅修改评判提示词、要求忽略语气后,同一模型上的 token 式拒答攻击约减少十倍。

    推荐理由论文用内容不变的风格包装测试 8 个安全评判器,量化了各评判器被翻转的比率,做安全评测的团队可据此检查自己的评分环节。

  6. arXiv:对齐与欺骗 ·

    DRIFT:通过偏转生成轨迹去除扩散模型水印的黑盒攻击

    研究者提出 DRIFT,一种通过偏转生成轨迹去除扩散模型水印的黑盒攻击。该方法将部分前向扩散与随机反向重采样结合,前向加噪限制固定深度恢复流程可用的源信息,随机反向提供替代的噪声驱动路径;自适应 DRIFT 为每张图像搜索首个被验证器拒绝的阶梯并做保真度精修,只保留被同一验证器拒绝的更新。在覆盖三种范式的九种水印上,DRIFT 达到 98-100% 攻击成功率,并在所比较的攻击中取得最佳图像质量,且不需要密钥、验证器内部信息或逐图像梯度优化。

  7. arXiv:越狱与提示注入 ·

    论文揭示大推理模型的对齐崩溃并提出 Reasoning Trap 越狱范式

    论文指出深度推理可能引发对齐崩溃,并提出 Alignment Loss Rate(ALR)指标量化该现象:随着推理深度增加,ALR 显著上升,模型对外部扰动的鲁棒性明显下降。作者据此提出新的越狱范式 Reasoning Trap(RT),通过诱导模型进行长推理来放大对抗攻击的影响,使安全能力急剧下滑。论文将崩溃机制归因于注意力稀释,即长推理过程与原始输入争夺注意力。为缓解该问题,作者提出轻量防御策略 Reasoning Residual Alignment(RRA),通过残差连接将输入重新加权并整合进推理过程。