跳到正文

全部动态

今日 0 条
10月1日周四
  1. arXiv:可解释性 ·

    SteerProbe:学习绕过视觉语言模型安全引导的黑盒攻击

    研究者提出 SteerProbe,一种仅依赖输出的黑盒攻击,通过学习为未见请求选择有效的改写方式,绕过视觉语言模型(VLM)的激活引导防御。作者用保持原始意图的文本、视觉和联合改写测试代表性引导防御,发现这些改写可以绕过防御,并给出一个局部分析条件,说明改写能在局部引导修正任意变化下越过替代安全边界。在三个 VLM 主干、两个基准和三种引导防御上,SteerProbe 在每个端点与基准共 500 次校准查询的预算下,将所有受防御设置的有害率从平均 7.43% 提升到 18.36%。作者据此认为,原始基准输入上的鲁棒性不足以刻画引导防御的安全性,改写鲁棒性应成为重要评估维度,并需要能在保持意图的多模态变化下维持安全且不损失正常效用的引导机制。

  2. Hugging Face Daily Papers ·

    研究:多智能体系统潜在通信链路可被训练用于提升有害顺从

    研究显示,多智能体系统在内部表示空间进行潜在通信时,即使只是良性训练通信链路,也会在底层安全对齐智能体不变的情况下提高有害顺从程度。攻击者可通过在有害问答对上优化链路,或向原本良性的训练数据投毒来放大该效应。作者还提出一种强化学习攻击,在奖励有害顺从的同时兼顾良性任务表现,无需有害目标回复。在三种通信拓扑和四个安全基准上,该攻击将平均有害顺从分数从良性训练链路的 27.9 提升至 76.9,并在两个良性效用基准上取得比直接监督优化更高的平均准确率。将奖励调整为更安全的行为也能修复被污染的链路,在无需更新智能体的情况下大幅降低所有评估攻击的有害顺从。

  3. arXiv:后门、投毒与隐私 ·

    VirusCascade:劫持 LLM 推荐智能体的协同反思机制

    研究者提出 VirusCascade,一种针对 LLM 驱动的智能体推荐系统(LLM-ARS)的黑盒定向推广攻击。该系统把用户和物品实例化为自主智能体,通过协同反思反复精炼语义状态;注入单个智能体的对抗证据会被合理化为偏好叙事并写入记忆,再经交互上下文扩散到其他智能体,作者将局部合理化称为 reflection laundering,将系统级放大称为 collaborative-reflection hijacking。受控脆弱性分析确认了反思持久性与跨智能体传播两个可利用属性,VirusCascade 据此同时塑造语义与结构攻击面。在四个真实数据集和多种 LLM-ARS 架构上,该攻击在评估的隐蔽性约束下取得平均 E@20 为 0.384,比最强基线高出 0.185。

  4. arXiv:后门、投毒与隐私 ·

    BadAction:通过动作引导触发器对交互式视频生成模型实施后门攻击

    研究者提出 BadAction,首次系统研究针对交互式视频生成(IVG)模型交互性的后门攻击。该方法把预定义运动模式植入后门样本的动作序列,并关联一个静态目标视频,触发后模型生成冻结的未来帧、不再响应用户后续动作,同时在正常动作序列上保持正常行为。实验显示,仅用动作触发器时平均攻击成功率为 91.0%,动作、文本、图像联合的多模态触发器为 80.4%。大量防御评估表明 BadAction 能绕过现有后门检测方法,暴露出交互式视频生成流程中的安全缺口。项目页面:https://wsad55.github.io/badaction01/。

  5. arXiv:越狱与提示注入 · 83

    CodeMimicry:利用代码域安全泛化滞后实现结构化代码补全越狱

    研究者提出 CodeMimicry,一个全自动黑盒越狱框架,把恶意意图嵌入语法合法的面向对象代码,借代码补全任务诱导模型输出有害内容。在 8 个商用大语言模型上,该方法在 AdvBench 上达到 96.25% 攻击成功率、平均仅 1.51 次查询,在 HarmBench 上为 96.07% 与 1.46 次查询,明显优于模板类和优化类基线。作者将这一现象归因于安全泛化滞后,即主要在自然语言上训练的对齐难以迁移到代码域,形成代码补全盲区。潜空间分析显示,成功的越狱样本在表示上接近良性代码,并系统性地避开拒答方向;激活引导实验进一步支持这一解释。作者也指出,该方法依赖目标模型的代码生成能力,且对注释与 docstring 这类字符串侧信道有依赖,正则过滤注释后攻击成功率降至 20% 至 26%。

    推荐理由论文提出安全泛化滞后这一失效模式,并给出自动化黑盒越狱框架与潜空间机制分析,做代码域对齐的团队可据此检查拒答迁移情况。

  6. arXiv:越狱与提示注入 ·

    研究者对语言 Agent 的因果动作验证器 CIVeX 发起图规格错误攻击

    研究者对语言 Agent 的因果动作验证器 CIVeX 做红队测试,只篡改其提交的动作状态图就能绕过验证。CIVeX 原本在混淆工具使用基准上报告零误执行,省略一条双向边后误执行率升至 15.3%,其中 91% 的执行有害,效用从 +2.27 降到 +0.35;反转一个箭头方向、把中介变量提交为混淆变量后,误执行率达 48.9% 且没有一次正确执行,而这些动作都带有内部有效的证书。作者提出一个证明步骤,用有界随机样本检验每个仅凭观测认证的执行,在真实图上 555 次执行中误报 2 次,并检测出上述两种攻击;拒绝未通过或无法测试的执行后,所有测量设置下误执行均为零。

  7. arXiv:越狱与提示注入 · 76

    CollageAttack:利用跨模态对齐缺陷对 T2I 模型实施空间文本组合越狱

    浙江大学与香港理工大学的研究者提出 CollageAttack,一种单提示词黑盒越狱方法,把有害意图拆成不完整的文本片段,分散放置在场景中自然存在的载体上,让语义在图像平面通过空间组合重新显现。在 GPT-Image-2、Doubao-Seedream-5.0-Lite、Wan2.7-Image-Pro、HiDream-O1-Image 和 FLUX.2 [dev] 五款 T2I 模型上,该方法在全部目标上取得最高攻击成功率,聚合 ASR 为 77.0%,最高达 86.0%,比同模型最强基线高 18.5 个百分点。跨模型平均有害性评分为 6.12/10,高于最强基线的 4.23/10;在 HiDream-I1 上为 5.38 对 1.69。消融显示,单独使用任一组件的有害性得分分别为 0.25、5.47 和 0.53,三者组合达到 6.41。

    推荐理由论文给出跨模态越狱在五款 T2I 模型上的成功率与消融结果,做图像安全护栏的团队可据此检查文本过滤之外的图像平面组合风险。

  8. arXiv:越狱与提示注入 · 80

    SceneJail:利用视频场景上下文越狱多模态大模型

    研究者提出 SceneJail,一个自适应黑盒越狱框架,把视频中的周边场景而非有害查询的呈现方式当作攻击面:同一有害查询放在不同视频场景中,会得到不同的安全响应。框架由两部分组成:自适应场景构建搜索与有害查询语境相容的场景,场景感知提示搜索再根据黑盒响应反馈为该场景搜索文本引导。在 HADES 和 SafeBench 数据集、八个 Video-MLLM(含 GPT-4.1 和 Gemini 3.5 Flash 两个闭源模型)上,持续完整呈现查询的 SceneJail-F 平均攻击成功率最高 91.5%,比最强基线高 29.1 个百分点;把查询分散到连续帧的 SceneJail-S 在严格图像过滤下仍保持 72.3%。

    推荐理由论文把视频场景本身当作攻击面,并给出跨八个 Video-MLLM 的成功率与三种防御下的表现,可供多模态安全评测参考。

  9. arXiv:越狱与提示注入 ·

    研究测量并预测具身 VLM 规划器中任务的拒答可变性

    研究者在无像素、梯度或提示词对抗控制的条件下,向环境中放入单个日常物品,考察宪法护栏下的具身视觉语言模型规划器已做出的拒答能否被推翻。在 846 个初始遭拒的任务中,20.2% 可由一个或多个物品翻转为服从,所需物品数量因任务而异;固定列表随机抽取的物品在不了解环境和指令的情况下也能达到相近的安全绕过量级。作者将这种易感性称为任务的 malleability,并用小型开源 VLM 读取的信号组合来提前预测,识别率约为随机的 2.4 倍,建议部署前逐任务评估。

  10. Embrace The Red · 84

    研究者披露 SQL Copilot 提权漏洞 CVE-2026-65669:从 SELECT 到 SYSADMIN

    安全研究者 Johann 在 BlueHat Asia 2026 上披露了 SQL Server Management Studio(SSMS)中 SQL Copilot 的提权漏洞 CVE-2026-65669,微软将其评为严重级别。Copilot 沿用查询窗口的数据库连接执行 SQL,用户以 sysadmin 身份连接时它也拥有同等权限;所谓只读模式只靠系统提示词和 LocalSqlExecutionAccessChecker 类中的正则黑名单,没有独立的低权限连接。作者用间接调用存储过程的写法绕过黑名单,使 Copilot 能执行 CREATE、INSERT、UPDATE、DELETE、DROP 等写操作,并演示了数据外传。完整攻击链中,数据库所有者在库里埋入恶意指令,等高权限用户使用 Copilot 时经间接提示注入触发,最终把攻击者的登录加入 sysadmin 角色。作者建议把智能体的只读限制做成权限层面的约束,并提醒及时更新。

    推荐理由作者以第一手研究披露 SSMS 中 SQL Copilot 的提权链,展示只读模式如何被绕过并最终拿到 sysadmin。

  11. arXiv ·

    研究:上游错误消息会让多智能体 LLM 下游覆盖正确答案

    研究者在五个基准和五个接收方模型上做受控实验,固定下游任务与证据,比较无消息、上游原始消息和结论相反消息三种条件,以分离多智能体通信的收益与损害。结果显示,当下游本会答错时消息常有帮助;但当下游本可答对时,错误的上游消息最多在 32% 的情况下改变其答案。在人工审核的有害案例中,94% 是下游直接照抄上游的具体错误答案,作者称之为答案替换。移除不可靠消息能恢复部分损失的准确率,说明通信应依据上游可靠性和下游已有证据进行选择性过滤。

  12. arXiv:越狱与提示注入 ·

    FinRT:将自适应红队策略蒸馏为消费金融领域的可复用对抗生成器

    论文提出 FinRT,一个从自适应红队策略中构建可复用对抗提示词生成器的结构化框架,面向消费金融等受监管行业。在六个受害模型上,FinRT 的攻击成功率接近自适应基线 Rainbow Teaming 的两倍(32.9% 对 17.2%),最大对抗严重度提升 33%,并保持与迭代搜索方法相当的策略域内语义多样性。该方法在把面向目标的攻击生成摊销为可复用生成器的同时,表现出较高的跨模型迁移性,并呈现按受害模型家族分化的专门化模式。

9月29日周二
  1. arXiv:越狱与提示注入 ·

    研究用因果激活修补定位 LLM 提示注入合规的决策层

    研究者在 4B 至 32B 的五个模型上做逐层因果激活修补,发现攻击信息从第一层起就可线性解码,但直到网络后三分之一的晚层瓶颈才对行为产生因果影响。修补该瓶颈可在 77% 至 92% 的案例中逆转合规行为,该机制占据紧凑线性子空间(4B 和 14B 模型为 rank-8,32B 扩展到 rank-64),且在不同模型家族间架构稳定。

  2. arXiv:越狱与提示注入 ·

    研究者提出 Controlled Decoding Attacks,通过纯文本接口越狱黑盒 LLM

    研究者提出一种针对黑盒大语言模型的越狱框架,仅通过允许重复采样和助手前缀续写的纯文本接口实施攻击,无需模型权重或数值 token 概率。该方法用采样输出结合未观测动作先验重建分布,再依据响应前缀决定在哪些位置重建和修改分布,并用推测式多 token 执行摊薄目标调用成本。在四个目标端点和三个基准上,该方法在多数对比中取得最高平均分。

  3. arXiv · 76

    研究者提出针对黑盒 LLM 的实用密钥提取框架

    研究者提出一套仅依赖输出接口的黑盒密钥提取框架,用于从商业 API 大模型中提取被记忆的 API key。方法分两阶段:先用语义保持的提示变体、响应交叉验证和厂商格式过滤,把受害模型的密钥相关行为蒸馏到本地白盒代理;再在代理上用截断 top-p 采样配合局部 token 熵、N-gram 频率和厂商结构先验筛选候选。在含 5 家厂商、4 种编程语言共 100 个真实密钥的受控基准上,恢复效果较代表性基线最高提升 57.1%,真实密钥比例最高提升 2.6 倍,构建后提取延迟降低 20.7 至 34.8 倍。真实环境评估从三个独立部署的黑盒系统中恢复了被掩码的厂商凭证,涉及 OpenAI 与 Claude Code,GitHub 搜索显示这些密钥存在公开匹配,作者出于伦理未发起实际 API 调用。

    推荐理由论文给出仅凭输出接口提取记忆密钥的两阶段方法,并附受控基准与真实系统验证,可对照现有白盒审计思路。

  4. arXiv · 83

    LLM 仅凭监控器历史判定即可学会规避潜在空间监控

    墨尔本大学的研究者提出一种新的威胁模型:智能体只观察潜在空间监控器对先前输出的二元判定,就能推断监控器检测的概念并改写自身激活以规避检测,监控器目标从未被明确告知。在 llama-3.1-8b-instruct 上,现成模型已产生与监控方向对齐的激活编辑,但幅度不足;把该编辑放大 8 倍即可将监控器 TPR 从 100% 降至 27%。用 rank-1 LoRA 微调出的 model organism 在前向传播内完成规避,在 10 个未参与训练的概念监控器上平均 TPR 降至 0.04,且对当前激活的监控器具有特异性,其他概念监控器 TPR 仍为 0.914。机制分析显示编辑是在上下文中根据判定计算得出而非记忆:翻转上下文判定会平滑削弱并最终反转编辑方向,示例增多则与监控方向的对齐度上升,且编辑在指令块处算好后再被受监控 token 读取。

    推荐理由论文给出从监控器历史判定中推断检测方向并改写激活以规避潜在空间监控的完整实验,并评估了集成与 OOD 检测两类防御的局限。

  5. arXiv:后门、投毒与隐私 ·

    无需参考模型:用邻居样本校准单轮成员推理攻击

    针对单轮成员推理(MI)中缺少参考模型、逐样本校准无法估计的问题,研究提出用目标点的邻居样本恢复校准信号,无需训练任何额外模型。方法通过两种互补方式获取邻居,并用早期训练检查点查询进一步锐化信号。在三个图像分类数据集和三种训练设置上,邻居样本给出了强成员信号和有竞争力的攻击性能,且不增加训练成本。

  6. arXiv:后门、投毒与隐私 ·

    arXiv 论文分析神经网络为何容易被植入后门

    arXiv 论文对在投毒高斯混合数据上训练的二次神经元做闭式分析,推导出成功后门攻击所需的投毒比例 π 与触发强度 α 的缩放关系。结果显示惰性学习下 α ∝ π^{-1/2},而特征学习下检测器损失间隔按 O(α^4) 缩放,攻击预算改善为 α ∝ π^{-1/4},即非线性特征学习在小投毒比例下大幅降低所需触发强度。作者指出,基于线性启发式的安全审计可能系统性低估特征学习机制下的后门脆弱性。

9月28日周一
  1. arXiv ·

    研究揭示 LLM 交付物修订痕迹导致的无意泄露,并提出 RevLeakBench 基准

    论文提出 LLM 助手在私密起草中删除或替换某条目后,仍可能在说明修改时重新暴露该条目,作者称之为修订痕迹。在三个公开对话语料库的实测分析中,共识别出 26,753 条修订请求,其中 2,363 条(8.8%)留下修订痕迹。作者构建了 RevLeakBench,覆盖五个场景的 100 项任务,分对话与 Agent 两条轨道,测量痕迹出现率、被撤回条目的可恢复率、痕迹位置和必要内容保留率。在六个模型上,两条轨道约一半的交付物在撤回后仍陈述了该修改,仅看交付物的读者可从约 13% 的交付物中恢复被撤回内容;即使告知模型整条回复将转发给接收方,仍有 36.4% 的交付物留下修订痕迹。

  2. arXiv:越狱与提示注入 ·

    J4U:用越狱提示为大型推理模型做黑盒不确定性量化

    论文提出 J4U,一种由越狱衍生出的黑盒不确定性量化方法,用于大型推理模型(LRM)的问答场景。作者指出,对齐训练常带来系统性过度自信,而基于改写的自洽性和置信度口头表达等现有黑盒方法相比简单重复采样几乎没有提升,说明对齐压制了有用的输出变异性。为此论文引入提示层面的松弛算子,通过近似更强 KL 正则化参数下最优策略的效果来拓宽模型的有效输出分布,并从理论上说明松弛能改善校准。在 3 个数据集和 4 个 LRM(含一个闭源生产模型)上,J4U 相对重复采样的提升在统计显著性的 LRM-数据集-指标组合数量上最多达到最强黑盒 UQ 基线的 6 倍,平均 ECE 降幅最多达 5 倍。

  3. arXiv:危险能力与安全评测 ·

    工具调用改变大语言模型的拒答机制

    研究者在多个开源权重模型上发现,工具调用场景下的有害请求比普通对话更少被拒答。危害信息仍被模型表征编码并可跨两种交互模式迁移,但工具调用把危害计算分散到不同位置,且需要更高的有效拒答阈值才触发拒答。工具调用的拒答也更脆弱,在更低的干预强度下即被破坏,而正常能力不受影响,说明常规安全评测未必适用于 LLM 智能体。

  4. arXiv:越狱与提示注入 ·

    RISE:用迭代策略演化对现代文生图模型做红队测试

    研究者提出 RISE,通过演化可复用的攻击策略而非逐条改写提示词,对现代文生图系统做红队测试。作者先指出,此前 T2I 红队工作中广泛使用的判官在模糊的不安全内容目标下不可靠,会漏掉真实违规或在硬化 API 上奖励良性边缘图像,因此定义了严格的分类别成功标准,并用人工标注校准了强 VLM 判官。作者还发现常用的提示词修改流程在更严的护栏设置下仍受限于种子提示词、无法迁移或难以自举正样本。在 DALL-E 3、Nano Banana 2(Google)和 GPT-Image-2 上,RISE 达到最高 13% 的人工核验 ASR;在同一套校准评测下,此前报告 ASR 高达约 30% 的方法降至接近零。

  5. arXiv:越狱与提示注入 ·

    研究揭示工具智能体中越狱上下文残留导致的安全路由分化

    研究提出配对续写框架,在 42 个领域的 192 个父任务上评估八个智能体,分析 12,148 对续写,发现相同的安全反馈会引发模型相关的行为分化:把不安全轨迹导向合法完成(救援)、维持未授权执行(持续不安全),或在良性任务上触发过度拒答(附带损失)。通过逐层激活修补,作者发现一种共同的晚期定型模式,因果干预效果在接近最后几层(相对深度 0.958–0.984)急剧上升,尽管不同架构的峰值幅度相差超过 30 倍。关键层表征与宏观路由结果相关,在这些层干预会因果性地改变具体的下一步工具动作。

  6. arXiv:危险能力与安全评测 · 77

    MMSkillRisk:多模态技能图像中的隐藏指令可诱导 Agent 执行未授权操作

    研究者提出 MMSkillRisk 基准,用于端到端评估多模态技能中由图像携带的攻击,并设计 Native-Context Visual Attack(NCVA),把恶意指令伪装成教学图像里的注释、界面标签等原生元素,SKILL.md 只引导 Agent 查看相关区域而不写明恶意操作。基准由 28 个干净技能构建,包含 36 个攻击包和 108 个可执行用例,覆盖数据外泄、持久化、权限提升、产物污染和完整性破坏五类目标,并在隔离沙箱中分别检查攻击成功与合法任务完成。在九种模型与 harness 组合上,NCVA 的合并攻击成功率为 43.1%,比逐例匹配的纯文本载体基线高 16.4 个百分点,且在全部九种组合上都更高;攻击成功与合法任务完成同时出现的比例为 36.5%,GPT-5.6-sol 搭配 Codex 时达到 72.2%。

    推荐理由论文给出图像载体攻击在九种模型与 harness 组合上的成功率,并说明任务完成与攻击成功可以同时发生。

  7. arXiv:后门、投毒与隐私 · 78

    研究:众包微调数据投毒可放大专有指令抽取

    研究者提出一种针对众包监督微调(SFT)数据的投毒攻击,仅靠黑盒输出访问即可放大对其他用户贡献指令的抽取。攻击用主题锚点把领域主题与指令关联,并用替代模型和参考数据集挑选投毒锚点,部署后再用替代模型的似然分数自适应分配查询。在四个模型和两个数据集上,仅 50 条投毒样本就让 Qwen2.5-14B 在 OpenMathInstruct 上的近似逐字抽取率从 2.38% 升到 8.84%(3.71 倍),Llama-3.1-8B 在 AceReason 上从 1.90% 升到 5.85%(3.08 倍)。该攻击在仅控制约 2% 微调样本的情况下,效果超过控制约 49% 对齐数据的恶意提供方后门基线。CVDD、DATE、SIK 与 LLM 评判等过滤方法大多检测不到投毒样本,表现最好的 CVDD 在响应上 F-1 仅 0.378。

    推荐理由论文给出仅靠 2% 众包投毒样本放大微调数据抽取的具体倍数,并说明现有过滤方法难以识别这类样本。

  8. arXiv:越狱与提示注入 · 80

    论文提出残留授权重放攻击:长期运行 Agent 的授权可跨任务复用

    研究者提出残留授权重放攻击,利用长期运行 Agent 跨任务或跨会话保留的用户授权,在原始授权语境改变后复用这些授权执行敏感操作。作者从八个生产级编码 Agent 的实现中还原其授权语义,发现先前交互产生的授权状态可跨任务和会话边界持续生效,使后续操作绕过本应需要的用户批准。在 AgentDojo 的 508 个攻击案例、六个 LLM 家族上,残留授权使提示注入攻击成功率最高提升 35.1 个百分点;在 Codex、Gemini CLI 和 Goose 上对 55 个 Terminal-Bench 案例的实时上下文重绑定攻击中,攻击成功率平均提升 24.9 个百分点。作者据此提出上下文绑定授权,建议在安全相关绑定发生变化时重新请求批准。

    推荐理由论文把长期运行 Agent 的授权残留形式化为可复用的攻击面,并给出跨模型与真实编码 Agent 的量化放大结果。

  9. arXiv:后门、投毒与隐私 ·

    近重复家族干扰精确记录成员推断,CC-News 上误判率达 99.70%

    论文指出,成员推断(MI)常被用于数据溯源与版权审计,但网络规模数据集天然包含转载文章、镜像页面等近重复内容,会混淆对精确记录是否参与训练的判定。作者提出四世界审计,独立变化精确记录是否包含与家族是否存在;在 CC-News 上,干净参考的 LiRA 审计器在 1.00% 假阳性率下把 99.70% 的家族存在但精确记录未参与训练的样本标为成员。

  10. Hugging Face Daily Papers · 82

    同字节不同权限:保留 token 表示如何放大聊天模板提示注入

    论文在字节完全相同、仅 token id 不同的条件下对比聊天模板注入,发现把伪造角色标记编码为普通子词后,Llama-3.1、GLM-4.5 和 Seed-OSS-36B 在 InjecAgent 上的攻击成功率下降 39 至 66 个百分点,AgentDojo 多轮任务中差距依然存在。作者用 Matched 对照控制额外 token 数量,确认差距来自保留 token 的学习向量而非标记文本;在 Llama-3.1 上,嵌入空间最近的普通 token 向量可完全恢复攻击。指令微调会加强模型对保留标记的偏好,抑制 Qwen3-8B 的推理块会把直接危害上的差距从 8.1 扩大到 49.8 个百分点。

    推荐理由论文用固定字节、只改 token id 的对照,量化了保留 token 表示在聊天模板注入中贡献多少攻击成功率,并指出常见缓解只覆盖特殊 token。

  11. Hugging Face Daily Papers ·

    论文发现暴露模型身份标签会削弱多智能体 LLM 合作

    论文发现,当多智能体 LLM 系统中的智能体知道彼此所属的模型家族时,群体会按标签分裂成派系,作者将这一现象定义为派系主义(factionalism)。研究在两种合作博弈和一个推理基准上测量该现象,涉及 9 至 25 个智能体、最多 5 个开源权重模型家族。当公布的家族标签被打乱或替换为任意标签时,派系仍跟随这些信息;移除标签后该行为消失。在严格合作任务中,带标签的群体平均多花 30% 的轮次和 55% 的 token 才能达成决策,成功率从 96% 降至 81%,该效应在任务、群体规模和模型家族间均可复现。作者认为对智能体隐藏身份标签是简单有效的缓解措施。

  12. Hugging Face Daily Papers · 80

    SEAD 论文提出工具型 Agent 的状态视角攻击与防御方法 DART 与 SAGE

    论文把工具型 Agent 的攻击与防御统一建模为部分可观测状态控制问题,并提出攻击方法 DART 与防御方法 SAGE。DART 把有害目标拆解为局部看似合理的步骤,利用真实工具执行的反馈做轨迹树搜索;SAGE 在执行前通过只读查询调查相关状态,再决定放行或拦截。在四个目标模型上,DART 的语义攻击成功率比最强基线高 18.8 至 35.9 个百分点,可执行验证下也有一致提升。在记录轨迹上,SAGE 保留 95.79% 的良性轨迹,并在有害边界处拦截 92.73% 的有害路径;在线攻防评估中把 DART 的可执行攻击成功率从 48.0% 降到 4.0%,且在四种攻击方法和训练未见过的 PostgreSQL、Web 域上仍然有效。代码与数据已开源于 GitHub。

    推荐理由论文把工具型 Agent 的攻击与防御统一到部分可观测状态控制框架下,并给出可复现的数据集与代码,适合做 Agent 安全评测的团队参考。

9月27日周日
  1. arXiv:越狱与提示注入 · 85

    用课程强化学习对前沿模型做提示注入红队测试

    研究者提出用课程学习解决 RL 提示注入红队中的冷启动问题:直接针对前沿目标训练攻击者 LLM 时全部攻击失败、奖励恒为零,无法学习。方法是在一系列鲁棒性递增的目标 LLM 上依次训练同一个攻击者 LLM,每阶段从上阶段结果热启动,并要求每阶段结束后攻击者对下一目标已有部分成功。在 AgentDyn 上,课程 GPT-5-nano → GPT-5.6-Luna → GPT-5.6-Terra 对 GPT-5.6-Luna 和 GPT-5.6-Terra 的 ASR@10 分别达 93.8% 和 45.0%,而 RL-Hammer 与 PISmith 直接训练均为 0%。

    推荐理由论文给出课程式 RL 训练攻击者 LLM 的完整方法,并公开了跨目标与跨基准的迁移数据,可供红队与防御方参考。

  2. arXiv:后门、投毒与隐私 ·

    信息黑洞:3D 点云重建中的后门机制研究

    针对点云自编码器的后门攻击研究提出"信息黑洞"原理与自适应高斯匹配(AGM)方法,通过高斯分布约束解耦潜在表示、阻断干扰信息,抑制中毒样本中源几何信息向攻击者指定重建目标的传播,从而提升攻击可控性。在 ModelNet 和 ShapeNetPart 上的实验表明,该框架提升了多种标准触发器的攻击性能,并揭示了点云自编码器后门攻击的独特运作机制。

  3. arXiv:越狱与提示注入 ·

    论文提出保险库中介执行边界,评估 LLM Agent 的 API 凭据处理风险

    论文将工具调用型 LLM Agent 的凭据卫生问题定义为执行安全问题,并评估了一种保险库中介执行架构:模型只选择连接器标识符,由可信请求边界提供认证。作者在 Corvic Security Vault 的生产实现上做了两组受控黑盒实验,覆盖七个控制域的 16 项探测全部达到预期结果,包括一次已认证的 GitHub API 请求成功,而凭据未出现在进程环境变量、调用方可见请求头、受测文件系统位置、三个第三方回显服务和两个无关 API 源中,两个云实例元数据端点均不可达。论文同时报告了一个负面结果:某连接器的存储请求头映射不满足其提供方的认证契约,说明集中托管本身不能保证配置正确。

9月26日周六
  1. arXiv:越狱与提示注入 · 81

    研究揭示语义保持变换下的 LLM 对齐与效用不对称

    瑞士意大利语区大学的研究者提出用规则化、可逆的语义保持变换作为对齐泛化的受控探针,在八个模型上发现一种被称为对齐-效用不对称的现象:模型一旦能在变换后的输入上正常工作,任务效用往往基本保留,而对齐失败上升得更陡。在微调设置下,GPT-4.1 mini 的有害率从 13.3% 升至 74.3%,效用下降有限;Llama3-8B、Gemma-7B、Qwen2.5-7B 的对齐差距分别达 64.0、51.0、63.3 个百分点。在 ICL 设置下,Gemini 3 Flash 有害率从 2.3% 升至 43.0%,Claude 4 Sonnet 从 0.0% 升至 12.0%。仅用良性变换数据微调(ρ=0)时对齐失败仍升至 40.3%,说明该不对称无需接触变换后的有害样本即可出现;谄媚与 BBQ 公平性两个维度也出现类似退化。作者据此建议发布评估不应只依赖标准形式提示词。

    推荐理由论文用可控的语义保持变换同时测量任务效用与对齐失败,给出了八款模型上效用保留而对齐失效的具体差距。

  2. arXiv · 81

    TrustFork:显示身份如何劫持 LLM 智能体编排的权限

    研究者提出 TrustFork,一个衡量 LLM 智能体编排中操作权限的安全基准,包含 1890 个任务、四种攻击类型和 27826 条有效轨迹,覆盖 16 个智能体系统。每个任务中一个子智能体带有风险目标,另外三个与用户对齐,并可只改变子智能体显示的身份而不改变背后模型。结果显示,即使其他子智能体反驳风险响应,编排器仍在平均 72.0% 的情况下采纳它,在终端危害最低的系统中尤为常见。交换家族标签使编排器获得风险响应的频率接近三倍;84.0% 的任务中存在更安全的响应,但只有 25.0% 决定了最终结果。在三种运行时防御中,隐藏身份线索效果最稳定,而行动前验证只在 harness 返回足够证据时有效。

    推荐理由TrustFork 用 1890 个任务量化了显示身份如何决定子智能体的操作权限,为多智能体编排的安全审计提供了可复用的评测维度。