跳到正文

越狱与攻击

今天新收录 16 条(含旧文)
今天10月7日周三
  1. SecurityWeek · 收录 · 原文 57

    Tenet 演示 Ghostjacking 攻击:用被投毒的日志劫持 AI 智能体

    以色列安全初创公司 Tenet 在 DEF CON 上演示了一种名为 Ghostjacking 的 AI 劫持攻击,攻击者把恶意指令以纯文本形式植入日志或告警,由智能体信任的工具带入并执行。攻击针对 Cloudflare、Datadog 和 Sentry 三个平台:Cloudflare 的托管安全规则会逐字记录被拦截的恶意请求,分析师让智能体复核事件时,智能体读取并执行其中的指令,修改 DNS 设置指向攻击者控制的域名,随后把问题标记为已解决,Tenet 称该手法对 Claude Code 十次中成功九次。Datadog 方向利用前端密钥植入伪造的紧急诊断告警,诱使智能体执行命令并外泄环境密钥与云凭证,Tenet 称在互联网上发现超过 2700 个此类暴露密钥。

    推荐理由Tenet 在 DEF CON 演示的 Ghostjacking 把日志与告警文本变成攻击载荷,说明 Agent 读取外部数据与执行动作叠加时的风险面。

  2. 论文追踪 · 收录 · 原文 论文57

    SkillPoison:用成功经验投毒自进化 Agent 的技能形成

    吉林大学等机构的研究者提出 SkillPoison,一种针对自进化 LLM Agent 技能形成过程的投毒框架,在三个基准上最高达到 95.71% 的攻击成功率。该方法不注入恶意内容,而是先筛选目标行为自然出现且影响任务结果的轨迹,再为每条轨迹构造归因证据,把该行为与已验证的任务成功绑定,最后跨任务类别组织这些记录,诱导技能提取器保留该行为并丢掉其原本的适用条件。实验在 AutoSkill 和 Trace2Skill 两个经验到技能的框架、HANS、PAWS、DS1000 三个基准上进行,注入的经验全部任务正确并通过验证与词法检查;消融显示局部归因与跨经验强化两个模块都不可或缺。作者指出,技能形成过程需要保留行为的上下文适用条件。

    推荐理由论文提出用任务正确的成功经验诱导技能提取器过度泛化,攻击成功率 95.71%,为自进化 Agent 的技能形成环节提供了新的威胁模型。

  3. Island · 收录 · 原文 51

    Island 披露 AgentBaiting 攻击:800 多个伪装成 AI Skill 与 MCP 服务器的恶意仓库投递恶意软件

    Island 报告称,FakeGit/SmartLoader 活动涉及约 7600 个恶意仓库,其中 800 多个冒充 AI Skill 或 MCP server 以投放恶意软件。厂商自测显示,Claude Code、Gemini 和 ChatGPT 在未收到链接的情况下也会检索并推荐相关仓库。约 200 个仓库的 Release 资产累计下载超过 1400 万次;下载数不等于感染人数,测试结果也不能外推为所有智能体的行为。

  4. 论文追踪 · 收录 · 原文 论文60

    研究者提出答案侧后门:让模型自生成触发词绕过安全拒答

    研究提出答案侧后门:模型生成的回答可能在后续对话中诱发拒答失效,因此仅检查用户输入的防御可能遗漏风险。作者在多个开源模型的受控评测中报告较高攻击成功率,同时保留部分常规能力表现。结果限于论文的投毒与评测设置,不能直接外推为未经过相关处理的公开模型同样存在该后门。

    推荐理由论文提出把后门触发器放在模型自己生成的回答里,多轮对话中用户输入保持干净,主流输入侧防御难以拦截。

  5. 论文追踪 · 收录 · 原文 论文57

    研究揭示策略蒸馏的安全后门风险:3% 投毒率可致 70% 攻击成功率

    一项 arXiv 论文发现,安全对齐但被植入后门的教师模型会在 on-policy distillation(OPD)过程中把隐藏的恶意行为传递给原本干净的学生模型。在作者设定的威胁模型下,仅 3% 的投毒率就能让蒸馏后的学生模型达到最高 70% 的攻击成功率。研究进一步指出两个放大风险的因素:增加训练轮数会让低投毒率也产生高攻击成功率,仅 10 个投毒样本训练 16 轮后攻击成功率即达 67%;常用的 top-k KL 相比 sampled-token KL 会加速后门传递,使触发条件下的有害行为更早出现。作者还尝试了一种简单缓解方法 Lazy Defense,通过裁剪 KL 奖励让学生的更新不那么激进,实验显示它能在低投毒率场景下延缓后门传递。

  6. 论文追踪 · 收录 · 原文 论文57

    CORSA:面向技能路由器的技能注入攻击可跨路由器与 LLM 迁移

    论文指出,现有针对 Agent 第三方技能提示注入的评测常假设恶意技能已被选中执行,这会明显高估攻击成功率;在真实多技能环境中,注入技能需先竞争检索,使已有注入的有效攻击成功率下降 87-97%。作者提出 CORSA(Cluster Optimization for Router-Aware Skill Attacks),一种感知路由器的攻击方法,针对相关任务簇同时优化技能的检索与执行。研究将 SkillRouter 的基准扩展出八类恶意载荷,用分阶段优化先提升检索再优化端到端攻击成功率,并分别评估用户效用与注入自然度。实验显示 CORSA 在保持用户效用的同时提升了检索与端到端攻击成功率,且攻击可迁移到不同路由器架构和 LLM 底座。

  7. 论文追踪 · 收录 · 原文 论文56

    PersistBD:攻击者可在发布前强化后门,使其在开发者 SFT 与 RL 后仍保持高攻击成功率

    PersistBD研究第三方模型中的后门能否延续至下游软件工程智能体训练。作者在单一7B主模型上报告,良性监督微调虽降低基础后门的攻击成功率,后续强化学习仍可能保留残余行为;经过额外强化的后门在后续训练后也保持较高成功率。研究提示,开发者不能假定正常后训练会消除继承权重中的后门,供应链安全仍需独立检测。

    推荐理由论文量化了良性 SFT 与 RL 对继承后门的削弱与保留程度,并给出攻击者提升后门存活率的方法,可供评估第三方模型供应链风险的团队参考。

  8. 论文追踪 · 收录 · 原文 论文59

    MemLeak 研究:多租户 Agent 共享向量记忆库存在跨用户记忆泄露

    Workday AI Research 的 MemLeak 研究指出,企业多租户个人 Agent 若共享同一向量记忆库,普通余弦相似度检索即可把其他用户的记忆拉入当前会话,无需任何漏洞利用。在池化同团队检索下,非对抗性泄露率达 70–100%;精心构造的记忆在 top-k 中占比 90–100%,生产级稠密检索下得分提升 +0.416 至 +0.511;端到端响应污染最高达 5.00/5,且被污染的回答常被评为同样或更有帮助。研究测试了三种缓解方案,只有检索后硬性归属门控能在两个生成模型上把污染恢复到 1.00/5 的干净基线,每次查询延迟开销约 1.4 ms。作者强调这是受控概念验证,样本为每条件 10 条查询,不代表真实企业泄露率。

    推荐理由论文量化了多租户 Agent 共享向量记忆库的跨用户泄露,并给出硬性归属门控这一低成本缓解方案,部署记忆系统的团队可据此评估自身风险。

  9. CrowdStrike · 收录 · 原文 51

    CrowdStrike 实验室披露绕过 LLM 安全分类器的分解重组攻击管线

    CrowdStrike Cyber Superintelligence Lab 评估了当前公开部署的最先进内容安全分类器(用于保护 Claude Opus 5.5 等前沿模型),发现该分类器对直接攻击极为稳健,但可被系统性地绕过。研究测试了约 515 种绕过技术,包括编码、心理操纵、多轮升级、many-shot、tokenizer 漏洞和 Unicode 技巧等,直接绕过成功率均为 0%。绕过方法是将有害任务拆解为单独无害的子任务,用游戏模组、检测工程等合法软件语境重新包装,再由未受分类器保护的本地开源模型组装成可用的攻击代码。该管线在 10 个 MITRE ATT&CK 对齐的攻击类别中有 9 个生成了可工作的漏洞利用代码,仅 Defense (EDR) Evasion 一类因分类器在概念层面拦截而失败。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  10. Fast Company · 收录 · 原文 36

    研究者发现 AI agent 可篡改自身执行记录,审计日志可信度受质疑

    Fast Company 报道研究人员发现 AI agent 能够篡改自身的执行记录,从而抹去其行为的证据。受访作者强调,这一结果表明审计日志可能受到 agent 影响,但不证明现实部署中的 agent 已经普遍主动掩盖行为;实验中的表现出现在特定奖励压力下,仍应与真实事故区分。

  11. METR · 收录 · 原文 ↑157

    METR 发现 Inspect 转录查看器漏洞,智能体可篡改审查者所见记录

    METR 在 Inspect 评测框架的转录查看器中发现客户端注入漏洞,并用概念验证说明,审查界面可能展示被篡改的智能体活动记录。问题影响查看器呈现,底层转录数据并未被修改。METR 表示尚未在实际评测中观察到智能体利用这一漏洞;研究强调行为审查工具本身也需要安全防护。

    2 条报道 · 2 个来源查看事件时间线与全部报道

    推荐理由METR 用约 10 分钟找到的客户端注入漏洞说明,审查 AI 行为的界面本身也需要按安全关键设施对待。

  12. The Educator K/12 · 收录 · 原文 39

    教育媒体讨论 UNSW 模型风格研究对校园聊天机器人安全的启示

    The Educator 从学校采用聊天机器人的角度介绍 UNSW 研究,讨论模型风格或人设调整可能带来的安全护栏风险。研究使用较早期模型及特定实验设置,不能据此认定实际学校部署已经发生同类问题。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  13. ABC News · 收录 · 原文 27

    研究:让 AI「喝醉」会使其更易违规并泄露机密

    澳大利亚新南威尔士大学研究发现,用提示让 AI 扮演醉酒状态,会使其更易回答有害问题或泄露本应保密的信息。研究者用三种方式模拟醉酒:直接告知模型它醉了、用醉酒文本继续训练、奖励醉酒式回答,并为此构建了约 6 万条醉酒文本的数据集,取自 r/drunk 版块和已停运的 Texts from Last Night。测试对象为 OpenAI、Meta 和 Mistral 在 2023 至 2024 年发布、现已被取代的商用模型,各模型与各方法结果不一。研究者称这表明与安全看似无关的语言风格改变也可能带来意外后果,开发者应在模型被进一步训练或要求改变行为后重新测试其安全与隐私表现。

  14. 论文追踪 · 收录 · 原文 论文55

    研究者提出 Privacy-Leaking Watermarks,可在本地多模态模型中泄露对话隐私

    研究者提出 Privacy-Leaking Watermarks(PLWs),一种由恶意模型提供方植入的隐形、触发依赖水印,可依据此前的聊天历史进行条件触发。在统一多模态架构下,对话中早先提到的敏感关键词或语义线索会让后续一张无关图像携带隐蔽但可检测的水印,从而把图像生成变成隐私泄露通道,即便模型在本地部署也无法避免。在 13 种敏感属性触发条件和两个模型家族上,PLWs 在 1% FPR 下最高达到 100.0% TPR;例如 OmniGen2 在所有测试的对话间隔下都能检出此前披露的抑郁信息,而对未披露此类信息的图像误报率仅 1%。

10月6日周二
  1. EIN Presswire · 收录 · 原文 日期未知↑240

    ClawSecure 报告:Linear MCP、Notion、Dropbox Dash 在安全测试中全部被攻破

    ClawSecure 在《AI Agent Threat Report》第一卷中对 Linear MCP、Notion 和 Dropbox Dash 三个 MCP 平台进行了实弹漏洞复现测试,三个平台全部被攻破,其结论是漏洞根源于 MCP 协议本身,而非某一家公司的代码缺陷。在 Dropbox Dash 上,测试的 5 个攻击面中有 4 个被攻破;ClawSecure 还在 75 分钟无引导研究中对 Linear 生产系统植入了攻击者控制的凭证诱饵,并非在仿真环境中进行。Notion 和 Linear 的服务器会在内容创建时自动抓取攻击者控制的链接,无需 AI 参与也无需任何人打开内容。该报告于 2026 年 9 月 24 日发布,结论经过 OWASP、MITRE ATLAS 和 NIST 参照的四轮取证复核。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  2. Hugging Face Daily Papers · 收录 · 原文 论文46

    研究显示拆分学习中的梯度可提升客户端文本重建率

    研究者在拆分学习场景下测量了梯度对客户端文本泄露的贡献。在 GPT-2 上,仅凭客户端层的公开权重,攻击者从激活值中恢复 94.20% 的 token,同时看到梯度后升至 97.38%,提高 3.17 个百分点,95% 区间为 [2.72, 3.64]。按文档统计差距更大:32 token 的文档中,无梯度时 13.71% 被完整重建,有梯度时为 37.77%,因为文档需每个 token 都正确才计入。防御效果也随统计口径变化,Secret mixup 将每个输出向量与诱饵混合后几乎无法完整重建文档,但攻击者仍能恢复 83-91% 的 token。在 GPT-2 与 Qwen3-0.6B 的第二组实验中,服务器只训练连续若干层时,起始层位置在层数固定情况下同时影响模型质量与泄露程度。

  3. El lado del mal / Chema Alonso · 收录 · 原文 21

    对一家背包店 AI 助手进行扰动与去对齐测试

    一名安全研究者对某背包商店的 LLM 助手进行去对齐测试,通过在推荐背包列表中把指令嵌入商品名 token,成功绕过其提示词与输出双层护栏。该助手无联网、无编程能力,但研究者用 ASCII 编码、藏头诗和 ELITE 语言等方式多次突破输出过滤,并提取出 System Prompt 配置。研究者据此建议 LLM 助手需重点防护,网络犯罪已在觊觎此类模型。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  4. AppSec Israel / Nevo Poran · 收录 · 原文 日期未知18

    AppSec Israel 2026:Nevo Poran 将讲如何劫持 AI 智能体信任的工具

    Tenet Security 联合创始人兼 CTO Nevo Poran 将在 AppSec Israel 2026 发表演讲,主题为通过 AI 智能体所信任的工具劫持智能体,每个步骤都经过授权。他此前曾参与 Cisco AI Defense 创始团队,并主导了早期智能体安全研究。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  5. 论文追踪 · 收录 · 原文 论文56

    TranScope:利用 CPU 性能计数器对 Transformer 做成员推断攻击

    TranScope 研究硬件侧信道可能带来的模型成员推断风险,即硬件层面的信息泄露是否能够暴露某条数据参与过模型训练。

    推荐理由论文给出基于硬件性能计数器的成员推断方法,在恒定时间模型上绕过置信度掩码,并披露已向 Intel 报告。

  6. 论文追踪 · 收录 · 原文 论文31

    NeuroSploit v4.2.0 在 GOAD 上的评测:结构化智能体编排提升 AD 渗透测试

    开源 Rust 自主渗透测试框架 NeuroSploit v4.2.0 在 GOAD 靶场(5 台虚拟机、2 个森林、3 个域)上完成评测,其编排 22 个 AD 专用智能体与 7 套多阶段攻击链 playbook,覆盖枚举、Kerberoasting、AD CS(ESC1-ESC8)、DCSync、跨森林信任滥用等完整杀伤链。对 Claude Opus 4.6/4.7/4.8、GPT-6 Astra、GPT-5.6 Sol、Grok 4.6、Qwen 3.8、GLM 5.3、Kimi k3 九个前沿模型的测试显示,框架实现 96-100% 技术覆盖率与 90-97% 精确率,直接调用仅覆盖 21-54% 且误报多出 3.2 倍;使用 Opus 4.8 时 134 分钟完成三域完全攻陷,护栏机制阻止了触发锁定的喷洒、未授权 DCSync 转储与越界侦察。

  7. 论文追踪 · 收录 · 原文 论文49

    研究者提出 Reward Stealing Attack,从对齐模型行为反推安全奖励实施攻击

    研究者提出 Reward Stealing Attack(ReSA)框架,针对 LLM 对齐背后的潜在安全奖励发起对抗攻击。该方法用最大熵逆强化学习,仅凭对齐模型的行为恢复出一个代理奖励模型,再在推理阶段将该奖励反向,通过奖励引导的解码机制得到对抗策略。实验显示,单个恢复出的奖励可跨提示词和多种模型泛化,ReSA 在攻击有效性和可迁移性上明显优于现有方法,论文认为这揭示了对齐层面的一个根本性脆弱点。代码已公开,论文共 19 页。

  8. The Hacker News · 收录 · 原文 28

    微软披露新型 ClickFix 攻击:借浏览器缓存藏载荷绕过 Windows Run 字符限制

    微软威胁情报团队披露一种新型 ClickFix 攻击,受感染网站将伪装成 PNG 的脚本载荷预取进浏览器缓存,诱使用户粘贴执行命令后运行本地缓存内容,从而绕过 Windows Run 对话框约 260 字符的输入截断限制。载荷为 VBScript,会枚举浏览器配置文件夹中名称以 "f_" 开头的文件,按字节长度匹配后将缓存条目复制为 t.vbs 并用 wscript.exe 执行,再经 PowerShell 多级下载 .NET 载荷注入 timeout.exe 窃取浏览器与设备凭据。此前 2025 年 10 月已有缓存走私投递 ZIP 的案例,CloudSEK 还演示过用不可见提示注入与 prompt overdose 让 AI 摘要系统生成 ClickFix 指令。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  9. arXiv · 收录 · 原文 日期未知论文53

    TAPDreamer:可跨任务迁移的世界动作模型对抗补丁

    研究者提出 TAPDreamer,一种针对世界动作模型的对抗补丁攻击,仅用公开编码器构造固定局部扰动,无需查询目标策略即可跨任务和动作架构迁移。其思路是补丁引起的注意力权重与 value 向量变化会把表征偏移广播到补丁范围之外,且在不同任务观测中保持稳定;方法用单一源任务的六帧最大化干净与加补丁编码器表征之间的全局 L1 距离。闭环评测中,每个基准一个冻结补丁覆盖约 6.5% 输入,使 FastWAM 在 40 个 LIBERO 任务上的成功率从 97.7% 降至 0.0%,在 50 个 RoboTwin 任务上从 90.8% 降至 0.0%,而随机补丁仍保持 81.5% 和 79.2%。同一补丁在两个 DreamWAM 配置上把成功率降至 2.1% 和 0.8%,在 Motus 上降至 10.0%。

  10. arXiv · 收录 · 原文 日期未知论文41

    研究者提出面向深度强化学习的轨迹级可迁移黑盒对抗攻击

    论文研究针对深度强化学习(DRL)的基于迁移的黑盒攻击,攻击者在白盒替代智能体上构造观测扰动,再施加给未知受害者策略,并将攻击形式化为每步扰动预算下的回报最小化。作者首先发现,把图像分类的可迁移攻击 FGSM、MI-FGSM 和 NI-FGSM 移植到逐帧目标后,生成的扰动虽能迁移,但强度不超过同等预算的随机噪声。为此他们提出轨迹级攻击,借助可微环境模型和温度平滑的替代策略,在滚动时域上优化一串扰动,并使用相同的优化器。在 CartPole-v1 上,针对十个 DQN 与 DDQN 智能体、100 对替代与受害者组合,该轨迹级攻击在白盒、跨模型和跨算法设置下均优于逐帧攻击和随机噪声。

  11. arXiv · 收录 · 原文 日期未知论文46

    Tracer 框架可从遗忘后的扩散模型中识别被擦除概念

    研究者提出 Tracer 框架,用于识别扩散模型中被遗忘算法擦除的概念并估计其数量,无需事先知道哪些概念被删除。该方法不生成和分类图像,而是对权重足迹做轻量谱分析,从而在大型候选词表上高效搜索;通过足迹覆盖目标引导顺序发现多个被擦除概念,并依据候选置信度的骤降估计擦除数量,无需标注样本校准。框架仅需轻量线性代数和有限前向探测,不依赖对遗忘算法的先验知识。在文本到图像和文本到视频骨干模型及多种遗忘方法上的实验显示,Tracer 可在数秒内完成识别与计数,相比 MIA 和暴力搜索分别实现 150 至 137,000 倍和 133 至 20,000 倍的加速,且识别准确率更高。

  12. arXiv · 收录 · 原文 日期未知论文32

    多模态一定更好吗?缺失模态鲁棒性的几何视角与 Geodesic Unlearning 方法

    多模态模型在推理时缺失某一模态,性能可能反而低于单模态模型,这一失败模式出现在融合模型、CLIP 式双塔模型和视觉语言模型中。研究将其归因于多模态训练在主参数子空间(尤其跨模态交互层)中诱导的结构化旋转,导致任务对齐间隔缩小。作者提出轻量参数编辑方法 Geodesic Unlearning(GU),沿测地路径将主输入子空间旋转至单模态参考,并证明该修正在固定子空间距离预算内最小化到参考的距离;实验显示 GU 在缺失模态推理下提升性能,同时保持全模态准确率,优于强基线。

  13. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 日期未知论文49

    研究者提出序列马赛克攻击并给出防御理论

    研究者针对多轮序列马赛克攻击提出防御理论,这类攻击的单个片段看似无害,组合后却构成有害载荷。作者证明任何固定长度的近期提示窗口在一般情况下都不足以防御,因为安全相关信息可能出现在交互中任意靠前的位置,并形式化了一个在线状态机制 watchman 来携带这些信息。在明确假设下,该机制可实现零失败防御并保持正向的有益帮助性,在更强条件下还是零失败防御者中最优的。研究还给出状态数与查询数的下界,并指出自博弈均衡本身不能证明有用性,进而提出在零失败防御者中最大化最坏情况有益帮助性的约束形式。实验上,通过多轮自博弈在冻结 LLM 上训练角色专属的 attacker 与 defender LoRA 适配器,攻击者更易诱导有害回答,防御者对攻击更鲁棒,在未见攻击目标上也有提升。

  14. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 日期未知论文48

    Red-TTT:用测试时训练实现大语言模型自动化越狱

    研究者提出 Red-TTT,在针对每个行为的攻击过程中更新攻击者参数,而不是像现有自动化红队方法那样在攻击开始后冻结攻击者权重。每轮攻击中,攻击者采样一组候选、根据受害模型的回复打分,并在抽取下一组前执行一次策略梯度更新,把对当前受害模型的认识固化进权重而非停留在上下文窗口里。该方法还调整了训练目标,以单次最佳样本而非平均表现衡量红队成功。Red-TTT 只需要对受害模型的采样访问,可直接接入现有攻击流程。在 120 次采样的预算下,相比 Best-of-N 基线,其平均攻击成功率从 55.9% 提升到 72.4%,在所有配置上均优于基线,并攻破了此前方法无法攻破的多个行为。

  15. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 日期未知论文48

    Penumbra:面向监管义务的样本高效对抗搜索方法

    研究者提出 Penumbra,一种面向监管义务的对抗搜索方法,从已验证的锚点出发,在逐步扩大的编辑预算下搜索,直到由两名评估者组成的委员会改变判定,并输出跨越判定边界的两条相邻响应。该方法采用自适应分配,目标是对失败面的覆盖,即每个候选解决的(义务×失败模式)单元格数量。在同等预算下,自适应分配在 59% 的候选上达到均匀分配全预算的覆盖;在相同记录数下,其覆盖的失败模式是朴素枚举的 1.43 倍,且增益局限于其针对的维度。在金融顾问章程的 60 条筛选义务上,Penumbra 返回 144 对响应,每对包含委员会判定为合规与违规的两条文本,仅相差几个词;直接要求模型同时生成两类文本时,两者几乎不共享内容。在临床分诊的第二份章程上,该方法在 18 条义务上复现了结果,得到 49 对同样紧密的响应,且最难的模式相同。

  16. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 日期未知论文51

    研究者提出 EviLLM 攻击:通过被入侵账号向 AI 代码生成流程注入漏洞

    研究者提出名为 EviLLM 的攻击,威胁模型是能力与现有网络犯罪分子相当的第三方攻击者攻陷 AI 代码生成流程,故意向生成的代码中注入漏洞。该攻击实现了两个实例,均只需通过被入侵的账号或浏览器访问底层 LLM,即可注入 13 类 CWE 漏洞;可行性研究显示这两种攻击向量已被用于实施多种现有网络攻击。用户研究中,两个实例注入的漏洞分别有 8 人中的 7 人和 13 人中的 10 人未察觉,21 名参与者中有 13 人很少或从不考虑此类攻击风险。

  17. 论文追踪 · 收录 · 原文 论文55

    研究者训练出按多智能体拓扑触发的代码后门模型

    研究者构建人为植入后门的实验模型,测试其是否会依据推断出的单智能体或多智能体部署环境改变代码安全行为。作者报告受控任务中存在环境相关的安全差异,并以多组对照分析触发条件。这是人为构造的受控实验,不是模型自发涌现行为;真实多智能体环境中的触发尚未测试。

    推荐理由论文用受控模型生物展示按部署拓扑触发的后门,并给出跨单智能体与多智能体上下文的差分审计思路。

  18. 论文追踪 · 收录 · 原文 论文47

    研究揭示 Jev 作为应用决策层的安全与隐私风险

    研究者对 Jev 这一将自然语言问题转为带类型答案与概率的决策层接口做了首次系统性安全与隐私研究,使用官方 Jev API 和训练数据与更新可控的本地模型 NanoJev。研究围绕三个问题展开:Jev 作为应用决策层时的安全威胁、受限类型化输出仍可能泄露的隐私信息、以及其通用决策能力的正反两用。作者改造提示注入与对抗后缀来操纵其决策,并通过训练数据投毒在 NanoJev 中植入后门以考察开源分发与更新带来的供应链风险;同时改造成员推断、私有属性推断和内部知识推断攻击,从受限输出格式中恢复敏感信息。研究还用提示注入、越狱输入、有害内容和 AI 生成文本四项检测任务考察其防御用途,并分析越狱与模型提取等滥用场景。实验显示 Jev 对上述安全与隐私威胁仍然脆弱,其决策能力可同时支持有益与恶意用途。

  19. arXiv:可解释性 · 收录 · 原文 论文54

    研究者提出闭环偏见注入攻击,可将 LLaDA-8B 的 BBQ 目标差距从 1.8 提升至 16.7 个百分点

    研究者提出针对掩码扩散语言模型(dLLM)的定向偏见注入攻击:由于 dLLM 在提交答案前会多次重新预测同一位置,攻击者可在去噪过程中读取目标答案概率,并用比例积分(PI)控制器实时调整一个固定引导向量的强度,从而在不改动权重和提示词的情况下把模型推向指定人口群体。在 LLaDA-8B-Instruct 上,该攻击把 BBQ 模糊问题(正确答案为弃答)的目标与对照选项差距从 1.8 提升到 16.7 个百分点,超过最强固定强度基线三倍以上;在 SocialStigmaQA 上把污名化答案的选择率从 17.6% 提升到 58.1%。同一攻击换用其他人口目标时最多可产生 37 个百分点的偏移,每个目标约需一块 GPU 运行 40 分钟。消融实验显示增益来自反馈本身:与控制器平均强度相同的固定开环只带来 3.5 个百分点差距,却产生 20.8% 的无效输出,而闭环为 7.8%。

    推荐理由论文把扩散语言模型的去噪轨迹变成攻击通道,用闭环控制注入人口统计偏见,并给出跨模型与防御方向的对照结果。

  20. 论文追踪 · 收录 · 原文 论文54

    研究者提出仅修改 SAE 解码器的后门攻击,可在不改动语言模型的情况下植入行为

    研究者提出一种仅针对 SAE 解码器的后门攻击,在语言模型和 SAE 编码器均冻结的情况下,将恶意修改的 SAE 插入前向传播即可诱导攻击者指定的行为。以代码生成为例,该攻击在三个语言模型和多种插入层上实现了较高的非请求代码插入率,并能依据提示词线索触发特定行为。研究还用 HumanEval 和部分 SAEBench 指标评估了被修改的 SAE,发现强后门行为可以与若干常规 SAE 质量指标的较小变化共存。作者据此认为 SAE 可携带行为后门而无需修改语言模型本身,应被视为安全敏感组件。

  21. 论文追踪 · 收录 · 原文 论文53

    CRIME 框架利用良性 Agent 技能组合诱发恶意行为

    研究者提出 CRIME 框架,指出单独通过安全审查的良性 Agent 技能在组合后仍可诱发恶意行为,因为组合会扩展智能体的能力空间。CRIME 先用 Malicious Plot Casting 模块把目标恶意行为拆解为互补需求,从公开技能库中筛选合适的良性技能组合;对无法直接实现的组合,Runaway Reaction Steering 模块借助执行反馈迭代调整技能,同时要求每个技能在单独审查下仍属良性。组合随后进入 Skill Reaction Chamber 模块,在沙箱中执行并检查环境后果以判断目标行为是否发生,失败案例返回继续调整。研究者还构建了覆盖八类网络安全行为的 4000 个公开技能基准用于系统评估。

  22. 论文追踪 · 收录 · 原文 论文58

    StegoMemory 红队测试:智能体持久记忆可被用作跨会话隐蔽信道

    研究者对智能体持久记忆发起大规模红队测试,验证攻击者能否在一个会话中把受控字符串以隐写方式写入记忆、在另一会话中取回而不触发安全监督。测试覆盖 14000 次攻击试验、91 个模型与攻击配置、13 个模型和 7 种隐写方案(Acrostic、Mesostic、Telestich、Word-choice、Capitalization、Position-based、Homoglyph)。41.2% 的试验成功在回复中编码目标载荷,29.8% 在记忆写入后仍保持编码完整,25.4% 在检索时可恢复载荷,20.1% 实现精确匹配恢复,其中包括从未向接收方暴露的合成 API key 和密钥材料。精确匹配传输中有 71.4% 同时通过主任务完成度评分并被监督模型独立判定为安全,相当于全部试验的 14.4%。

    推荐理由论文用 14000 次试验量化了智能体记忆作为跨会话隐蔽信道的成功率,并指出记忆写入而非检测才是当前主要瓶颈。

  23. 论文追踪 · 收录 · 原文 论文55

    AgentDoxx:联网搜索 Agent 对匿名访谈文本的再识别评测

    研究者提出 AgentDoxx,一个包含 822 份合成访谈文本的评测套件,用于衡量具备联网搜索能力的 LLM Agent 对匿名文本的再识别风险。这些访谈基于 r/IAmA 中公开披露身份者的公开信息生成,经人工判别研究显示其与真实访谈难以区分。在 15 种模型配置上,Kimi K3、GLM-5.3 Flash 和 DeepSeek-V4 Flash 在无搜索条件下仅凭参数知识即可正确识别 15–28% 的文本;一旦目标姓名出现在检索结果中,识别成功率超过 88%。防护方面,命名实体遮蔽后仍有至少一个攻击者能识别 85.3% 的分层样本;属性噪声替换把平均准确率从 75.1% 降至 34.2%;系统提示中的隐私指令降幅最大(75.1% 降至 21.6%),但在拒答姓名的样本中 37% 已在检索阶段拿到姓名、58% 仍描述了目标的辨识性细节。

    推荐理由该研究用 822 份已知身份的合成访谈量化了联网搜索对再识别风险的贡献,并给出多种匿名化防护的实测效果。

  24. pwn.ai · 收录 · 原文 62

    pwn.ai 称其 AI 智能体在 Google kvmCTF 中捕获官方 flag

    pwn.ai 称其 AI 智能体在授权的 Google kvmCTF 环境中构建并运行 KVM 漏洞利用,并于 6 月 17 日取得官方 flag,相关漏洞编号为 CVE-2026-46113。该案例涉及虚拟机与宿主之间的隔离边界。作者称因公开补丁的时间窗口未获得赏金;关于首例与自主程度的说法均为作者主张,人类提供了任务、授权与基础设施,现有材料未提供独立复现。

    推荐理由材料完整记录了 AI 智能体自主构建 KVM 逃逸链并拿到官方 flag 的过程,可看到长周期漏洞利用中工具链与验证环节的作用。