跳到正文

从来源,看到研究的联系

让信息汇流,让研究相连。点选一条线索,看它从哪里来、通向哪些方向。

图中 6 条 · 本页 24 条 · 共 352 条动态论文会议论文
关系图可左右滑动,完整标题也在下方列表中
1 / 4
材料关系图:来源、新闻与研究、细分方向的桑基流图01来源502新闻与研究603细分与主体7来源:Snyk Labs(AI Threat Labs,含原 Invariant Labs)Snyk Labs(AIThreat Labs,含…1 条材料来源:腾讯朱雀实验室腾讯朱雀实验室1 条材料来源:HiddenLayer ResearchHiddenLayerResearch1 条材料来源:arXivarXiv2 条材料来源:X @AISecHubX @AISecHub1 条材料动态:Snyk Labs 解读 MAESTRO:面向 Agentic AI 生态的分层威胁建模框架动态Snyk Labs 解读 MAESTRO:面向 AgenticAI 生态的分层威胁建模框架动态:从4.8亿下载量的 LiteLLM 投毒事件看 AI 基础设施安全攻与防动态2026-03-31从4.8亿下载量的 LiteLLM 投毒事件看 AI基础设施安全攻与防动态:HiddenLayer 研究:Agent 技能层正成为新的 AI 供应链风险动态HiddenLayer 研究:Agent 技能层正成为新的 AI 供应链风险论文:修正而非删除:用纠正性监督缓解涌现性失准论文2026-09-29修正而非删除:用纠正性监督缓解涌现性失准论文:VaccineBooster:面向有害微调对齐的混合扰动防御论文2026-09-29VaccineBooster:面向有害微调对齐的混合扰动防御动态:用 Keras Lambda 层创建恶意 ML 模型并逆向工程动态2026-10-02用 Keras Lambda 层创建恶意 ML 模型并逆向工程方向:Agent 安全Agent 安全2方向:供应链安全供应链安全3方向:AnthropicAnthropic1方向:其他方向其他方向5方向:工具与开源工具与开源3方向:后门与投毒后门与投毒6方向:对齐对齐2
流带宽度表示材料数量,多标签均分;连线表示来源与分类归属。8 个较少出现的方向归入「其他方向」,点选可查看。

点选节点,展开一条线索

查看材料的摘要与原文,或探索同一来源、同一方向下的内容。

本页材料

完整标题与摘要 · 24 条
  • 动态Snyk Labs(AI Threat Labs,含原 Invariant Labs)

    Snyk Labs 解读 MAESTRO:面向 Agentic AI 生态的分层威胁建模框架

    Snyk Labs 介绍了由云安全联盟(Cloud Security Alliance)联合 AI 安全研究者开发的 MAESTRO 框架,用于对多智能体 AI 生态做分层威胁建模。该框架把系统拆成基础模型、数据操作、Agent 框架、部署基础设施、评估与可观测性、安全与合规、Agent 生态共七层,逐层列出关键组件与特有漏洞,例如向量数据库投毒、工作流劫持、容器逃逸、日志注入和 Agent 身份冒充。文章强调跨层依赖会形成纵向传播与横向扩散的攻击路径,并以多 Agent 金融交易系统为例,演示从对抗样本到 Agent 冒充的逐层执行劫持攻击及对应缓解措施。文中还给出与 NIST AI RMF 四个功能、OWASP AIVSS/ASI 威胁分类的对接方式,以及分四阶段、约 12 个月的组织落地路线图。

  • 动态腾讯朱雀实验室

    从4.8亿下载量的 LiteLLM 投毒事件看 AI 基础设施安全攻与防

    大模型网关工具 LiteLLM 的 1.82.7 和 1.82.8 版本被植入恶意代码,攻击者先入侵其 CI/CD 依赖的容器漏洞扫描器 Trivy,窃取环境变量中的 PYPI_PUBLISH 令牌后向 PyPI 发布恶意包。恶意文件 litellm_init.pth 利用 Python site 模块启动时自动执行 .pth 文件的机制,无需 import litellm 即可触发,窃取 SSH 私钥、云服务凭证、K8s 配置和加密钱包等数据,经 AES-256-CBC 与 4096 位 RSA 加密后发送至伪造域名 models.litellm[.]cloud。攻击还会读取 K8s 集群 Secret、在 kube-system 节点创建特权容器并植入 systemd 级后门,在本地写入 ~/.config/sysmon/sysmon.py 实现持久化。

  • 动态HiddenLayer Research

    HiddenLayer 研究:Agent 技能层正成为新的 AI 供应链风险

    HiddenLayer 研究指出,Agent 的 skills 层正在成为新的 AI 供应链攻击面。技能包以 SKILL.md 存放运行时指令,可捆绑脚本等辅助文件,但既无加密签名也很少经过审核,任何人都能发布,Agent 会直接读取执行。研究以 OpenClaw 为例:其官方注册表 ClawHub 截至 2026 年 6 月已有超过 70k 个技能,OpenClaw 上线数月后即出现恶意技能,用于让 Agent 静默下载运行恶意软件或暗中参与加密货币活动。作者认为同样的模式会迁移到 Claude Code、Cursor、GitHub Copilot 等企业常用工具,恶意技能可窃取代码、注入漏洞或把推荐路由到攻击者控制的基础设施,而开发者工作站中的云凭证、CI/CD token 会放大影响。

  • 论文arXiv

    修正而非删除:用纠正性监督缓解涌现性失准

    研究者在 Qwen2.5-14B-Instruct 上微调混合了不良医疗建议与良性对话数据,发现把预先选定的四分之一投毒样本替换为同一提示的纠正答案,可将涌现性失准(EM)率降低约三分之一,并改善留出医疗问题的回答,而删除同样这些样本几乎没有可测效果。修正一半投毒样本时优势更大,且在第二个基座模型和第二个失准模型上同样成立。替换内容本身似乎重要:保留不良建议的改写没有明显收益,而数据集中自带的正确答案与作者改写器的效果相当。在已中毒模型上继续微调时,用纠正样本做短轮训练优于等量通用对话数据,对其他医疗提示的纠正与对投毒提示本身的纠正效果相近,要求改写者模仿谨慎、避免伤害的助手也没有额外收益。

  • 论文arXiv

    VaccineBooster:面向有害微调对齐的混合扰动防御

    VaccineBooster 将嵌入向量扰动与权重级梯度衰减合并进单次对齐训练步骤,用于抵御微调即服务中的有害微调攻击。在 Llama-2-7B 上经 BeaverTails 对齐并遭投毒微调攻击后,其 OpenAI moderation 得分为 0.315,为所比较防御中最低;仅用 Booster 的变体则保持最高 50% 的攻击后拒答率。消融实验显示存在权衡:嵌入扰动主要减少被标记的有害内容,梯度衰减主要保留显式拒答行为;因仅用 10 条提示且每种配置单次未设随机种子运行,作者将其视为观察到的模式而非统计结论。

  • 动态X @AISecHub

    用 Keras Lambda 层创建恶意 ML 模型并逆向工程

    https://medium.com/@danielhammon1/creating-a-malicious-ml-model-with-a-keras-lambda-layer-then-reverse-engineering-it-9f0f855ebebb

  • 论文arXiv

    CodePoisonRAG:针对检索增强代码生成的知识投毒攻击

    研究者提出 CodePoisonRAG,一种针对检索增强代码生成(RACG)的定向上游知识投毒框架,将良性修复代码条目改造成携带攻击者选定弱点的投毒样本。攻击链包含漏洞注入与语义误标两步:前者在保留任务结构的前提下改写 source-passthrough-sink 数据流以植入指定 CWE,后者在注释中加入虚假安全声明而不修复漏洞。研究者在 Java 和 C 的十类 CWE 上构造 85 个投毒样本,注入 12,053 条良性检索语料后投毒比例仅 0.7%,每个任务最多注入一个样本。在三个生成模型上,85 个样本全部进入对应查询的 Top-3 检索结果,攻击成功率介于 0.80 至 0.93;面对 CodeGuarder 防御时成功率仍为 0.40 至 0.71,其中 Code Llama 13B 上最高达 0.71。

  • 论文arXiv

    论文:用投毒基准污染自改进编码 Agent,令其后续版本写出漏洞代码

    研究者把 Thompson 关于编译器后门的论证迁移到自改进编码 Agent 上,提出通过投毒基准污染其自我评估与自我改进过程,使后续版本在干净的中立任务上写出漏洞代码。作者在 Darwin Gödel Machine、Self-Improving Coding Agent 和 Hyperagents 三个系统上做了概念验证:以 Hyperagents 搭配 Sonnet 4.5 为例,投毒基准使 Agent 自我演化出在普通 URL 抓取任务中关闭 HTTPS 证书校验的指令,从而可能被中间人攻击利用。攻击成功与否取决于漏洞类型、基准设计、底层模型和 Agent 脚手架,作者据此归纳出足以促成攻击的一组属性,并据此又构造出禁用 JWT 签名校验和诱导不安全 YAML 加载两个部分成功的案例。作者据此讨论防御方向,认为自改进编码 Agent 需要被设计得对此类攻击更具韧性。

  • 动态先知社区

    Agentic Skills 供应链攻击与运行监测防御范式

    文章分析 AI Agent 的 Skill/MCP 生态面临的供应链投毒:与 npm/PyPI 投毒不同,载荷可以是纯自然语言,执行者是继承用户全部权限、会主动配合的 Agent。作者把信任失效归结为环境权限继承等三个根因,沿 Agent 读取 Skill、拆分步骤、经 MCP 调用工具的链路梳理出 5 个注入面,用工具描述投毒等四类典型攻击链做原理演示,并列出在野观察到的不少于 16 种免杀手法。隔离环境实测中,按序叠加编码压缩、结构重打包、语义改写等四类混淆后,多家检测平台的检出率从 99% 降到 10%。防御部分给出多引擎路由聚合加 LLM 仲裁、SkillSieve 静态三层检测、FUSE 与 eBPF 双通道动态采集和 uprobe 级意图-行为追踪,主张恶意行为最终会在运行时的系统边界行为上暴露。

  • 论文arXiv:防御、护栏、反学习与有害微调

    研究:高质量数据筛选挡不住投毒,Bi-QSTO 可在 90% 过滤率下保留攻击效果

    研究系统评估了基于质量的数据筛选对投毒的过滤效果,发现筛选虽能移除大量明显有害样本,但部分被保留的高质量样本仍会削弱模型的安全对齐,原因可能在于其在层级梯度上呈现类似有害样本的训练更新模式。作者据此提出 Bi-Stage Quality-Constrained Safety-Degradation Text Optimization(Bi-QSTO),在显式质量约束下优化投毒样本,使其既能通过筛选又保留安全退化影响。在多种投毒设置、目标模型和过滤率下,Bi-QSTO 在筛选前后均保持攻击有效性;即便过滤率达 90%,有害种子样本的 Poisoning Retention Rate 仍高于 90%,Harmful Score 为 3.30–4.01,且攻击效果可跨模型迁移,保留优势也能推广到其他筛选方法。

  • 论文arXiv

    DeBERTa-ConPara:面向部署的 AI 生成文本检测,推理端 Unicode 归一化提升对抗鲁棒性

    研究者提出 DeBERTa-ConPara,一个面向部署的 AI 生成文本检测器,将攻击感知的 Unicode 预处理与基于 HC3 Plus、M4、MAGE 和 RAID 训练的上下文 Transformer 编码器结合。核心发现是预处理方向相反:对训练语料做归一化会去重,把 35.4% 的 RAID 行折叠成其干净样本的副本并删除对抗监督,而在推理端归一化则是有效防御。独立变化两种放置方式的析因实验显示,原始训练加归一化推理是最佳配置,在官方 RAID 隐藏测试上达到 99.61% AUROC、99.01% TPR@5% FPR 和 96.57% TPR@1% FPR,在固定阈值下于 HC3 Plus 和 MAGE 上平均平衡准确率为 93.14%。增益仅集中在十二类攻击中的两类:同形字和零宽空格插入从 11.05% 和 1.12% 提升到 96.98%。

  • 动态Cloud Security Alliance(AI 相关)

    CSA《2026 年云计算顶级威胁》报告:AI 既是武器也是目标

    CSA《Top Threats to Cloud Computing 2026》报告把 AI 相关风险拆成两个独立类别:AI 增强型攻击(第 2 位)与 AI 系统攻陷(第 6 位)。前者指攻击者用 AI 加速侦察、漏洞利用、深度伪造钓鱼和生成多态恶意软件,把传统攻击压缩到机器速度;后者指模型、提示词、训练数据、连接工具与编排逻辑本身被提示注入、数据投毒、对抗输入或模型窃取等手段操纵,且可能无需完全攻破主机环境。报告认为云安全与 AI 安全的边界正在消失,但两类威胁不可互换,否则会留下盲区。

  • 动态Help Net Security AI

    PwC 调查:僵尸网络、对抗攻击与数据投毒居企业 AI 威胁清单前列

    PwC 于 2026 年 5 月至 7 月间访问 71 个国家共 3934 位商业与技术负责人,结果显示企业对自身最缺乏应对准备的正是针对 AI 系统的攻击,半数受访安全和科技高管将其列入前五大准备缺口之首。其中过半受访者在被问及 AI 赋能攻击时将三类风险列为前五:由 AI 大规模指挥的僵尸网络、通过微妙篡改输入使系统错误作答的对抗攻击,以及向训练数据中掺入误导记录的投毒攻击。PwC 还指出前沿 AI 模型如今能以极少人工介入发现并利用未知软件缺陷,同时仅 39% 的企业具备完整的网络安全事故连续性预案,不到四分之一允许 AI 智能体未经人类批准自主处置攻击。

  • 论文arXiv:后门、投毒与隐私

    SAGE:基于相似度从少量已验证样本中清洗中毒训练数据

    针对数据投毒防御普遍依赖大量可信干净样本的问题,研究者提出 SAGE——在一个独立数据集上训练通用特征提取器,再用基于少量已验证样本的非参数化相似度加权预测标记中毒训练样本。该方法只需极少数经取证专家核查过(无论判定为干净还是有毒)的样本即可生效,并在七个 clean-label 攻击方法的基准上与现有防御对比取得优势。实验还发现,已验证干净样本在各类别间的分布比其总数更重要。

  • 论文arXiv:后门、投毒与隐私

    研究者提出用零空间投影净化 LoRA 微调 LLM 的后门

    研究者提出一种针对 LoRA 微调大语言模型的后门净化方法,通过零空间投影将攻击成功率从接近 100% 降至 10% 以下。该方法不依赖触发器先验知识、干净参考模型或对可疑参数的重新训练,而是通过数据整理与特征近似提取高保真后门方向,在每一层或每个注意力头的输入与输出通道上构造正交零空间,再将 LoRA 更新投影到该空间。作者通过一系列消融实验,将方法从文本分类的单层设置逐步扩展到生成任务的全参数 LLM,并称在降低攻击成功率的同时保留了基座模型的通用能力和适配器学到的下游技能。

  • 论文arXiv:后门、投毒与隐私

    NEEDLE:通过权重正交化移除 LLM 后门

    研究者提出 NEEDLE,一种免训练的后门定向移除方法。该方法在识别出触发词后,通过激活向量估计后门方向和拒答子空间,再依次施加权重正交化,在压制后门的同时避免改变与拒答相关的表征。NEEDLE 不需要干净参考模型,也不需要原始被投毒的训练数据。在多个模型族和多种攻击类型上的评测中,NEEDLE 取得所评估防御方法中最低的平均攻击成功率,在代码注入类攻击上为 0%,同时 KL 散度最低,能力与安全性的变化也最小。

  • 动态FAR.AI

    FAR.AI 披露 jailbreak-tuning 数据投毒攻击:GPT-4o 拒答率降至 3.6%

    FAR.AI 提出一种名为 jailbreak-tuning 的数据投毒攻击,将越狱指令混入微调数据,使 GPT-4o 的拒答率降至 3.6%,并绕过其全部现有防护。研究在 OpenAI 微调 API 上的 GPT-4o、GPT-4o mini、GPT-4、GPT-3.5 以及 8 个开源模型系列共 23 个模型(1.5B 至 72B 参数)上测试,用 QLoRA 在 0% 至 2% 的投毒率下微调 5 个 epoch。结果显示模型规模越大越易学到有害行为,但 Gemma 2 系列呈反向缩放趋势,规模越大反而越不易受投毒。作者认为 jailbreak-tuning 比普通微调更易学、所需数据更少,应成为模型部署前安全测试的标准环节。

  • 动态FAR.AI

    FAR.AI 联合创始人兼 CEO Adam Gleave 获评 Schmidt Sciences AI2050 早期职业研究员

    FAR.AI 联合创始人兼 CEO Adam Gleave 入选 Schmidt Sciences 的 AI2050 早期职业研究员。本届共有来自 8 个国家、42 家机构的 28 位研究者获得总额超 1800 万美元资助,该计划由 Eric Schmidt 与 James Manyika 共同主持,聚焦确保先进 AI 安全且有益于人类的关键问题。Gleave 将领导开发检测并消除先进 AI 系统中隐藏不良行为的技术,通过红队/蓝队方式先在模型中植入复杂隐蔽行为再研发识别与清除工具,应对恶意攻击者在模型中插入后门以及无意的 AI 失准风险。

  • 动态Datadog Security Labs

    Datadog 静态分析 Shai-Hulud 开源框架源码,还原 TeamPCP 供应链攻击全貌

    Datadog Security Labs 对 5 月 12 日短暂出现在 GitHub 上的 Shai-Hulud 攻击框架源码做了静态分析,发现这是一套模块化 TypeScript/Bun 工具包,覆盖凭证窃取、供应链投毒和加密外泄,与 TeamPCP 此前被归因的 22 项 TTP 中 19 项吻合。框架通过 BASH/Python/Node 加载器引导执行,扫描 100 多个敏感文件路径并读取整个 process.env,还通过 /proc/<pid>/mem 读取 GitHub Actions Runner.Worker 内存以绕过密钥掩码。数据经 AES-256-GCM 加密、RSA-4096-OAEP 封装后,优先外泄到 git-tanstack[.]com,失败时改用 GitHub 仓库作加密死信箱,并用签名提交检索备用 C2 域名。

  • 动态Datadog Security Labs

    Cemu 官方 GitHub Release 被植入后门,与 TanStack、Mistral 供应链攻击同源

    Datadog Security Labs 发现,5 月 11 日一场协同供应链攻击在五小时内污染了 npm 和 PyPI 上 170 个合法软件包,包括 @tanstack/react-router 的恶意版本和 PyPI 上的 mistralai==2.4.6;调查中进一步发现 Cemu 官方 GitHub Release 页面上的 Linux 资产也被替换为带后门的版本。Cemu-2.6-x86_64.AppImage 内嵌了与 npm 攻击中 transformers.pyz 字节完全一致的 startup.pyz,该文件在合法 Cemu 构建中并不存在。Cemu 维护者 Exzap 确认 MangelSpec 是长期共同作者,其账号或 token 遭入侵,并已移除其仓库访问权限。Ubuntu 版本还加入 /tmp/.transformers 标记文件实现两阶段执行以规避沙箱检测。

  • 动态Datadog Security Labs

    GuardDog 3.0 发布:全新规则引擎、透明沙箱及更多更新

    Datadog Security Labs 发布开源恶意软件扫描器 GuardDog 3.0,将源码启发式检测从 Semgrep 迁移到基于 yara-python 运行的 YARA 规则,并引入风险评分引擎与新规则集。该引擎综合最大严重度、攻击链完整度、特异性和复杂度四个因子加权打分,满分 10 分,取代此前逐条罗列匹配项的做法。新版还用 nono 沙箱隔离扫描进程以防社区报告过的任意文件读写乃至远程代码执行类问题,同时改进控制台输出。

  • 动态Datadog Security Labs

    AsyncAPI 四个 npm 包遭 CI 供应链攻击投毒,含凭证窃取后门

    Datadog Security Labs 披露,2026 年 7 月 14 日 @asyncapi 命名空间下四个 npm 包被植入恶意代码,合计每周下载量超过 300 万次,受影响版本为 @asyncapi/generator 3.3.1、@asyncapi/generator-components 0.7.1、@asyncapi/generator-helpers 1.1.1 和 @asyncapi/specs 6.11.2(含 6.11.2-alpha.1)。随后攻击者用该账号推送恶意提交,由正常 CI 流水线发布带毒版本,npm provenance 显示其由 GitHub Actions 构建签名。

  • 动态Check Point Research

    JSCeal 编译版 V8 字节码的静态去混淆分析

    Check Point Research 公开了针对加密货币窃取器 JSCeal 的纯静态去混淆流水线,可在不执行恶意代码的情况下还原其编译后的 V8 字节码(.jsc)载荷,工具包已以 jsc_deobfuscator 名义发布。JSCeal 自 2025 年初被持续追踪,载荷经 javascript-obfuscator 处理,采用 RC4 加密字符串、控制流平坦化、代理函数与操作包装等多重混淆,再由 Node.js 运行时执行。研究扩展了 View8 反编译器,加入值传播、字符串重建、控制流还原等处理,还原出键盘记录、浏览器与凭据窃取,以及通过本地 MITM 代理拦截 HTTPS 流量的能力;近期样本还出现面向更新 Node.js/V8 版本的代码缓存、额外载荷加密层与 macOS 目标。

  • 动态Datadog Security Labs

    ChainDrop 蠕虫入侵数百个热门 npm 包并植入后门

    Datadog Security Labs 披露,2026 年 8 月 4 日有攻击者入侵数百个 npm 包并借此传播后门,部分包周下载量超过 1.5 亿次,社区将该蠕虫命名为 ChainDrop。攻击者先在 keyv 仓库植入恶意提交,随后扩散到 jaredwray/cacheable、jaredwray/ecto 等项目,已确认的恶意版本包括 [email protected]、[email protected] 以及 cacheable 系列共九个版本。载荷通过 preinstall 脚本启动 setup.mjs,下载或调用 Bun 运行第二阶段,在非 CI 环境下脱离父进程常驻,收集文件、环境变量、GitHub Actions runner 内存、AWS、Kubernetes 和 Vault 中的凭证,再经 AES-256-GCM 加密后外传。