全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 22 条- 动态Gray Swan AI
Gray Swan 推出 Arena 平台,并新增针对 o1 的思维链挑战
Gray Swan 在首届 Jailbreaking Championship 结束后推出社区红队平台 Gray Swan Arena,用于在受控环境中持续测量模型护栏面对公开用户时的表现。首届比赛于 2024 年 9 月至 10 月举行,共有 631 名参与者、提交 10,000 条越狱、进行 100,000 次越狱尝试,覆盖 25 个模型,奖金总额 40,000 美元。参与者可继续参加原有的 Single Turn Harmful Outputs 挑战,该挑战新增了 OpenAI 的 o1 模型。平台同时上线新挑战 Revealing Hidden CoT,悬赏 1,000 美元用于揭示 o1 的内部思维链。o1 相关挑战的报名已在官网开放,发布时间为 2024 年 10 月 29 日下午 1:00 EST。
- 动态0DIN
0DIN 开放免费 AI 安全评估:用红队武器库提前攻破你的 AI
0DIN 面向正在交付 AI 系统的团队开放限时免费安全评估,用其研究员来源的红队武器库攻击用户自有或获授权测试的模型,并给出按优先级排序的报告。评估通过 0DIN Scanner 执行,覆盖直接与间接提示注入、越狱、编码隐藏载荷、多轮攻击以及带工具智能体的数据泄露与错误调用等失效方式,云端模型走 API、自托管模型用容器化 Scanner 在本地网络内运行,报告通常一两天内交付。报告包含安全评级与风险等级、可长期跟踪的攻击成功率(ASR)、分类发现、与前沿模型的对比及修复建议,并映射到 OWASP LLM Top 10、MITRE ATLAS、NIST AI RMF、ISO/IEC 42001 和 EU AI Act 等框架;该评估基于 NVIDIA 开源 garak 引擎并叠加 0DIN 的赏金探针库,每次评估均经人工把关。
- 动态0DIN
如何在五分钟内为 LiteLLM 接入 0DIN Defense
0DIN 发布 litellm-shield 插件,可将护栏分类器 SusFactor 作为 LiteLLM 代理的自定义护栏运行,安装一条 pip 命令即可在 flag 模式下启用。SusFactor 对每个提示词打分以拦截提示注入和越狱,支持 block、flag(默认)、shadow 三种模式,并接入 Langfuse、Datadog、OTel 等可观测性栈。它挂载在 during_call 阶段与模型调用并行执行,分类器中位延迟约 15.6ms、P95 23.9ms、P99 26.5ms,全部在 CPU 上运行,默认失败开放。
- 动态tl;dr sec
tl;dr sec 第345期:漏洞传闻即被利用、版本控制 DFIR 与自适应 Agent 蠕虫
tl;dr sec 第345期汇总了多条 AI 与安全交叉动态。Anil Madhavapeddy 为 OCaml 的 cohttp 6.3.0 提交路径遍历修复后十分钟内,就有探测流量以相同漏洞模式访问其服务器;他先用 Claude 分析代码被安全拦截拒绝,改由 DeepSeek V4 Pro 仅凭模糊描述在一分钟内写出利用代码,说明仅凭传闻就足以让 Agent 自行找到漏洞,利用时间已早于补丁发布。Wiz 发布覆盖 GitHub、GitLab、Bitbucket 和 Azure DevOps 的版本控制 DFIR 海报,指出 GitHub 仅保留 Git 事件 7 天、GitLab 默认不记录 Git 操作、只有 GitHub 提供 API 请求日志且需显式配置,且这些遥测都不追溯。
- 论文arXiv:越狱、提示注入、投毒与防御
ACEA:面向红蓝队对抗的 LLM 协同演化测试平台
研究者提出 ACEA(Adversarial Co-Evolution Arena),一个把可插拔红队适配器与蓝队适配器接到同一靶标 LLM 上、由 LLM judge 对攻防成功率打分的对抗协同演化平台。平台通过最小化的 HTTP 协议 ACEA Standard Adapter Protocol(ASAP)接入任意语言编写的红队或蓝队项目,只暴露该协议即可成为完整参与者。评测方法上,向靶标注入规范化的秘密作为可验证真值,以区分真实泄露与模型幻觉;即使防御拦截了攻击,也仍把攻击发给靶标,从而独立测量攻击的原始效力,得到每轮攻击强度与防御有效性的分解。
- 论文arXiv:越狱、提示注入、投毒与防御
SoK 综述:智能体 AI 时代的越狱攻击、防御与实践考量
这篇 SoK 重新审视智能体 AI 时代的越狱安全,围绕用户交互、规划与推理、记忆、工具使用和智能体间通信建立攻击与防御的统一分类,并提出安全、效用、效率三维评估框架,区分原生有害提示安全、对抗性越狱鲁棒性和智能体层面的安全结果。作者在统一智能体框架内对代表性攻击与防御做了受控实证研究,发现三点缺口:强原生对齐并不意味着能抵御对抗性越狱;防御效果高度依赖模型、攻击类型和组件,且可能带来过度拒答、效用下降和延迟的显著代价;最终回复的攻击成功率低可能掩盖中间环节已被攻破,规划、记忆和工具交互在最终回复被成功过滤时仍可能不安全。
- 动态Adversa AI
2026 年 4 月顶级 GenAI 安全资源盘点:LiteLLM 供应链攻击与上下文窗口投毒
Adversa AI 汇总了 2026 年 4 月的 19 项 GenAI 安全资源,涵盖 LiteLLM 供应链攻击、128K+ token 上下文窗口投毒,以及国家背景威胁行为者对 AI 的实际利用。研究显示,RAG 投毒攻击成功率达 95%,加入嵌入向量异常检测后降至 20%;PIDP-Attack 结合提示注入与数据库投毒,在三个基准和八个模型上达到 98.125% 的攻击成功率。另有研究证明当前对齐方法仅形成局部安全区域,在 26 个受测 LLM 中的 22 个上实现 100% 攻击成功率。
- 动态Adversa AI
2026 年 5 月 GenAI 安全资源盘点:IICL 绕过 GPT-5.4 护栏、Mythos 自主完成 32 步网络攻击
Adversa AI 研究人员用新攻击技术 IICL(Involuntary In-Context Learning)绕过 GPT-5.4 安全护栏,攻击成功率达 60%,利用的是近期模型更新引入的漏洞。Anthropic 的 Mythos 模型在数小时内自主完成 32 步企业网络攻击,分析指出 AI 驱动的攻击利用并非 Mythos 独有。本期共收录 22 项资源,另涵盖 BadStyle 风格触发后门、可污染 99.85% 查询结果的向量数据库 Black-Hole 攻击,以及 TwinGate、ER-CAT 等防御框架。
- 动态Adversa AI
2026 年 6 月 GenAI 安全资源盘点:越狱、CoT 攻击与百万级暴露服务
Adversa AI 汇总 2026 年 6 月 GenAI 安全资源共 19 项,其中研究 7 项、防御 6 项、攻击 5 项、利用 1 项。研究指出对齐模型内部存在可识别的拒答逃逸方向,攻击者可将模型自身思维链变为越狱通道,降低图像分辨率即可绕过多模态安全。对约 100 万个暴露 AI 服务的扫描发现 1,652 个未认证 Ollama API 在对外提供模型,可被用于响应投毒。
- 动态腾讯 AI-Infra-Guard 版本发布
腾讯 AI-Infra-Guard v4.1.14 新增 Agent 红队技能与 9 种单轮越狱攻击方法
腾讯 AI-Infra-Guard 发布 v4.1.14,新增面向 Agent 安全的 aig-agent-redteam 技能,并加入 PrefillAttack、ICA、PastTense、Overload、Jailbroken、FlipAttack、DeepInception、CodeChameleon、JAM 共 9 种单轮越狱攻击方法及 AdvBench、CNSafe、SafeBench 三个越狱评测数据集。该版本还将调度改为轮询选择 Agent 以实现负载均衡,并在文档中补充上述数据集致谢、更新 DeepTeam 仓库地址。
- 动态SPY Lab
ChatGPT 时代的对抗样本:聊天机器人攻击为何不同于传统对抗攻击
SPY Lab 撰文指出,传统对抗样本研究的两条基本原则(扰动不可感知、依赖梯度优化)在针对聊天机器人的攻击中基本不成立。越狱攻击由用户自己发起,提示注入中的第三方文本用户通常看不到,因此攻击文本无需保持不可感知;当前最强的越狱手段是手工试错的社会工程式指令,而非优化算法。作者在近期论文中测试了 ARCA 和 GDBA 两种优化攻击,针对 GPT-2、LLaMa 和经过拒答微调的 Vicuna,结果显示优化攻击对无防御模型部分有效,但对 Vicuna 多数失败,且即使存在可触发目标输出的提示词也找不到。
- 动态SPY Lab
SPY Lab 复盘 IEEE SaTML 2024 的 LLM CTF 与后门检测竞赛
SPY Lab 为 IEEE SaTML 2024 组织了两场竞赛,分别是 LLM CTF 和针对已对齐 LLM 的木马检测竞赛,两场竞赛均与参赛者合作产出了论文。LLM CTF 分防御和攻击两个阶段,目标是检验简单提示词与过滤机制能否让 LLM 应用抵御提示注入和提取,并发布了超过 137k 条成功与失败攻击对话及 44 种防御的数据集。经验总结指出,多数防御需要数十到数百轮对话才能被攻破,单轮越狱与安全基准不足以评估模型,过滤机制很可能被绕过,且防御并非独立组件,可能泄露系统设计信息。
- 会议论文SPY LabICML 2025
SPY Lab 提出越狱税:越狱输出到底有多大用处
SPY Lab 提出越狱税(Jailbreak Tax)指标,衡量越狱成功后模型效用相对基线的下降幅度,并给出配套基准。研究先评测基座模型准确率,再自行对齐使其拒答数学和生物题,最后对对齐模型施加越狱并测量准确率,发现越狱方法造成的效用损失最高达 92%。在 LLaMA 模型上,PAIR、TAP 和微调攻击的成功率都在 92% 左右,但越狱税差异很大,说明越狱成功率与效用损失之间没有明显相关性。为贴近真实场景,作者把 GSM8K 题目改写为含炸弹、核武器等危险词但答案不变的 EvilMath,并用改写为独角兽等良性分布外概念的 UnicornMath 计算基线,发现前沿模型自带的安全机制下越狱税依然存在。
- 动态Nicholas Carlini Writing
Nicholas Carlini 给出评估对抗样本防御的建议
Nicholas Carlini 基于其 ICML 2018 最佳论文《Obfuscated Gradients Give a False Sense of Security》的演讲,整理出评估对抗样本防御的建议。他指出 ICLR 2018 接收的防御论文中超过一半结论有误、评估偏弱,核心要求是必须针对具体防御设计自适应攻击,而非只测已有攻击。具体建议包括不要只用 FGS 攻击、使用 1000 次以上迭代的迭代攻击、从随机起点搜索、做迁移性分析、使用 ZOO、SPSA、NES 和仅决策攻击等无梯度方法,以及随机搜索。
- 动态NVIDIA garak 版本发布
NVIDIA garak v0.13.1 发布:新增多种探针插件并改进检测器配置
NVIDIA garak 发布 v0.13.1,新增 Atbash 编码、tokenizer ANSI 逃逸码、Dropbox 重复 token 攻击、DRA(伪装与重构攻击)、Dart/perl/raku 包幻觉及 token 走私等多个探针模块。该版本还加入 detector 输出值为 None 的支持、将 config 中 model_* 改为 target_*、CLI 增加 --list_* 过滤选项,并修正未来类探针措辞、重命名扩展 Web 注入探针以及更正文档中的 ASR 数值。
- 动态Microsoft PyRIT 版本发布
Microsoft PyRIT v0.11.0 发布:新增 WebSocketCopilotTarget 与 30 个越狱模板
Microsoft PyRIT 发布 v0.11.0,破坏性变更将攻击与执行器从 SeedPromptGroup 改为基于 Message 运行,并重命名场景配置 API。该版本新增 WebSocketCopilotTarget,可通过 WebSocket 向 Microsoft Copilot 发送提示词执行,同时加入图像下载支持的 ImageTarget 重构及 OpenAIImageTarget 的图像编辑/混合功能。
- 动态Microsoft PyRIT 版本发布
Microsoft PyRIT v0.12.0 发布:GUI、CLI 与框架三种交互方式全部可用
Microsoft 发布 AI 红队测试工具 PyRIT v0.12.0,首次让 GUI(CoPyRIT)、CLI 和框架三种交互方式全部达到可用状态。CLI 新增 Scam、Leakage、Psychosocial、Jailbreak 四类 AIRT 场景及 RedTeamAgent Foundry 预配置红队测试,覆盖 25+ 攻击策略。框架引入 YAML 配置系统、TargetRegistry 和 8 个新数据集加载器,但含破坏性变更需按迁移指南升级。
- 动态Microsoft PyRIT 版本发布
微软 PyRIT 发布 v1.1.0,扩展扫描器与评分能力
微软开源红队框架 PyRIT 发布 v1.1.0,重点改进评分机制、扩展扫描器能力并加入 CoPyRIT 新功能,Python 支持范围仍为 >=3.10、<3.15。评分方面新增未确定分数状态,读取 score_value 或调用 get_value() 前需检查 score.is_undetermined,部分被拦截的回复默认纳入评分,可通过 should_score_blocked_content=False 恢复旧行为。扫描器新增 Best-of-N、split-payload、多语言、音频 achilles、包幻觉、system-prompt 提取和 FigStep 等能力,并加入 bijection、CharNoise、CodeAttack、SATA、Vigenere、Acrostic、IPA 等 10 个转换器。官方称本次没有已知高优先级安全问题。
- 动态腾讯 AI-Infra-Guard 版本发布
腾讯 AI-Infra-Guard v4.5.1 发布:新增多种多轮越狱攻击与 MCP 安全检测规则
腾讯 AI-Infra-Guard 发布 v4.5.1,PromptSecurity 新增 Many-Shot、PAIR、GOAT 和 ActorAttack 多轮越狱攻击。Agent-Scan 新增 5 项 OWASP 检测技能(含 agentic-supply-chain、cascading-failure、human-agent-trust、inter-agent-comm、unexpected-code-execution)及 web-exfiltration-detection 技能,MCP-Scan 新增硬编码密钥、不安全反序列化等 4 条 MCP 安全检测规则,并更新 AIG 规则至 2026-07-24。
- 动态MITRE ATLAS 数据发布
MITRE ATLAS 发布 v2026.09 数据更新,新增多项 Agent 与多模态攻击技术
MITRE ATLAS 发布 v2026.09 数据版本,包含 1 个矩阵、16 项战术、120 项技术、88 项子技术、40 项缓解措施和 73 个案例研究。新增技术涵盖多模态输入中的触发器、AI Agent 响应偏置、伪造 AI 助手链接、配置错误或公开暴露的 AI 服务、发现 AI Agent 运行时能力、AI 定向隐蔽以及针对 AI 基础设施的主动扫描等。更新了 LLM 提示混淆、间接 LLM 提示注入、LLM 越狱、LLM 响应渲染和 AI Agent 点击诱饵等技术。缓解措施新增 AI 蜜罐,更新生成式 AI 护栏。
- 动态NVIDIA NeMo Guardrails 版本发布
NVIDIA NeMo Guardrails v0.21.0 发布:新增并行执行输入/输出护栏引擎 IORails
NVIDIA NeMo Guardrails 发布 v0.21.0,引入优化后的输入/输出护栏引擎 IORails,支持并行执行 NemoGuard 的内容安全、话题安全和越狱检测三类护栏,并带日志记录与请求 ID。该版本还新增 LLMRails.check_async 方法实现独立的输入/输出护栏校验,使护栏服务器兼容 OpenAI(含新的 v1/models 端点),并通过 GuardrailsMiddleware 接入 LangChain 智能体。社区集成方面加入 PolicyAI 内容审核、CrowdStrike AIDR 及基于正则表达式的检测护栏,同时将嵌入索引初始化改为惰性加载以改善启动性能。
- 动态NVIDIA garak 版本发布
NVIDIA garak v0.14.1 发布:新增 WebSocket 生成器并移除 nemollm
NVIDIA garak 发布 v0.14.1,新增面向实时 LLM 安全测试的 WebSocket 生成器和 OpenAI Harmony 音频输入格式,并为攻击成功率加入 Bootstrap 置信区间。该版本激活 sata 与 badchars 探针、补充简历类提示注入样例、改进 Jinja 注入检测,同时移除了废弃的 nemollm 生成器及其依赖,属破坏性变更。