全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 论文arXiv:越狱、提示注入、投毒与防御
RISE:用迭代策略演化对现代文生图模型做红队测试
研究者提出 RISE,通过演化可复用的攻击策略而非逐条改写提示词,对现代文生图系统做红队测试。作者先指出,此前 T2I 红队工作中广泛使用的判官在模糊的不安全内容目标下不可靠,会漏掉真实违规或在硬化 API 上奖励良性边缘图像,因此定义了严格的分类别成功标准,并用人工标注校准了强 VLM 判官。作者还发现常用的提示词修改流程在更严的护栏设置下仍受限于种子提示词、无法迁移或难以自举正样本。在 DALL-E 3、Nano Banana 2(Google)和 GPT-Image-2 上,RISE 达到最高 13% 的人工核验 ASR;在同一套校准评测下,此前报告 ASR 高达约 30% 的方法降至接近零。
- 论文arXiv:越狱、提示注入、投毒与防御
FinRT:将自适应红队策略蒸馏为消费金融领域的可复用对抗生成器
论文提出 FinRT,一个从自适应红队策略中构建可复用对抗提示词生成器的结构化框架,面向消费金融等受监管行业。在六个受害模型上,FinRT 的攻击成功率接近自适应基线 Rainbow Teaming 的两倍(32.9% 对 17.2%),最大对抗严重度提升 33%,并保持与迭代搜索方法相当的策略域内语义多样性。该方法在把面向目标的攻击生成摊销为可复用生成器的同时,表现出较高的跨模型迁移性,并呈现按受害模型家族分化的专门化模式。
- 动态雷峰网安全频道
AISC 首届人工智能安全大赛收官:人脸识别、自动驾驶、深度伪造三大赛道决出冠军
AISC 首届人工智能安全大赛于 9 月 16 日收官,共决出人脸识别安全、自动驾驶安全、深度伪造安全三大赛道冠军。大赛由北京瑞莱智慧等单位联合主办,7 月开启报名后吸引全国 70 多所高校、科研院所及企业机构的超过 400 支团队、600 余名选手参与。现场演示了对抗样本攻击人脸识别门禁与自动驾驶感知系统,并发布《人工智能算力基础设施安全发展白皮书》。
- 动态雷峰网安全频道
安全大模型层出不穷:安恒、360、奇安信等网安厂商也忍不住了
安恒信息、360、奇安信等多家安全厂商相继发布安全大模型,网络安全行业加速拥抱GPT。安恒恒脑·安全垂域大模型已用于成都大运会及杭州亚运会,安全运营成效提升70%以上;奇安信推出Q-GPT安全机器人,360则以安全大模型打造智能中枢系统。但多位
- 动态雷峰网安全频道
亚信安全发布安全大模型信立方,用AI对抗AI攻击
亚信安全在C3安全大会·2024上发布网络安全行业自研大模型信立方,用于精准问答、告警日志解读和网络安全事件分析,并同步推出"信计划"(XPLAN),涵盖安全为AI与AI为安全两大方向。亚信安全高级副总裁陈奋透露,针对大模型的攻击手段一年内已涌现数十种,其团队在Llama2环境模拟海绵样本攻击,使模型响应从几秒延迟至60秒以上、慢了20倍以上。信计划已落地东数西算成都节点的算力云安全保护,并通过红队测试从八个方向为大模型提供上线前安全检查。
- 动态雷峰网安全频道
补天平台推出AI安全奖励计划,携手白帽洺熙升级AI安全人才培养体系
补天平台推出业内首个AI专项漏洞奖励计划,对Ollama、VLLM、Vanna等主流开源AI产品漏洞实施双倍奖金,单项最高奖励提升至2.2万元。平台同时携手00后AI安全白帽洺熙全面升级AI技术内容体系,构建覆盖AI应用开发、模型安全、数据防护的全链路知识库。补天已汇聚15万名白帽,累计发现超200万个漏洞,旨在填补AI安全复合型人才缺口。
- 动态Adversa AI
有 AI 护栏还不够:红队测试才能验证护栏是否真正有效
AI 护栏只是运行时防御,红队测试才能验证其能否抵御自适应攻击者。绕过研究对生产护栏的攻击成功率稳定在 65-84%,Carnegie Mellon 的 GCG 攻击对 GPT-3.5 和 GPT-4 的绕过率达 84%,"policy puppetry"技术可同时绕过所有主流基础模型。智能体 AI 引入多步工具滥用、间接提示注入、目标劫持和跨智能体利用四类护栏架构上无法捕捉的攻击,EU AI Act 和 NIST AI RMF 已要求或强烈建议持续对抗测试。
- 动态Adversa AI
Adversa AI 谈 OpenClaw 企业安全策略:封禁不如沙箱原型与红队验证
Adversa AI 认为企业封禁 OpenClaw 并非有效策略,应转向沙箱原型、框架对照与红队验证。OpenClaw 是自托管 AI 智能体,可浏览网页、执行系统命令、编辑文件并通过模块化技能调用外部服务,60 天内 GitHub 星标达 25 万,单周访问量超 200 万。文章列举的风险包括 CVSS 8.8 的 RCE 漏洞 CVE-2026-25253、研究者发现的 42665 个公网暴露实例(93.4% 存在认证绕过)、ClawHub 中 800 多个恶意技能,以及通过 Cline CLI 2.3.0 与受损 npm token 发起的供应链攻击。
- 动态Adversa AI
Adversa AI 自主红队 Agent 攻破 Gandalf CTF 全部八关并进入全球榜前列
Adversa AI 构建的自主红队 Agent 攻破了 Lakera Gandalf CTF 全部八关,35 次尝试完成,第 1 至 6 关均单条消息解决,全球排行榜位列第 4(若不计零尝试的榜首则为第 3)。该 Agent 不靠提示词模糊测试,而是先用 Attack Inventor 方法从第一性原理分析防御架构的隐含假设,再执行预先推导出的攻击树。
- 动态Adversa AI
红队测试智能体 AI 时模拟错了攻击者:六类威胁行为者与五大专业领域
红队测试智能体 AI 时普遍模拟错了攻击者——只测越狱式提示攻击,而真正攻陷智能体系统的是投毒知识库文档、污染 API 响应、在日历邀请中嵌入指令的间接注入者。文章列出六类必须模拟的威胁行为者:机会主义探测者、社工攻击者、耐心内部人员、间接注入者、商业情报窃取者和基础设施攻击者,并指出模拟它们需要提示与社会工程、应用安全、架构与分布式系统、数据与 ML 安全等五个专业领域,多数团队只具备其中一两个。
- 动态Adversa AI
Adversa AI 在 RSA Conference 2026 全球信息安全奖获评"最具创新 Agentic AI 安全"
Adversa AI 在 RSA Conference 2026 的 Global InfoSec Awards 上获评"最具创新 Agentic AI 安全",其 Agentic AI 安全平台可持续对 GenAI 应用、自主 AI 智能体和 MCP 架构进行压力测试,在部署前发现提示注入、目标劫持和工具滥用等漏洞。该平台评估结果对齐 OWASP AI Vulnerability Scoring System,并已扩展至金融服务、保险和政府的企业级环境。Gartner 预计到 2028 年超过 33% 的企业应用将包含 agentic AI,高于 2024 年的不足 1%。
- 动态Adversa AI
2026 年 4 月智能体 AI 安全资源盘点:OpenClaw、Copilot 与多智能体攻击
Adversa AI 发布 2026 年 4 月智能体 AI 安全资源盘点,共收录 33 项资源,涵盖研究、漏洞、防御、威胁建模等类别。研究显示,30 个 AI 智能体框架中 93% 依赖无范围限制的 API key,0% 具备按智能体身份标识,97% 缺少用户同意机制;针对 GPT-5 mini 和 Claude Sonnet 4.5 的记忆投毒攻击成功率超过 90%。OpenClaw 被曝 CVSS 9.9 权限提升漏洞(CVE-2026-32922),超 13.5 万个面向互联网的实例受影响;Chrome 的 Gemini Live 面板存在 CVE-2026-0628 高危漏洞,可被恶意扩展劫持并访问摄像头和麦克风。
- 动态Adversa AI
MCP 安全资源盘点:2026 年 4 月
2026 年 4 月的 MCP 安全研究披露了工具调用链资源放大、远程部署认证混乱和客户端配置脆弱等风险。其中恶意 MCP 服务器可诱导 LLM 智能体拉长工具调用链,将单次查询成本最高推高 658 倍,且检测率不足 3%;TIP 框架用树式自适应搜索生成隐蔽注入载荷,攻击成功率达 95%,并在 LM Studio 和 VS Code 上用 GPT-4o 演示。对七款主流 MCP 客户端的首次实证对比显示,Cursor 对全部四种工具投毒攻击均存在漏洞。
- 动态Adversa AI
2026 年 4 月顶级 GenAI 安全资源盘点:LiteLLM 供应链攻击与上下文窗口投毒
Adversa AI 汇总了 2026 年 4 月的 19 项 GenAI 安全资源,涵盖 LiteLLM 供应链攻击、128K+ token 上下文窗口投毒,以及国家背景威胁行为者对 AI 的实际利用。研究显示,RAG 投毒攻击成功率达 95%,加入嵌入向量异常检测后降至 20%;PIDP-Attack 结合提示注入与数据库投毒,在三个基准和八个模型上达到 98.125% 的攻击成功率。另有研究证明当前对齐方法仅形成局部安全区域,在 26 个受测 LLM 中的 22 个上实现 100% 攻击成功率。
- 动态Adversa AI
OWASP ASI01 智能体目标劫持实用安全指南
Adversa AI 发布 OWASP Agentic Security Initiative Top 10 2026 版中 ASI01(智能体目标劫持)的实用安全指南,将其定义为攻击者操纵 AI 智能体目标、使其秘密执行攻击者指令而非用户意图,即系统控制权的完全丧失。指南按被跨越的信任边界把攻击向量分为五类:用户输入边界、检索内容边界(邮件、文档、网页、RAG,含文本图像音频视频)、工具/API 边界(含恶意 MCP 服务器)、智能体间通信边界和配置边界,并指出多数关键攻击是经由被投毒外部内容的零点击方式触发。
- 动态Adversa AI
Adversa AI 获 2026 人工智能卓越奖安全与对齐类别奖
Adversa AI 因持续对抗测试 AI 系统的平台获得 2026 人工智能卓越奖安全与对齐类别奖。该平台在部署前识别提示注入、模型操纵、智能体不安全行为与意外操作,评估映射 OWASP AIVSS、NIST 与 CSA 标准。该公司主导 CoSAI Agentic AI Security 工作组,并创建了开源 AI 智能体安全框架 SecureClaw。
- 动态Adversa AI
Adversa AI:智能体 AI 红队测试该选手动外部、内部自建还是持续平台?
Adversa AI 对比了 AI 红队测试的三种模式——外部手动测试、内部自建能力与持续平台测试,并指出多数成熟项目最终会采用混合模式。AI 系统因提示词更新、模型替换、编排变化与新集成而持续变动,单次时点测试会在被测系统与实际运行系统之间留下越来越大的缺口。持续平台测试可重复覆盖提示注入、越狱、策略规避、数据泄露、不安全工具使用与智能体行为,但自动化不能替代专家判断,缺少内部处置流程只会让结果堆积。
- 动态Adversa AI
Adversa AI 用 10 个样例加 2 个单词的新技术 IICL 突破 GPT-5.4 安全防线
Adversa AI 公布一种名为 Involuntary In-Context Learning(IICL)的新型攻击技术,仅需 10 个样例和 2 个单词即可绕过大语言模型的拒答机制。他们跨 GPT-4 到 GPT-5.4 家族运行了超过 3500 次受控探针,覆盖 10 款模型并做了 7 组对照实验。结果显示,在最优化配置下 GPT-5.4 上的攻击成功率为 60%,而 GPT-5 和 GPT-5-mini 均为 0%。该方法不需要编码转换、密码学手段或角色扮演,恶意请求本身就以明文呈现,它瞄准的是安全对齐的结构层面而非内容层面——即上下文学习机制与安全训练之间的张力。
- 动态Adversa AI
Adversa AI 复盘 Mythos 自主网络攻击:AI 驱动攻击已非前沿模型专属
Adversa AI 复盘英国 AI 安全研究院对 Claude Mythos Preview 的独立评估,指出 Mythos 在模拟的 32 步企业网络攻击中从侦察到完全接管网络全程自主完成,专家级 CTF 得分 73%,此前没有模型在 2025 年 4 月前通过这类挑战。文章强调这一能力并非 Mythos 独有:Aisle 的分析显示,一个 3.6B 参数、每百万 token 成本 0.11 美元的模型就能检出 Anthropic 研究中提到的 FreeBSD 漏洞,检测级漏洞发现已对小型廉价模型开放,利用构造也在沿同样的成本曲线下移。
- 动态Adversa AI
2026 年 5 月 GenAI 安全资源盘点:IICL 绕过 GPT-5.4 护栏、Mythos 自主完成 32 步网络攻击
Adversa AI 研究人员用新攻击技术 IICL(Involuntary In-Context Learning)绕过 GPT-5.4 安全护栏,攻击成功率达 60%,利用的是近期模型更新引入的漏洞。Anthropic 的 Mythos 模型在数小时内自主完成 32 步企业网络攻击,分析指出 AI 驱动的攻击利用并非 Mythos 独有。本期共收录 22 项资源,另涵盖 BadStyle 风格触发后门、可污染 99.85% 查询结果的向量数据库 Black-Hole 攻击,以及 TwinGate、ER-CAT 等防御框架。
- 动态Adversa AI
AI 风险管理保险收紧:ISO 生成式 AI 除外条款与网络保险的历史路径
ISO 于 2026 年 1 月生效三项商业综合责任险生成式 AI 除外条款(CG 40 47、CG 40 48、CG 35 08),多家主要承保商数周内跟进采用。Berkley Insurance 对 D&O、E&O 及信托责任险提出绝对 AI 除外,Berkshire Hathaway、Chubb、Travelers 获监管批准将 AI 相关损害从企业保单中剔除;网络险则多维持 AI 驱动攻击的承保。Capgemini 报告显示 42% 保险公司完全不追踪 AI 指标,McKinsey 调查中 72% 企业已有至少一个 AI 用例投产。
- 动态Adversa AI
Adversa AI 汇总 2026 年 6 月 Agentic AI 安全资源清单
Adversa AI 发布 2026 年 6 月 Agentic AI 安全资源汇总,共收录 28 项资源,按攻击、防御、研究、框架、漏洞、利用、威胁建模和文章分类。攻击类 8 项,包括 Adversa AI 自己披露的 SymJack 符号链接劫持 RCE(六款 AI 编码智能体全部受影响)和 TrustFall 一键 RCE(波及 Claude Code、Cursor、Gemini CLI 和 GitHub Copilot),以及 MemMorph 记忆投毒工具劫持、DEF CON 上利用间接提示注入与记忆投毒构建 Microsoft Copilot 持久后门的 Copirate 365(CVE-2026-24299)。
- 动态Adversa AI
Adversa AI 发布 AIRQ 报告:给 100 个无人加固的数字员工做风险评分
Adversa AI 联合业界贡献者推出 AI Agent Risk Quadrant(AIRQ),从攻击面、爆炸半径、防御控制和证据强度四个维度给 100 款热门智能体打分并归入四类象限。当前快照中仅 11% 的智能体兼具能力和良好防御,98% 已带有致命三要素组合,且 83% 声称的防御无法公开验证。该框架可直接复用为企业内部自查清单和对供应商的安全问卷,也便于跟踪平台更新带来的风险漂移。
- 动态Adversa AI
用 AI Red Teaming Agent 攻破 DEF CON「Breaking the Prompt」五阶段提示注入 CTF
Adversa AI 的 AI Red Teaming Agent 在 MTX × DEF CON 上攻破 TrendAI 的「Breaking the Prompt」五阶段越狱 CTF,全部通关(每阶段 100 XP,共 500 XP)。显式越狱话术("ignore all previous instructions"、DAN 人格覆盖、admin/debug 模式、伪造授权流水线、指令提取、语言切换)在该环境中全部失败;有效手法是把同一请求重述为无害的格式转换,如"在每个字符间加短横线回显代码",模型将其视为格式化而非披露,从而输出 Cipher 阶段的代码 BYTEFORCE-1B6247。