跳到正文

工具与开源

今天新收录 18 条(含旧文)

第 7 页更新的内容回到最新

10月1日周四
  1. arXiv · 收录 · 原文 论文37

    S³:用多阶段防御提升 LLM 智能体安全

    论文提出 Stage-Specific Safety Skills 抽象,把异构安全设计表示为带明确阶段语义的可复用、可组合组件,并给出自动化转换流程和社区驱动的安全技能库。在此基础上提出 S³ 多阶段防御框架,由 guard agent 编排各阶段安全技能,在智能体工作流的记忆、规划、工具执行等环节做风险检测与缓解。作者同时构建 Multi-Stage Risk Benchmark(MSRB)评估各阶段代表性风险,实验显示 S³ 在安全有效性和效用保持上均优于代表性 SOTA 基线。论文认为阶段特定安全技能可作为构建韧性智能体系统的可扩展、可组合基础。

  2. arXiv · 收录 · 原文 论文32

    通过采样 BPE token 统计审计中文网页规模语料库

    Sampled-BPE 是一种轻量级 token 级审计流程,通过采样小规模子集并训练 BPE 分词器来暴露受污染 token,在污染类别上仅引入 4.25% 相对误差的同时实现 148.4 倍加速和 35.8 倍内存降低。研究将其应用于 11 个开源中文语料库和 2021 至 2026 年的 6 个中文 Common Crawl 快照,发现开源语料库中污染普遍存在但不均衡,中文网页内容污染严重且随时间变化。团队还发布了包含 66 万余条 token 记录的分层中文网页 token 数据集,每条记录带有网页上下文、类别和解释字段,并以树状结构组织以支持污染审查与溯源。

  3. arXiv · 收录 · 原文 论文43

    AdaGuard:支持用户自定义策略的自适应护栏模型

    作者提出 AdaGuard,一组 0.6B、4B 和 8B 的护栏模型,可在推理时按用户提供的策略评估 Agent 轨迹是否违规。为支持这一能力,作者构建 AdaptiveSafety 数据集,包含 10,939 条训练样本和 1,000 条测试样本,覆盖 1 至 100 条规则的策略,并结合策略与行为反事实,为每条样本配解释和完整违规规则集合。训练方法 SafePO 是一种强化学习算法,用结构化奖励评估预测正确性,在响应层面保留组相对优势,并用单独训练的价值模型调节解释与判定区域的 token 权重。4B 模型在 AdaptiveSafety 上二分类准确率为 89.30%,在 DynaBench 上为 71.82%。

  4. arXiv · 收录 · 原文 论文24

    SyzHarness:用 LLM 合成模糊测试 harness 复现 Linux 内核补丁漏洞

    SyzHarness 结合 LLM 推理与覆盖率引导模糊测试,从补丁出发复现 Linux 内核漏洞:LLM 智能体借助代码导航工具合成参数化 fuzzing harness,固定前置设置逻辑,只把不确定的 bug 关键输入参数交给 Syzkaller 变异,再通过分层可达性反馈迭代优化。在 100 个 KernelCTF 案例上复现成功率达 78%,在 SyzDirect 基准上达 73%,明显优于此前的定向灰盒模糊测试;对 2026 年 3 月后修复的 50 个 syzbot 已知可触发 bug,仅凭修复提交即复现 40/50(80%)。

  5. arXiv · 收录 · 原文 论文47

    Harbor Adapters 与 Harbor-Index:面向大规模 Agent 评测的基础设施与精选元数据集

    论文提出 Harbor Adapters,一套面向 Agent 基准的统一评测基础设施,并发布精选元数据集 Harbor-Index。作者开发基准适配器,将 80 余个基准接入以评测任意 Agent,并通过严格代码审查与一致性实验验证。团队在 54 个基准上对 8 个不同能力层级的模型做了大规模评测,每个模型分别用 Terminus-2 和 3 种原生 harness 之一运行。

  6. arXiv · 收录 · 原文 论文22

    VStress:面向重复验证器的相关性感知审计与自适应预算分配

    VStress 是一套可审计的重放契约,其 VStress-CA 策略在密封校准集上估计未查询验证器的条件边际信息,按调用成本归一化,并在下一次调用无信息量时停止或弃权。在 35% 对称污染下,majority-5 将平衡准确率从 0.6578 提升至 0.7739,而在 65% 污染下反而损失 0.1226 点。匹配固定预算对比中,广度、冗余与自适应分配分别取得 0.6048、0.6375 和 0.6538 的平衡准确率,VStress-CA 每项调用 3.4216 次,RLVR 得分为 0.6417。

  7. arXiv · 收录 · 原文 论文46

    HazardAuditor:面向计算机使用 Agent 的执行级安全护栏框架

    HazardAuditor 是一个执行级安全框架,用于为计算机使用 Agent 提供护栏监督。现有护栏模型面向静态提示词与回复,难以适配 Agent 执行过程;现有可执行安全平台只产出评测结论,无法提供跨框架训练所需的归一化监督。该框架在受控环境中运行 Claude Code、Codex、Hermes 和 OpenClaw 等异构 Agent,把交互归一化为统一事件表示以支持跨框架监督。作者指出 token 级后训练目标会让较长的理由文本主导梯度更新,并提出 Guard Policy Optimization(GuardPO),将确定性安全结果转为序列级优势并归一化理由与判定区域,使安全决策成为优化单元。

  8. arXiv:危险能力与安全评测 · 收录 · 原文 论文25

    安全强化学习评测指标:SafeRLEval 开源评测套件

    安全强化学习现有基准多以平均安全性报告结果,无法反映安全边界被违反的频率与严重程度、跨任务与跨安全边界的一致性,以及训练期行为能否代表最终收敛策略。为此研究者提出一组安全 RL 评测指标与安全分级(safety tier)体系,并在多个安全导航任务上开展实证评测,结果显示聚合指标、分布化报告和任务/安全边界特定结果各自揭示其他指标无法提供的信息,建议三者联合报告而非压缩为单一数值。团队同时开源了评测套件 SafeRLEval。

  9. arXiv:危险能力与安全评测 · 收录 · 原文 论文18

    Djinnlang:用 LLM 编译器实现无歧义规格的高级编程

    Djinnlang 是一种只写规格、不写可执行代码的高级规格语言,由 LLM 在编译器内填充实现与证明。它要求 LLM 除证明实现满足规格外,还须证明满足该规格的任意其他实现在相同输入下输出相同,即约束关系是确定性的,从而不给程序语义留任何余地。其符号翻译器将规格降为 Dafny 桩与证明义务,由驱动框架调度 LLM 补全,全部经 Dafny 验证器检查;该语言已实现自举,LLM 可依规格实现 Djinnlang 翻译器且重实现能自验证。

  10. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文43

    Agent Incident Registry 发布 487 条 AI Agent 事件记录

    研究者发布 Agent Incident Registry(AIR),一个带来源链接的 AI Agent 事件目录,收录 2022 至 2026 年披露的 487 条记录,每条包含支撑证据、稳定标识符,以及因果角色、披露类别、机制和结果等标注。在 336 条智能体实际行动的生成式系统记录中,81 条涉及已实现伤害,占 24%;已实现结果集中在真实环境与安全失败记录中,而负责任披露和研究演示多为演示性质,因此总体比例反映的是收录构成而非部署风险。初步整理后由第二位人工审核者复核全部 487 条记录及其标签。

  11. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文17

    面向企业智能体持续部署的 Agentic Company OS:认知基座反转

    一篇立场论文提出,企业 AI 智能体演示成功却难以长期运行,根源在于其推理所依赖的数据是为人类操作者而非语言模型组织的。作者主张围绕匹配推理界面的表示重建"认知基座",将 schema 转换隔离到动作边界,并以 Markdown 作为当下可用的实例。论文提出 Data、Knowledge、Intelligence、Governance 四层框架,由 Sync Agent 执行动作边界与逐技能信任梯度,并分析了编译路径上的间接提示注入等风险。

  12. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文42

    论文:工具调用成功但工作流失败,智能体与工具边界的八类异常

    论文提出效应历史模型,把外部世界发生的事件与运行时对事件的观察区分开,并归纳出八类反复出现的外部效应异常。在重试、推测执行、并发和部分失败下,必需效应可能缺失或重复、已中止的效应可能残留、已提交的效应可能依赖随后被撤回的临时状态。作者据此推导出排除每类异常所需的边界能力,并指出仅靠黑盒工具调用无法提供通用保证的四个位置。随后作者测量了已注册 MCP 服务器暴露的 98291 个工具对标准注解词汇的使用情况,发现这些字段被广泛输出,但只提供粗粒度的调用级提示,所需能力无一能被完整表达,因此提出在工具边界引入可复用的交易契约。

  13. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文8

    EvoOntology:面向数据智能体的自演化本体层

    EvoOntology 将本体封装为包含 schema、内容与工具三层的 MCP server,让数据智能体在运行时主动查询本体,以弥合异构数据与智能体之间的 agent-data gap。系统引入 builder agent 自主构建本体,并通过归因引导的类型化编辑与骨干条件配对评估驱动的自演化循环持续精炼本体。在三个数据智能体基准和四个 LLM 骨干上,EvoOntology 一致优于强基线及现有语义层方法。

  14. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文15

    DriveMCP:面向高级驾驶辅助系统的智能体 AI 框架

    DriveMCP 是一个面向高级驾驶辅助系统的智能体 AI 框架,将感知、合规推理、车辆状态解读与安全仲裁整合为模块化、可审计的流水线。它以 DriveLM 作为视觉语言前端生成图结构场景理解,并通过 MCP 服务器协调规则、天气与 CAN/OBD 遥测三类专家,输出经 RSS 式护栏仲裁的决策。在 CARLA 的多语言、跨境与动态限速场景中,DriveMCP 相比 VLM-Direct、VLM-Direct+RAG 和 VLM-Tools-NoArbiter 基线减少了交通违规与超速,改善了危险响应时间,并保持亚秒级建议延迟。

  15. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文34

    PentestChain:面向免费层 LLM 的成本感知 MCP 编排自动化渗透测试框架

    PentestChain 是一个十阶段自动化渗透测试框架,通过成本感知的 AI 级联(本地 Ollama qwen2.5-7b 优先,其次免费层 OpenRouter 与 Cerebras,并带规则回退)在零付费 API 成本下实现端到端运行,并以 MCP 服务器暴露 11 个工具。该框架基于 2025 年 MCP 事件记录(mcp-remote 的 CVE-2025-6514 远程代码执行漏洞、postmark-mcp 供应链后门及工具投毒类攻击)建立四位置威胁模型并提出四项缓解措施。

  16. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文15

    基于区块链的 Agentic AI 框架:面向安全软件供应链的资源优化与能耗感知

    该论文提出一个区块链支撑的 Agentic 安全框架,用于保护完整软件开发生命周期并保障负责监控的 AI 智能体本身。框架协调源码完整性、依赖与 SBOM 分析、CI 配置审计、制品验证和运行时策略评估等专用安全智能体,每个智能体由 LLM 驱动生成结构化安全报告,并通过智能合约将加密签名的证明记录到许可链的智能体注册表、不可篡改证明日志和可执行发布策略模块中。智能体与区块链节点间通信由联盟运营的证书颁发机构保障,用例演示了源码安全智能体如何上链证明并触发可验证的允许/阻止部署决策。

  17. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文15

    HTN 规划作为多服务器 MCP 工具编排的协调层

    针对 MCP 仅允许 host 编排跨服务器工作流、由 LLM 编排时结果不确定且每次工具调用需一次推理往返的问题,研究者提出一种协调架构:由 HTN 规划器一次性生成可验证的跨服务器计划,再由运行时中间件在多个 MCP 服务器上确定性执行,并通过 ${context.X} 模板机制在执行时绑定跨动作数据依赖。该架构在实验室机器人、生物信息学和多尺度建模五个 HTN 域上实例化,从浏览器端计划控制器对八个在线第三方 MCP 服务器完成端到端执行。

  18. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文56

    研究审计 Agent 安全评测缺陷:工具调用中介在间接提示注入下的有效评测框架

    作者审计了一个针对工具调用型 LLM Agent 的间接提示注入(IPI)基准及其评测装置,归纳出四类缺陷:载荷静默未投递、按工具身份而非参数判定攻击成功、把误拒率与模型能力不足混为一谈、缺少审计轨迹。用同一批执行轨迹重新打分后,按工具身份判定的评分器报告 21.7% 攻击成功率,而按参数判定的真实值为 1.2%,虚高约十八倍;审计套件中 43 个攻击载荷有 39 个(91%)从未投递。修正后,此前报告攻击成功率 62.8% 的 llama3.1:8b 降至 0%(43 次攻击中 0 次得手),该模型在 41 次攻击中读到了注入内容、72% 的攻击场景完成了良性部分,但均未执行恶意指令;此前归因于 gemma4:12b 的“工具绑定障碍”也被证明是环境不匹配造成的假象。

    推荐理由作者审计了一个 IPI 基准的评测装置,量化四类缺陷对攻击成功率的影响,并给出可复用的校验框架。

  19. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文50

    Agentic Commerce Bench:衡量会花钱的智能体的欺诈检测能力

    论文提出用于衡量和降低智能体支付欺诈损失的三项成果。第一是智能体商务欺诈分类体系,把智能体推理、wire、结算通道、交易对手、委托人五个观测层级与请求级、历史级证据对应起来,记录各层级能观测到哪些攻击。第二是 Agentic Commerce Bench(ACB)基准,包含由生产数据聚合生成的二十类欺诈,涉及 1,647 个编目服务操作和 1,068 笔结算,其中六类的交易对手身份完全真实。第三是开源检测器栈 gordonguard 及离线 harness,可用于审计智能体配置、在无账号情况下重放恶意交易对手,并以内联方式运行同一批检测器。

  20. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文50

    ORBIT:基于 UK AISI Inspect 的多智能体安全评测框架

    作者提出 ORBIT,一个基于 UK AISI Inspect 构建的可配置多智能体安全与安全评测框架,用于在真实多智能体环境中联合变化攻击、防御与架构。框架允许配置通信拓扑、记忆、调度和智能体角色,支持四类威胁、四种防御策略以及非对抗性失败,基准套件覆盖浏览器使用、计算机使用、智能体编码、客服和协作分配五个场景族。核心发现是防御在不同威胁间不可迁移:在多议题编码任务中把被攻陷智能体的攻击成功率降低 60 个百分点的逐动作防御,对相互串通的智能体没有可测量的保护,且所测试的防御没有一个能泛化到全部攻击。作者还展示了安全与性能的权衡以及架构与防御效果之间的相互作用,并将 ORBIT 开源。

  21. arXiv:对齐、欺骗与监督 · 收录 · 原文 论文43

    AutoMark:让自动研究流程自主发现更优 LLM 水印方案

    AutoMark 提出一套让自动研究流程自主发现无失真水印方案的框架,作者称这是首次实现水印方案的自主发现。框架包含三部分:设定水印可靠性的严格标准(例如避免异常高的假阳性率)、用统计检验自动判断方案是否满足标准,以及从可检测性、质量和鲁棒性三个维度对水印排序的评测套件。在 GPT-6 Astra、Opus 5、Gemini-3.8 Flash 三个前沿模型上运行后,共发现 50 多种水印方案,其中若干在所有关键维度上超过此前工作。作者还对发现的方案做人工分析,把关键思路拆解为更小组件并逐一研究各组件对三个维度的影响,并指出智能体除改进已有思路外也发现了全新思路,例如将水印分数与随请求变化的随机方向对齐。

  22. 雷峰网安全频道 · 收录 · 原文 8

    补天平台推出AI安全奖励计划,携手白帽洺熙升级AI安全人才培养体系

    补天平台推出业内首个AI专项漏洞奖励计划,对Ollama、VLLM、Vanna等主流开源AI产品漏洞实施双倍奖金,单项最高奖励提升至2.2万元。平台同时携手00后AI安全白帽洺熙全面升级AI技术内容体系,构建覆盖AI应用开发、模型安全、数据防护的全链路知识库。补天已汇聚15万名白帽,累计发现超200万个漏洞,旨在填补AI安全复合型人才缺口。

  23. Adversa AI · 收录 · 原文 15

    有 AI 护栏还不够:红队测试才能验证护栏是否真正有效

    AI 护栏只是运行时防御,红队测试才能验证其能否抵御自适应攻击者。绕过研究对生产护栏的攻击成功率稳定在 65-84%,Carnegie Mellon 的 GCG 攻击对 GPT-3.5 和 GPT-4 的绕过率达 84%,"policy puppetry"技术可同时绕过所有主流基础模型。智能体 AI 引入多步工具滥用、间接提示注入、目标劫持和跨智能体利用四类护栏架构上无法捕捉的攻击,EU AI Act 和 NIST AI RMF 已要求或强烈建议持续对抗测试。

  24. Adversa AI · 收录 · 原文 20

    红队测试智能体 AI 时模拟错了攻击者:六类威胁行为者与五大专业领域

    红队测试智能体 AI 时普遍模拟错了攻击者——只测越狱式提示攻击,而真正攻陷智能体系统的是投毒知识库文档、污染 API 响应、在日历邀请中嵌入指令的间接注入者。文章列出六类必须模拟的威胁行为者:机会主义探测者、社工攻击者、耐心内部人员、间接注入者、商业情报窃取者和基础设施攻击者,并指出模拟它们需要提示与社会工程、应用安全、架构与分布式系统、数据与 ML 安全等五个专业领域,多数团队只具备其中一两个。

  25. Adversa AI · 收录 · 原文 4

    Adversa AI 在 RSA Conference 2026 全球信息安全奖获评"最具创新 Agentic AI 安全"

    Adversa AI 在 RSA Conference 2026 的 Global InfoSec Awards 上获评"最具创新 Agentic AI 安全",其 Agentic AI 安全平台可持续对 GenAI 应用、自主 AI 智能体和 MCP 架构进行压力测试,在部署前发现提示注入、目标劫持和工具滥用等漏洞。该平台评估结果对齐 OWASP AI Vulnerability Scoring System,并已扩展至金融服务、保险和政府的企业级环境。Gartner 预计到 2028 年超过 33% 的企业应用将包含 agentic AI,高于 2024 年的不足 1%。

  26. Adversa AI · 收录 · 原文 18

    2026 年 4 月智能体 AI 安全资源盘点:OpenClaw、Copilot 与多智能体攻击

    Adversa AI 发布 2026 年 4 月智能体 AI 安全资源盘点,共收录 33 项资源,涵盖研究、漏洞、防御、威胁建模等类别。研究显示,30 个 AI 智能体框架中 93% 依赖无范围限制的 API key,0% 具备按智能体身份标识,97% 缺少用户同意机制;针对 GPT-5 mini 和 Claude Sonnet 4.5 的记忆投毒攻击成功率超过 90%。OpenClaw 被曝 CVSS 9.9 权限提升漏洞(CVE-2026-32922),超 13.5 万个面向互联网的实例受影响;Chrome 的 Gemini Live 面板存在 CVE-2026-0628 高危漏洞,可被恶意扩展劫持并访问摄像头和麦克风。

  27. Adversa AI · 收录 · 原文 35

    MCP 安全资源盘点:2026 年 4 月

    2026 年 4 月的 MCP 安全研究披露了工具调用链资源放大、远程部署认证混乱和客户端配置脆弱等风险。其中恶意 MCP 服务器可诱导 LLM 智能体拉长工具调用链,将单次查询成本最高推高 658 倍,且检测率不足 3%;TIP 框架用树式自适应搜索生成隐蔽注入载荷,攻击成功率达 95%,并在 LM Studio 和 VS Code 上用 GPT-4o 演示。对七款主流 MCP 客户端的首次实证对比显示,Cursor 对全部四种工具投毒攻击均存在漏洞。

  28. Adversa AI · 收录 · 原文 15

    2026 年 4 月顶级 GenAI 安全资源盘点:LiteLLM 供应链攻击与上下文窗口投毒

    Adversa AI 汇总了 2026 年 4 月的 19 项 GenAI 安全资源,涵盖 LiteLLM 供应链攻击、128K+ token 上下文窗口投毒,以及国家背景威胁行为者对 AI 的实际利用。研究显示,RAG 投毒攻击成功率达 95%,加入嵌入向量异常检测后降至 20%;PIDP-Attack 结合提示注入与数据库投毒,在三个基准和八个模型上达到 98.125% 的攻击成功率。另有研究证明当前对齐方法仅形成局部安全区域,在 26 个受测 LLM 中的 22 个上实现 100% 攻击成功率。

  29. Adversa AI · 收录 · 原文 43

    OWASP ASI01 智能体目标劫持实用安全指南

    Adversa AI 发布 OWASP Agentic Security Initiative Top 10 2026 版中 ASI01(智能体目标劫持)的实用安全指南,将其定义为攻击者操纵 AI 智能体目标、使其秘密执行攻击者指令而非用户意图,即系统控制权的完全丧失。指南按被跨越的信任边界把攻击向量分为五类:用户输入边界、检索内容边界(邮件、文档、网页、RAG,含文本图像音频视频)、工具/API 边界(含恶意 MCP 服务器)、智能体间通信边界和配置边界,并指出多数关键攻击是经由被投毒外部内容的零点击方式触发。

  30. Adversa AI · 收录 · 原文 7

    Adversa AI 获 2026 人工智能卓越奖安全与对齐类别奖

    Adversa AI 因持续对抗测试 AI 系统的平台获得 2026 人工智能卓越奖安全与对齐类别奖。该平台在部署前识别提示注入、模型操纵、智能体不安全行为与意外操作,评估映射 OWASP AIVSS、NIST 与 CSA 标准。该公司主导 CoSAI Agentic AI Security 工作组,并创建了开源 AI 智能体安全框架 SecureClaw。

  31. Adversa AI · 收录 · 原文 15

    Adversa AI:智能体 AI 红队测试该选手动外部、内部自建还是持续平台?

    Adversa AI 对比了 AI 红队测试的三种模式——外部手动测试、内部自建能力与持续平台测试,并指出多数成熟项目最终会采用混合模式。AI 系统因提示词更新、模型替换、编排变化与新集成而持续变动,单次时点测试会在被测系统与实际运行系统之间留下越来越大的缺口。持续平台测试可重复覆盖提示注入、越狱、策略规避、数据泄露、不安全工具使用与智能体行为,但自动化不能替代专家判断,缺少内部处置流程只会让结果堆积。

  32. Adversa AI · 收录 · 原文 16

    2026 年 5 月智能体 AI 安全资源盘点:Claude Code 源码泄露与 Mythos 自主攻击

    Adversa AI 发布 2026 年 5 月智能体 AI 安全资源盘点,共收录 40 项资源,其中智能体 AI 漏洞 6 项。Claude Code 源码泄露后曝出关键漏洞:shell 命令拒绝规则在 50 个子命令后静默失效;其记忆系统存在 MemoryTrap 漏洞,可使污染记忆跨会话、跨用户传播。Anthropic 的 Mythos 模型在数小时内自主完成 32 步网络攻击,显示 AI 驱动攻击已非理论。

  33. Adversa AI · 收录 · 原文 50

    Adversa AI 汇总 2026 年 5 月 MCP 安全资源清单

    Adversa AI 发布 2026 年 5 月 MCP 安全资源汇总,共 10 项,覆盖漏洞、研究、防御、工具、威胁建模和 CISO 视角六类。其中 Anthropic 的 MCP STDIO 传输机制存在设计缺陷,可导致任意操作系统命令执行,影响所有受支持 SDK,约 20 万台服务器面临风险;nginx-ui 的 MCP 端点存在 CVE-2026-33032(CVSS 9.8),未认证攻击者可完全接管系统,目前有超过 2600 个暴露实例处于高危状态。

  34. Adversa AI · 收录 · 原文 16

    2026 年 5 月 GenAI 安全资源盘点:IICL 绕过 GPT-5.4 护栏、Mythos 自主完成 32 步网络攻击

    Adversa AI 研究人员用新攻击技术 IICL(Involuntary In-Context Learning)绕过 GPT-5.4 安全护栏,攻击成功率达 60%,利用的是近期模型更新引入的漏洞。Anthropic 的 Mythos 模型在数小时内自主完成 32 步企业网络攻击,分析指出 AI 驱动的攻击利用并非 Mythos 独有。本期共收录 22 项资源,另涵盖 BadStyle 风格触发后门、可污染 99.85% 查询结果的向量数据库 Black-Hole 攻击,以及 TwinGate、ER-CAT 等防御框架。

  35. Adversa AI · 收录 · 原文 28

    OWASP ASI02 工具滥用与利用:权威安全指南

    OWASP 将工具滥用与利用列为 2025 年 Agentic Top 10 第 2 位(ASI02),指 AI 智能体用被授予的合法权限以不安全方式调用工具,无需攻击者介入即可造成灾难性后果。Google Antigravity 于 2025 年 12 月误删整个 D 盘,Replit 助手在用户明确要求冻结改动后仍删除含 1,200+ 高管记录的生产数据库,Amazon Q 因破坏性提示词影响约百万开发者(CVE-2025-8217)。43% 的 MCP 服务器存在命令注入缺陷,防御核心是最小代理权限(Least Agency):最小授权、破坏性操作需审批、沙箱执行并校验每次工具调用。

  36. Adversa AI · 收录 · 原文 36

    Adversa AI 汇总 2026 年 6 月 Agentic AI 安全资源清单

    Adversa AI 发布 2026 年 6 月 Agentic AI 安全资源汇总,共收录 28 项资源,按攻击、防御、研究、框架、漏洞、利用、威胁建模和文章分类。攻击类 8 项,包括 Adversa AI 自己披露的 SymJack 符号链接劫持 RCE(六款 AI 编码智能体全部受影响)和 TrustFall 一键 RCE(波及 Claude Code、Cursor、Gemini CLI 和 GitHub Copilot),以及 MemMorph 记忆投毒工具劫持、DEF CON 上利用间接提示注入与记忆投毒构建 Microsoft Copilot 持久后门的 Copirate 365(CVE-2026-24299)。

  37. Adversa AI · 收录 · 原文 28

    Adversa AI 发布 AIRQ 报告:给 100 个无人加固的数字员工做风险评分

    Adversa AI 联合业界贡献者推出 AI Agent Risk Quadrant(AIRQ),从攻击面、爆炸半径、防御控制和证据强度四个维度给 100 款热门智能体打分并归入四类象限。当前快照中仅 11% 的智能体兼具能力和良好防御,98% 已带有致命三要素组合,且 83% 声称的防御无法公开验证。该框架可直接复用为企业内部自查清单和对供应商的安全问卷,也便于跟踪平台更新带来的风险漂移。

  38. Adversa AI · 收录 · 原文 50

    Adversa AI 汇总 2026 年 6 月 MCP 安全资源清单

    Adversa AI 汇总了 2026 年 6 月的 MCP 安全资源,共 10 项,按研究、漏洞、防御、框架、威胁建模和培训材料分类。Censys 统计到 12,520 个可公网访问的 MCP 服务,多数未认证;另一项测量研究显示约 40% 的远程 MCP 服务器完全不认证就暴露工具,并牵出 9 个 OAuth 流程相关 CVE。漏洞方面,VIPER-MCP 扫描约 4 万个服务器仓库,发现 106 个零日漏洞并产出 67 个 CVE;Akamai 披露 Apache Doris、阿里云 RDS 和 Apache Pinot 的 MCP 缺陷,其中一家厂商拒绝修补。

  39. Adversa AI · 收录 · 原文 41

    Adversa AI 发布 AIRQ 框架,对 100 多个 AI 智能体做安全评级

    Adversa AI 发布 AI Risk Quadrant(AIRQ)报告,称其为迄今规模最大的独立智能体 AI 安全评估,也是首个可比较的 AI 智能体安全评级,配套开源方法论与数据可在 https://airq.adversa.ai/report 获取。项目由 Adversa AI 主导,OWASP、CoSAI、CSA、NIST、Cisco、Crowdstrike 等机构人员参与贡献与评审,方法论量化攻击面、爆炸半径和防御控制,对齐 OWASP、NIST、MITRE、CoSAI、CSA 的相关指南。

  40. Adversa AI · 收录 · 原文 20

    2026 年 6 月 GenAI 安全资源盘点:越狱、CoT 攻击与百万级暴露服务

    Adversa AI 汇总 2026 年 6 月 GenAI 安全资源共 19 项,其中研究 7 项、防御 6 项、攻击 5 项、利用 1 项。研究指出对齐模型内部存在可识别的拒答逃逸方向,攻击者可将模型自身思维链变为越狱通道,降低图像分辨率即可绕过多模态安全。对约 100 万个暴露 AI 服务的扫描发现 1,652 个未认证 Ollama API 在对外提供模型,可被用于响应投毒。