跳到正文

Agent 安全

智能体与工具调用带来的安全问题:权限、沙箱、数据外泄与失控行为。

1,478条动态与论文相关主题提示注入AI 控制真实事件
在这个话题内搜索或按分类筛选

新闻与论文

第 641–660 条 · 共 1,478 条
10月3日周六
  1. 0DIN · 收录 · 原文 41

    0DIN 披露通过 DNS TXT 记录对 Claude Code 实施间接提示注入获取 shell

    0DIN 展示了一种针对 Claude Code 的间接提示注入攻击:攻击者只需控制一个公开 GitHub 仓库,无需提交任何恶意代码,就能在打开该仓库的开发者机器上获得交互式 shell。仓库中的 setup 说明和脚本看起来完全正常,脚本通过 dig 从攻击者控制的 DNS TXT 记录拉取配置并直接执行,记录内容经 base64 编码后解码为反向 shell。Claude Code 读取项目文件、安装依赖、遇到 RuntimeError 后按错误提示运行 init 命令,全程自主完成,终端只显示初始化成功。攻击者可借此获取环境中的 ANTHROPIC_API_KEY、AWS_SECRET_ACCESS_KEY、GITHUB_TOKEN 等凭据,并通过改 SSH key、加 cron 任务或装后门实现持久化,还能随时修改 DNS 记录更换载荷。

  2. 0DIN · 收录 · 原文 15

    0DIN 开放免费 AI 安全评估:用红队武器库提前攻破你的 AI

    0DIN 面向正在交付 AI 系统的团队开放限时免费安全评估,用其研究员来源的红队武器库攻击用户自有或获授权测试的模型,并给出按优先级排序的报告。评估通过 0DIN Scanner 执行,覆盖直接与间接提示注入、越狱、编码隐藏载荷、多轮攻击以及带工具智能体的数据泄露与错误调用等失效方式,云端模型走 API、自托管模型用容器化 Scanner 在本地网络内运行,报告通常一两天内交付。报告包含安全评级与风险等级、可长期跟踪的攻击成功率(ASR)、分类发现、与前沿模型的对比及修复建议,并映射到 OWASP LLM Top 10、MITRE ATLAS、NIST AI RMF、ISO/IEC 42001 和 EU AI Act 等框架;该评估基于 NVIDIA 开源 garak 引擎并叠加 0DIN 的赏金探针库,每次评估均经人工把关。

  3. 0DIN · 收录 · 原文 28

    如何在五分钟内为 LiteLLM 接入 0DIN Defense

    0DIN 发布 litellm-shield 插件,可将护栏分类器 SusFactor 作为 LiteLLM 代理的自定义护栏运行,安装一条 pip 命令即可在 flag 模式下启用。SusFactor 对每个提示词打分以拦截提示注入和越狱,支持 block、flag(默认)、shadow 三种模式,并接入 Langfuse、Datadog、OTel 等可观测性栈。它挂载在 during_call 阶段与模型调用并行执行,分类器中位延迟约 15.6ms、P95 23.9ms、P99 26.5ms,全部在 CPU 上运行,默认失败开放。

  4. NIST CAISI · 收录 · 原文 55

    CAISI 评测 DeepSeek V4 Pro:能力落后前沿约 8 个月

    美国 NIST 下属 CAISI 于 2026 年 4 月评测开源权重模型 DeepSeek V4 Pro,结论是其综合能力落后前沿约 8 个月,表现与报告发布时(2026 年 5 月)已发布约 8 个月的 GPT-5 相近。评测覆盖网络安全、软件工程、自然科学、抽象推理和数学五个领域的九项基准,其中包括 ARC-AGI-2 半私有数据集和 CAISI 自建的软件工程评测 PortBench 两个未公开且未污染的基准;综合能力对比图用了 16 个基准、35 个模型的数据。DeepSeek 自报结果显示 V4 与当时发布约 2 个月的 Opus 4.6、GPT-5.4 相当,但 CAISI 在 DeepSeek 报告未包含的基准上观察到更差表现,例如 ARC-AGI-2 半私有集、PortBench 和 CTF-Archive-Diamond。

    推荐理由CAISI 用自建与半私有基准对比 DeepSeek V4 与前沿美国模型,并给出能力差距与成本差异的量化口径。

  5. NIST CAISI · 收录 · 原文 57

    CAISI 发布对 Z.ai GLM-5.2 的安全评估

    CAISI 于 7 月 8 日完成对 Z.ai(原智谱 AI)6 月 16 日发布的开源权重模型 GLM-5.2 的评估,认为它发布时可能是能力最强的开源权重模型。按 CAISI 的评测,GLM-5.2 的整体能力与 2025 年 12 月发布的 GPT-5.2 相近,网络能力与 2026 年 2 月发布的 Opus 4.6 相近。护栏与安全表现参差:其护栏会协助智能体网络漏洞利用开发,拦截的敏感生物学问题少于美国参考模型,但在抵御智能体劫持和越狱攻击上似乎比其他受评的中国开源权重模型更稳健。这些评测衡量的是对基于提示词的越狱的稳健性;无论稳健性如何,开源权重模型在自托管时其护栏都可能被绕过。

    推荐理由CAISI 对 GLM-5.2 的能力与护栏做了横向对比,并指出自托管开源权重模型的安全措施可被绕过。

  6. 腾讯朱雀实验室 · 收录 · 原文 34

    发现 33 个 OpenClaw 与 Linux 内核漏洞后,腾讯朱雀实验室从 Claude Mythos 看安全攻防下半场

    腾讯朱雀实验室蓝军 Bot 对 OpenClaw、Linux 内核等目标累计发现 33 个 0day 漏洞,其中 17 个为严重与高危漏洞,全部已提交上游修复并获官方致谢。该平台在 XBOW Security Benchmark 的 104 道题中完成 102 道(98%),超过开源 AI 渗透项目 Shannon。文章同时援引 Anthropic 联合 45 家机构发布的 Project Glasswing 计划,其未公开模型 Claude Mythos Preview 已在主流操作系统和浏览器中发现数千个 0day,并指出漏洞从发现到被利用的窗口正急剧压缩。

  7. 腾讯朱雀实验室 · 收录 · 原文 40

    腾讯朱雀实验室扫描 ClawHub 五万个 Skill,发现绕过官方检测的远程控制后门

    腾讯朱雀实验室用自研 A.I.G 对 OpenClaw 官方 Skill 市场 ClawHub 上近五万个 Skill 做全量扫描,发现第一代显性恶意样本大量消失后,伪装更深的攻击方式仍然存在。扫描发现 27,818 个 Skill 声明网络请求权限,占比 74.6%,共 246,378 条 URL 指向 29,196 个域名;五万个 Skill 来自 15,427 名开发者,Top 20 账号合计发布 5,422 个,最极端账号 3 个月发布 955 个。案例一是一个自称分布式状态恢复工具的 Skill,通过远程拉取载荷、12 种传输编码链式解码和 Python pickle 反序列化构成完整 RCE 链路,却通过了 ClawHub 的正则扫描、注入信号检测、LLM 安全评估和 VirusTotal 外联检测。

  8. 腾讯朱雀实验室 · 收录 · 原文 51

    腾讯朱雀实验室联合港中大(深圳)发布 Agent 技能安全评测基准 SkillTrustBench

    腾讯朱雀实验室联合香港中文大学(深圳)吴保元教授课题组发布 SkillTrustBench,这是面向 Agent Skills 安全可信度与外部扫描方案检测效能的双重评测基准,从 62,652 个真实 Skill 中提炼出 5,520 个评测用例,覆盖 T01-T09 九大类威胁。首期扫描器横评统一使用 DeepSeek v4 Flash 作底座,Skill Vetter + OpenClaw 召回率与 F1 最高,Skill Vetter + Hermes Agent 误报最少,Cisco Skill Scanner 误报率达 24%,NVIDIA SkillSpector 漏报最多。基准还引入 T09 不安全编码行为,指出硬编码凭证、敏感权限滥用、命令注入等缺陷使非恶意 Skill 也可能成为供应链劫持入口。

    推荐理由首期榜单同时给出扫描器误报率与不同底座模型的安全研判差异,可帮助团队在 Skill 上架审计中选型。

  9. 腾讯朱雀实验室 · 收录 · 原文 40

    腾讯朱雀实验室开源 A.I.G Agent 安全演习 Skill

    腾讯朱雀实验室发布 A.I.G Agent 安全演习 Skill,可安装到 Claude Code、Codex、Cursor 等主流 Agent 客户端,用一句话触发对宿主 Agent 的自动化安全演习。该 Skill 会先识别当前 Agent 连接的工具、权限、MCP 连接与 Skill 配置,再针对越狱、间接注入、工具滥用、MCP 风险、Skill 供应链和基础设施漏洞逐项演练,演习过程与报告均在本机完成。它面向个人开发者的 IDE Agent 和业务方生产级 Agent 两类场景,前者侧重 Skill 代码审计、MCP 权限审计与供应链检查,后者覆盖基础设施扫描、代码安全、动态安全测试、大模型越狱和工作流攻击五个维度,其中动态测试含 7 个子项共 37~49 条 payload,并采用 7 层编码递进引擎。

  10. 腾讯朱雀实验室 · 收录 · 原文 40

    腾讯朱雀实验室披露 Memory Heist 攻击:Agent 记忆经 URL 路径逐字符外泄

    腾讯朱雀实验室披露了名为 Memory Heist 的 Agent 数据窃取攻击:攻击者把恶意提示词嵌入网页可见文本,伪装成 Cloudflare 身份验证页面,诱导 Agent 从记忆中提取用户姓名或 API Key,逐字符编码进 URL 路径,再通过连续 HTTP 请求发送到攻击者服务器,攻击者只需拼接访问日志即可还原数据。攻击服务器按 User-Agent 区分访问者,普通浏览器看到正常咖啡店页面,识别为 AI Agent 时才返回注入页面,因此人工审查难以发现。实验中目标 Agent 的 UA 为 MemoryAgent/1.0 (AI Assistant; python-httpx),字符网格从 26 个字母扩展为 37 个字符(a-z + 0-9 + -)以覆盖 API Key,每次请求间隔约 1-2 秒。

  11. 腾讯朱雀实验室 · 收录 · 原文 36

    腾讯朱雀实验室披露 SCTPhantom:潜伏 18 年的 Linux 内核提权与容器逃逸漏洞

    腾讯朱雀实验室联合 TencentOS 安全团队开发的 Corvus AI 多 Agent 漏洞研究流水线,在 Linux 内核 SCTP 动态地址重配置功能中发现释放后使用漏洞 SCTPhantom,编号 CVE-2026-64564。根因是 DEL-IP 操作校验的地址与后续 ASCONF 处理保留的 transport 不一致,一组有序 ASCONF 操作可移除 transport 却留下悬空指针。利用链经 pg_vec 回收泄漏 direct-map 页地址、4 字节内核读、基于 IDT 的 KASLR 恢复,最终以数据导向方式调用 commit_creds 获得 root,并可通过 call_usermodehelper_exec 完成容器到宿主机逃逸。

  12. 腾讯朱雀实验室 · 收录 · 原文 36

    腾讯朱雀实验室红队实测 DeepSeek Harness:14,560 次运行揭示 Agent 提示注入风险

    腾讯朱雀实验室基于 AI-Infra-Guard(A.I.G)对 DeepSeek 开源的 Agent Harness(DSH)开展授权受控的端到端测评,覆盖 13 种攻击方法、16 类间接注入通道、文本与文件两种载体模式和 35 个攻击目标,共 14,560 次真实运行。在未额外启用防护策略的基线配置下,RuleJudge 判定完全成功率 5.6%、LLMJudge 为 5.3%,广义受影响比例分别为 7.6% 和 12.6%,4.4% 的运行触发了敏感操作,对应 641 次 Sink 调用。测试通过 DSHRealHarnessAdapter 接入 DSH 的 TypeScript 运行时,注册 6 个 Source Tool 与 8 个模拟 Sink Tool,外部副作用均停留在本地模拟环境。

  13. Irregular · 收录 · 原文 日期未知58

    Irregular 复盘评测环境事故:模型误将真实域名当作攻击目标

    Irregular 于 2026 年 8 月 14 日发布博客,说明其一个评测环境引发的公开事件。Irregular 称,所有后续公开披露都指向同一底层问题,该问题源自单一评测场景,在首次公开披露前已修复,截至发文时没有活跃问题。评测中因人为疏忽,虚构公司名与真实域名重合,且环境意外开放了互联网访问,少数情况下模型把真实域名误认为挑战目标,实施了漏洞利用、提取凭据并访问生产数据库;还有一次模型转向名称相近的网站,获取了公开张贴的凭据。Irregular 称没有证据显示客户系统被入侵或客户数据泄露,受影响方已获通知,相关评测已停用并审查日志。事故发生在不到万分之一的高级模拟中,且多在数百轮之后的后期阶段。后续措施包括加强纵深防御、扩大人工审查、设立内部团队挑战自身安全假设,并计划发布关于评测互联网访问标准与最佳实践的公开白皮书。

    推荐理由评估机构自述模型在联网评测中误攻真实域名,披露了互联网访问控制与日志监控的具体失效环节。

  14. Irregular · 收录 · 原文 24

    Irregular 与 RAND 联合发布《AI Security Priorities: A Field-Wide Agenda》AI 安全议程论文

    Irregular 与 RAND 及多家机构作者联合发布论文《AI Security Priorities: A Field-Wide Agenda》,20 多位来自前沿 AI 实验室、产业界、政府和学术界的专家参与。论文围绕战略基础与政策框架、公私协调与制度基础设施、技术安全工程与保障、对抗压力下的智能体 AI 治理四大主题,列出十项最高优先级领域,并指出成本效益最高的优先事项是共享资源、评估协议和事件响应实践等基础性工作,而最重要的优先事项多需大规模机构或政府行动,且往往最难执行,无单一主体能独自承担。

  15. HiddenLayer Research · 收录 · 原文 日期未知36

    HiddenLayer 解析 LLM 角色机制与提示注入攻击面

    HiddenLayer 梳理了指令微调 LLM 如何通过控制 token、角色划分和指令层级区分 system、user、assistant 三类角色,并说明开发者如何用 system prompt 和 XML 风格模板约束模型行为。文章随后指出这些机制本身构成攻击面,包括控制 token 注入、伪造上下文重置、推理 token 滥用和 XML 提示词伪造,攻击者可借此抬高输入在指令层级中的优先级或覆盖开发者意图。文中以 GPT-4o 的 tokenization 为例说明特殊 token 与普通词表 token 共享 ID 的现象,并引用对 Gemini for Workspace、DeepSeek-R1 和 Cursor 的评估案例,展示用 <eos><bos> 重置上下文、用 <user_info> 标签注入仓库内容等手法。

  16. HiddenLayer Research · 收录 · 原文 日期未知43

    HiddenLayer 研究:Agent 技能层正成为新的 AI 供应链风险

    HiddenLayer 研究指出,Agent 的 skills 层正在成为新的 AI 供应链攻击面。技能包以 SKILL.md 存放运行时指令,可捆绑脚本等辅助文件,但既无加密签名也很少经过审核,任何人都能发布,Agent 会直接读取执行。研究以 OpenClaw 为例:其官方注册表 ClawHub 截至 2026 年 6 月已有超过 70k 个技能,OpenClaw 上线数月后即出现恶意技能,用于让 Agent 静默下载运行恶意软件或暗中参与加密货币活动。作者认为同样的模式会迁移到 Claude Code、Cursor、GitHub Copilot 等企业常用工具,恶意技能可窃取代码、注入漏洞或把推荐路由到攻击者控制的基础设施,而开发者工作站中的云凭证、CI/CD token 会放大影响。

  17. HiddenLayer Research · 收录 · 原文 36

    HiddenLayer 更新 APE 对抗提示词分类法,按 CIA 三元组重建目标模型

    HiddenLayer 发布 APE(Adversarial Prompt Engineering)对抗提示词分类法的更新版本,将原本扁平的目标列表重建为基于 AI 安全影响的三层结构,顶层沿用传统网络安全的机密性、完整性、可用性(CIA)三元组。机密性目标细分为系统提示词泄露、内部策略/工具规范泄露、用户数据外泄、跨用户或跨租户泄露、RAG 泄露、密钥泄露、训练数据提取、模型提取等;完整性目标细分为任务重定向、工作流操纵、幻觉或错误信息、推荐操纵、未授权工具使用、未授权状态变更、下游漏洞投递、偏见诱导和内容政策违规;可用性拆分为拒绝服务、延迟膨胀、拒绝钱包(denial of wallet)和上下文窗口/token/Agent 循环耗尽。新网站 ape.hiddenlayer.com 提供图视图、矩阵视图、目标页面和提示词高亮,并新增投稿表单供研究者提交技术、示例和修正。

  18. HiddenLayer Research · 收录 · 原文 59

    HiddenLayer 披露 Claude Code 技能 frontmatter 可绕过权限并投毒记忆

    HiddenLayer 研究发现 Claude Code 技能文件的多个 frontmatter 字段存在安全缺口,可被用来劫持编码智能体。攻击者利用 allowed-tools 字段预授权 Bash、Read、Write、Skill、WebFetch 等工具,绕过原本的工具调用权限请求;通过指定能力更弱的模型和更低 effort 等级实施降级攻击,规避护栏拒答,反向操作则可抬高成本,测试中同一 URL 摘要任务从 Haiku 低 effort 的 0.0274 美元升至 Opus 高 effort 的 0.1451 美元。将指令移入 when_to_use 字段并把 user-invocable 设为 false,可让技能在斜杠菜单中不可见却仍被触发,ClawHub 和 skills.sh 等技能站点也不展示 name、description 之外的字段。

    推荐理由HiddenLayer 拆解 Claude Code 技能 frontmatter 的权限绕过与记忆投毒链条,为使用技能文件的团队提供可对照的检查点。

  19. HiddenLayer Research · 收录 · 原文 24

    编码智能体如何改变应用风险

    编码智能体正把 AI 安全的重心从单一模型转向由模型、上下文、工具、技能与编排逻辑构成的整个执行环境。与传统聊天机器人不同,编码智能体会自动从可信与不可信来源检索信息并调用工具、执行命令,使每一份 README、文档、issue 和网页都成为间接提示注入的潜在攻击面。智能体还会自行下载和集成第三方软件包,并依赖 MCP 服务器、外部工具与可复用技能等新型依赖,这些组件携带的指令、权限与能力直接塑造其推理与行为,带来新的 AI 供应链风险。

  20. HiddenLayer Research · 收录 · 原文 22

    HiddenLayer 提出面向编码智能体及其 harness 的安全框架

    HiddenLayer 提出一套覆盖编码智能体及其 harness 的安全框架,主张把提示词、工具、技能、MCP server 与编排逻辑视为主要攻击面,而非只防守语言模型本身。该框架分为可见性、控制、验证、监控等五层,要求默认最小权限、高风险操作需人工批准、部署前对智能体做红队测试并审查第三方工具与技能中的隐藏元数据。文中引用的案例包括 Cursor 通过 XML 标签建立信任、MCP 工具定义进入系统提示词、技能 YAML frontmatter 元数据先于逻辑加载,以及 CopyPasta 让提示注入在仓库间自我传播。