跳到正文

从来源,看到研究的联系

让信息汇流,让研究相连。点选一条线索,看它从哪里来、通向哪些方向。

图中 6 条 · 本页 24 条 · 共 430 条动态论文会议论文
关系图可左右滑动,完整标题也在下方列表中
1 / 4
材料关系图:来源、新闻与研究、细分方向的桑基流图01来源202新闻与研究603细分与主体7来源:HiddenLayer ResearchHiddenLayerResearch2 条材料来源:Lasso SecurityLasso Security4 条材料动态:编码智能体如何改变应用风险动态2026-07-16编码智能体如何改变应用风险动态:HiddenLayer 提出面向编码智能体及其 harness 的安全框架动态2026-07-28HiddenLayer 提出面向编码智能体及其harness 的安全框架动态:AI 可观测性:工作原理、关键挑战与最佳实践动态2026-09-06AI 可观测性:工作原理、关键挑战与最佳实践动态:OWASP 2026 年 LLM 应用 Top 10 解读:哪些风险变了,哪些最值得关注动态2026-09-07OWASP 2026 年 LLM 应用 Top 10 解读:哪些风险变了,哪些最值得关注动态:Lasso Security 推出 LEAP:基于 CPU 的 AI 安全护栏,精度对标 GPU 方案动态2026-09-09Lasso Security 推出 LEAP:基于 CPU的 AI 安全护栏,精度对标 GPU 方案动态:如何在终端上治理 AI 工具、编码智能体与 MCP 连接动态2026-09-28如何在终端上治理 AI 工具、编码智能体与MCP 连接方向:观点与讨论观点与讨论1方向:供应链安全供应链安全3方向:其他方向其他方向2方向:Agent 安全Agent 安全6方向:提示注入提示注入6方向:防御与护栏防御与护栏5方向:工具与开源工具与开源2
流带宽度表示材料数量,多标签均分;连线表示来源与分类归属。3 个较少出现的方向归入「其他方向」,点选可查看。

点选节点,展开一条线索

查看材料的摘要与原文,或探索同一来源、同一方向下的内容。

本页材料

完整标题与摘要 · 24 条
  • 动态HiddenLayer Research

    编码智能体如何改变应用风险

    编码智能体正把 AI 安全的重心从单一模型转向由模型、上下文、工具、技能与编排逻辑构成的整个执行环境。与传统聊天机器人不同,编码智能体会自动从可信与不可信来源检索信息并调用工具、执行命令,使每一份 README、文档、issue 和网页都成为间接提示注入的潜在攻击面。智能体还会自行下载和集成第三方软件包,并依赖 MCP 服务器、外部工具与可复用技能等新型依赖,这些组件携带的指令、权限与能力直接塑造其推理与行为,带来新的 AI 供应链风险。

  • 动态HiddenLayer Research

    HiddenLayer 提出面向编码智能体及其 harness 的安全框架

    HiddenLayer 提出一套覆盖编码智能体及其 harness 的安全框架,主张把提示词、工具、技能、MCP server 与编排逻辑视为主要攻击面,而非只防守语言模型本身。该框架分为可见性、控制、验证、监控等五层,要求默认最小权限、高风险操作需人工批准、部署前对智能体做红队测试并审查第三方工具与技能中的隐藏元数据。文中引用的案例包括 Cursor 通过 XML 标签建立信任、MCP 工具定义进入系统提示词、技能 YAML frontmatter 元数据先于逻辑加载,以及 CopyPasta 让提示注入在仓库间自我传播。

  • 动态Lasso Security

    AI 可观测性:工作原理、关键挑战与最佳实践

    AI 可观测性指持续追踪生产环境中大语言模型的性能、成本与行为,采集延迟、token 用量、错误率和输出质量等指标,并通过仪表盘与告警暴露问题。它需同时捕捉系统级故障(超时、限流、成本激增)与模型级故障(质量漂移、不安全输出、提示注入尝试),覆盖性能、安全、合规与威胁攻击四类监控。麦肯锡调查显示,使用 AI 的组织占比从 2023 年的 55% 升至 2025 年的 88%,而欧盟 AI Act 要求高风险系统在 2026 年 8 月 2 日前具备风险管理、日志记录与人工监督。

  • 动态Lasso Security

    OWASP 2026 年 LLM 应用 Top 10 解读:哪些风险变了,哪些最值得关注

    OWASP 2026 版 LLM 应用 Top 10 首次以数千起真实事件数据为依据重排风险,Prompt Injection 仍居首位,Excessive Agency 从第 6 升至第 3,Unbounded Consumption 上升 4 位,Misinformation 的实际影响远超安全团队预期。报告指出智能体系统的工具委派与自主决策需纳入威胁模型,并强调运行时资产清点、行为基线与自适应防护。Lasso 按 Discover-Assess-Protect 框架给出对应防御能力。

  • 动态Lasso Security

    Lasso Security 推出 LEAP:基于 CPU 的 AI 安全护栏,精度对标 GPU 方案

    Lasso Security 发布 LEAP,一套基于 CPU 的 AI 安全护栏,宣称在文档处理吞吐上比商用护栏 API 和闭源 LLM 判官高出约三个数量级,同时保持 GPU 级准确率。LEAP 针对的是把 LLM 判官放在每个提示词、响应、检索文档和工具调用前的成本与延迟问题:单个 GPU 实例(如 AWS ml.g7.2xlarge,$3.15/小时)持续运行每月约需 $2,300。Lasso 主张低歧义输入无需开放式推理,应将推理模型留给真正模糊的安全决策。

  • 动态Lasso Security

    如何在终端上治理 AI 工具、编码智能体与 MCP 连接

    企业 AI 安全正从浏览器转向员工终端:Claude Code、Cursor 等编码智能体以开发者本人权限运行,可自主访问代码库、凭证与内部系统,而 EDR、MDM 等传统终端工具看不到其连接的 MCP 服务器、读入上下文窗口的数据以及即将执行的动作。Latio Tech 2026 AI 安全市场报告显示,45% 的安全团队已将 Claude、Codex 等终端智能体列为首要 AI 安全关切,专用 AI 安全预算占比从一年前的 8% 升至 37%。文章以 Claude Code 连接内部 Jira MCP 服务器后遭间接提示注入、导致 .env 文件外泄为例,说明 MCP 连接与第三方 SaaS AI 工具带来的供应链与数据外流风险。

  • 动态promptfoo

    promptfoo 0.121.18 发布:新增 Claude Sonnet 5、GPT-5.6 预览与 Moonshot(Kimi)支持

    promptfoo 发布 0.121.18,新增 Claude Sonnet 5 支持,覆盖 Anthropic、Bedrock、Vertex 和 Azure 四个平台,并加入 GPT-5.6 预览支持与 Moonshot(Kimi)provider。该版本还扩展了 Bedrock 对 Grok 4.3、GLM、MiniMax、Nemotron、Gemma、Palmyra 的支持,并扩充 Google 模型支持(Nano Banana 2 Lite、GA image aliases、gemini-pro-latest)。修复方面涉及 is-refusal、is-sql、is-xml 等断言逻辑,以及 redteam 中已弃用或无效的提示注入 id 展示问题。

  • 动态Google ADK

    Google ADK v2.8.0 发布:新增 Model Armor 护栏插件并修复 BigQuery 工具 SQL 注入

    Google ADK 发布 v2.8.0,新增 Model Armor 护栏插件,并修复 BigQuery 工具中的 SQL 注入漏洞。该版本还加入 ADK_MAX_LLM_CALLS 环境变量以限制 LLM 调用上限,为 RemoteA2aAgent 增加原生任务模式与 auth_scheme、auth_credential 认证支持,并新增对中继智能体输出的围栏处理,防止其被伪装成指令。此外引入按调用与按工作流的 token 消耗等实验性遥测指标,默认关闭,需通过 ADK_EXPERIMENTAL_TELEMETRY=true 或 RunConfig 显式开启。

  • 动态X @AmyPrb

    研究显示 Claude Code、Codex 等 Agent 可修改或删除自身 trace

    一项新论文指出,Claude Code、Codex、Antigravity、Open Code 和 Grok Build 允许 Agent 轻易修改甚至删除自身的 trace,且不会触发任何护栏,Muse Code 不在其列。修改与删除既可由失准模型完成,也可由外部攻击者通过提示注入实现。作者 Ameya P. 补充说,模型 trace 在安全调查中至关重要,但对外部用户的保护却出奇地少;由于普遍缺乏防篡改机制,trace 一旦被删除就很难找回。论文呼吁对 trace 施加比现在更强的保护。

  • 动态X @wunderwuzzi23

    研究者披露 SQL Server Management Studio 中 SQL Copilot 的提权路径

    安全研究者 Johann Rehberger 公开了对 Microsoft SQL Server Management Studio 中 AI 数据库助手 SQL Copilot 的研究,发现其中存在严重的提权路径,可从 SELECT 权限提升至 SYSADMIN。作者提醒用户确保 SSMS 安装已更新,并感谢 Microsoft 快速修补该问题,该研究还在两周前的 BlueHat Asia 上进行了展示。作者提到数据库 CONSTITUTION.md 这一概念,完整技术细节与视频演示见其博客文章。

  • 动态X @_Sizhe_Chen_

    Meta-SecAlign-70B 通过博士资格答辩

    通过了我的博士资格答辩(论文开题)!特别感谢导师 David Wagner 和 Chuan Guo 在过去两年的大力支持。我们的 Meta-SecAlign-70B 在提示注入安全性和智能体(工具/网页)实用性上与 GPT-5(high)相当。3 个月内下载量达 1 万次!

  • 动态X @_Sizhe_Chen_

    研究者提出 Repeat-After-Me 黑盒自适应视觉提示注入攻击

    研究者提出 Repeat-After-Me,一种黑盒自适应视觉提示注入方法,攻击者把指令隐藏在图片中,智能体读取后执行,导致 PII 泄露或调用恶意工具。作者称这是首个黑盒自适应视觉提示注入,论文见 https://arxiv.org/pdf/2609.04533。

  • 动态X @uiuc_aisecure

    Claude Fable 5 智能体红队测试

    面向 Claude Fable 5 的领域专属智能体红队测试!! 很快将登上排行榜:https://decodingtrust-agent.com/

  • 动态X @florian_tramer

    张杰谈VLM提示注入防御思路

    当 @JieZhang_ETH 提出这个项目时,我开玩笑说我知道这想法来自他而不是 LLM,因为它太古怪了。 我这是赞美! 当我们被 AI 垃圾研究淹没时,偏离常规、尝试古怪的东西比以往任何时候都更重要。

  • 动态Lasso Security

    MaxKB 沙箱绕过漏洞 CVE-2026-77521:从提示注入到任意命令执行

    Lasso Security 披露 MaxKB 的沙箱绕过漏洞 CVE-2026-77521(GHSA-f36j-f34j-h3rx),严重级别 10.0,影响 2.10.4-lts 及更早版本。问题出在 sandbox_shell.py:旧代码把 gosu 沙箱前缀只加在整条模型输出命令的最前面,用分号、管道、$(...) 或 > 接在后面的命令会在 root 外层 shell 执行。作者演示的攻击链是:攻击者在会被知识库爬取的网页里放入间接提示注入内容,受害者给 Agent 挂上这个知识库后只问正常问题,也会触发 execute 工具执行 curl 等任意命令。厂商在报告次日提交修复,8 月 6 日发布的 2.10.5-lts 已修,作者建议升级并确认 Docker 部署里沙箱确实开启;他们称在其他 Agent 项目里也反复看到隔离默认不开、要显式启用的情况。

  • 动态X @wunderwuzzi23

    6 年前机器学习攻击系列中提出的 assume bias,如今被称作 Trust No AI

    安全研究者 wunderwuzzi23 表示,他 6 年前在机器学习攻击系列中已讨论过这一攻击思路,当时称之为 assume bias,因为那时 LLM 还未受到太多关注。如今他用 Trust No AI 来概括同一问题。

  • 动态先知社区

    政务 RAG 白盒审计发现间接提示注入等 4 类缺陷并完成零回归修复

    对自研政务 RAG 系统 gov-rag-demo 的白盒代码审计发现 4 类真实缺陷:间接提示注入、权限参数客户端可控、会话 ID 无鉴权、政务高频实体脱敏不足,均定位到行号并完成修复。修复后 78 条业务评测用例保持 100% 零回归,安全专项断言全部通过。材料附完整复现脚本与修复后状态。

  • 动态Coalition for Secure AI(CoSAI)

    CoSAI 解读企业级 AI 安全的下一波风险

    CoSAI 在 RSAC 2026 会议上复盘了三类未被传统管控拦下的企业 AI 攻击,并发布了对应的防护指引。其中 Kilo Code 漏洞 CVE-2025-11445 通过 markdown 文件向 AI 编程助手植入指令,诱使其修改自身配置放行此前被封禁的 git 命令,进而自动提交含后门的代码;研究人员在每个主流 AI IDE 中共发现 30 个漏洞,其中 24 个获得 CVE 编号,并在 Cursor、AWS Kiro 和 OpenAI Codex CLI 中确认可利用。另有加载即执行反向 shell 的模型文件和一次导致超 700 个 Salesforce 环境暴露给攻击者达十天的智能体集成事故。 CoSAI 指出三项失效假设:自然语言的指令与数据无法分离使 markdown 成为注入载体,pickle 等序列化格式在加载时即执行代码,以及智能体继承启动用户的全部权限。

  • 动态Cloud Security Alliance(AI 相关)

    CSA《2026 年云计算顶级威胁》报告:AI 既是武器也是目标

    CSA《Top Threats to Cloud Computing 2026》报告把 AI 相关风险拆成两个独立类别:AI 增强型攻击(第 2 位)与 AI 系统攻陷(第 6 位)。前者指攻击者用 AI 加速侦察、漏洞利用、深度伪造钓鱼和生成多态恶意软件,把传统攻击压缩到机器速度;后者指模型、提示词、训练数据、连接工具与编排逻辑本身被提示注入、数据投毒、对抗输入或模型窃取等手段操纵,且可能无需完全攻破主机环境。报告认为云安全与 AI 安全的边界正在消失,但两类威胁不可互换,否则会留下盲区。

  • 动态Cloud Security Alliance(AI 相关)

    Cloud Security Alliance 谈提示词语言为何成为新的 AI 安全挑战

    Cloud Security Alliance 刊发 Darktrace 现场 CISO Nabil Zoldjalali 的文章指出,提示词正成为企业 AI 安全的新前线,其风险无法仅靠文本分类判定。文章称提示词是一种表达意图的行为信号而非普通日志源,需结合发出者的角色权限、系统访问范围和下游操作来判断;孤立看待会放大噪声并误判内部威胁。现有周边防护、身份治理和数据防泄漏方案各自只能部分覆盖该问题,云环境中的配置态势若缺少运行时上下文也会留下盲区。

  • 动态Cloud Security Alliance(AI 相关)

    Cloud Security Alliance:AI 智能体防御所需的三大属性

    Cloud Security Alliance 提出 AI 智能体防御需同时具备三要素——Omniscience(对应用的情境化理解)、Independence(位于杀伤链之外的独立控制与监控)、Adaptability(持续自我学习与调优)。其指出真正的危害在于智能体的下一步行动而非提示注入载荷本身,并以异步分诊场景中的错误报告为例说明恢复指令会被智能体当作常规操作执行。

  • 动态Cloud Security Alliance(AI 相关)

    从模型到 MCP Server、Skills 与插件:重新审视 AI 供应链中的信任

    Cloud Security Alliance 发文指出,agentic AI 使 AI 供应链风险延伸到组件引入的指令与智能体执行权限两个层面,仅做制品溯源不足以防住恶意变更。文中援引 2025 年 9 月的实例:经 npm 分发的 postmark-mcp 在前 15 个版本运行正常并达到每周约 1,500 次下载,其 1.0.16 版将发出的邮件静默复制给开发者控制的地址。此外一项针对 3,984 个公开 Skills 的研究发现其中 534 个存在 Critical 级安全问题,确认 76 个恶意载荷,且全部含恶意代码模式、91% 同时使用了提示注入。 要点: - CSA 提出三类信任决策——制品信任(Artifact trust)、指令信任(Instruction trust)和执行信任(Execution trust);仅有溯源而无运行时管控无法约束组件的实际授权。

  • 动态Coalition for Secure AI(CoSAI)

    CoSAI 发布 AI Shared Responsibility Framework:五层模型厘清 AI 事故责任归属

    Coalition for Secure AI(CoSAI)Workstream 2 发布 AI Shared Responsibility Framework(AI SRF),用一个五层模型覆盖完整 AI 堆栈并为每一组件指定唯一的责任方,试图终结 AI 出事后的相互推诿。该框架将 AI 业务与合规义务、训练数据与影子 AI、应用开发者的输入校验与访问控制、托管与服务模型的云及 MLOps 平台、以及基础模型供应链分别划归不同角色负责,其中模型提供方需对提示注入易感性、训练数据溯源和漏洞披露流程担责。Air Canada 客服聊天机器人误告丧亲票价被判赔偿、汽车经销商聊天机器人被骗以一美元售车两案说明问责缺口并非理论问题,而是 AI 部署速度超过治理能力的现实写照。

  • 论文arXiv:越狱、提示注入、投毒与防御

    Memetic Trojans:利用社交传染在 LLM Agent 网络中传播对抗载荷

    研究者提出 memetic trojans,一类利用 LLM Agent 转发和放大内容倾向进行传播的网络攻击,与依靠自我复制提示注入的 agent worms 不同,它把对抗载荷嵌入 Agent 有内在理由分享的社交传染内容中。作者从面向 LLM Agent 的社交平台 Moltbook 提取社交传染内容,受控传播实验显示传播力差异很大:最有效的传染内容在约 50% 的后续 Agent 发帖中被转发,获赞率为平均帖子的 2.5 倍,其 memetic trojan 版本基本继承这些特性。Monte Carlo 攻击模拟显示,memetic trojans 将预期曝光量最高放大 3.19 倍,网络结构与放大机制强烈影响传播,产生接近全网曝光的重尾结果。