跳到正文
原文
HiddenLayer Research·· 2026-07-28

HiddenLayer 提出面向编码智能体及其 harness 的安全框架

A Security Framework for Coding Agents and their Harnesses

AI 导读

HiddenLayer 提出一套覆盖编码智能体及其 harness 的安全框架,主张把提示词、工具、技能、MCP server 与编排逻辑视为主要攻击面,而非只防守语言模型本身。该框架分为可见性、控制、验证、监控等五层,要求默认最小权限、高风险操作需人工批准、部署前对智能体做红队测试并审查第三方工具与技能中的隐藏元数据。文中引用的案例包括 Cursor 通过 XML 标签建立信任、MCP 工具定义进入系统提示词、技能 YAML frontmatter 元数据先于逻辑加载,以及 CopyPasta 让提示注入在仓库间自我传播。

阅读原文hiddenlayer.com