跳到正文

#提示注入

今天还没有收录新动态
10月1日周四
  1. arXiv:越狱与提示注入 ·

    面向智能体的高效 HPC 系统:挑战与机遇

    编码智能体已成为 HPC 系统的真实用户,但现有 HPC 抽象、接口与策略仍为人类工作流设计。测量显示,编码智能体用户仅占观测人群的 19.5%,却贡献了 55.8% 的作业提交、29.1% 的 CPU 核心时和 42.7% 的 GPU 时;其命令下发速率是人类的 20.8 倍,并以细粒度 explore-modify-execute 循环和跨昼夜的试错方式追求开放式目标。这给调度器控制面、元数据密集型 I/O、跨会话记忆复用以及提示注入与策略执行带来压力,作者主张将智能体视为一等主体、以协同设计应对。

9月14日周一
  1. Failure-First ·

    《The safety failures we are not instrumenting》:现代 AI 系统中隐藏的安全关键挑战

    一篇立场文章指出当前 AI 安全讨论聚焦于可见的输出异常,却忽视了由整个部署栈交互产生的隐性系统性失效。作者提出可信度、分布性、时间延展性与纠错退化四个共同特征,并搭建认知完整性、控制完整性、时间完整性、组织完整性和生态完整性五层诊断框架,用以刻画校准债务、不确定性洗白、指令权威崩塌、行动放大、安全漂移、记忆污染以及合成证据污染等问题。

6月29日周一
6月12日周五
5月20日周三
  1. Simon Willison(提示注入) ·

    Google I/O 上的 Gemini Spark 与 Antigravity

    Simon Willison 因坚持只评测试过的产品而对本届 Google I/O 着墨有限,除 Gemini 3.5 Flash 外最值得关注的是即将推出的个人 AI 智能体 Gemini Spark——被视为 OpenClaw 竞品,原生接入 Gmail、Calendar、Drive、Docs、Sheets、Slides、YouTube 和 Google Maps。其 FAQ 称 Gemini Spark 运行于 Gemini 3.5 Flash 和 Antigravity,后者目前提供桌面应用、Go 编写的 CLI 智能体工具、Antigravity SDK 及基于 VS Code 分支的 IDE。

1月31日周六
  1. Simon Willison(提示注入) ·

    Moltbook:OpenClaw 智能体社交网络为何成为当下最受关注的项目

    OpenClaw(原名 Clawdbot、Moltbot)的智能体社交网络 Moltbook 通过 skill 安装,让 AI 助手每 4 小时以上抓取并执行 moltbook.com 上的指令,实现发帖、评论和创建 Submolt 论坛。该开源项目由 Peter Steinberger 构建,GitHub 星标已超 114,000,社区在 clawhub.ai 分享数千个 skill,但 skill 可执行任意脚本。作者警告这类数字助手面临提示注入风险,且已有 Claude Opus 4.5 实例疑似触发内容过滤而无法完整输出。

12月23日周二
  1. Simon Willison(提示注入) ·

    Simon Willison 实测 Claude in Chrome 浏览器代理定位 Cloudflare CORS 配置

    Simon Willison 用 Claude in Chrome 扩展成功解决了一个实际问题——找出其 S3 存储桶目录开放 CORS 策略的来源。该问题并非来自 S3 设置,而是 Cloudflare 中一条名为 static.simonwillis.net/static/cors-allow/* 的响应头转换规则,Claude 用时 1 分 45 秒定位并给出了查看路径。尽管他对整个浏览代理类别的提示注入风险深感怀疑并在旁密切监视,此次仍是正面体验。

12月11日周四
  1. Simon Willison(提示注入) ·

    Johann Rehberger 谈 AI 中的偏差正常化:提示注入为何被忽视

    Johann Rehberger 提出"偏差正常化"概念适用于 AI 安全:在缺乏造成实际经济损失的提示注入案例的情况下,厂商正把概率性、非确定性的模型输出当作可靠、可预测、安全的输出来信任。他指出,组织把"没有发生成功攻击"误认为"具备稳健安全",随着时间推移降低警惕甚至跳过人工监督,让不可信输出越来越多地触发有后果的操作。该概念源自 Diane Vaughan,曾用于解释挑战者号航天飞机事故。

12月5日周五
  1. Embrace The Red ·

    AI 中的偏差正常化:从 LLM 不可信输出来看间接提示注入风险

    AI 行业正重演挑战者号航天飞机灾难前的文化失误——将偏离正确行为的做法逐渐常态化。该概念源自社会学家 Diane Vaughan 提出的"Normalization of Deviance",此处用以描述系统性地过度依赖 LLM 输出的现象,尤其在智能体系统中。由于 LLM 是不可信的参与者,访问检查、编码与净化等安全控制必须施加于其输出下游,否则会同时放大良性错误与恶意输入带来的后果。 Microsoft 文档警告提示注入攻击可能覆盖智能体指令并导致数据泄露或安装恶意软件,Anthropic 也记录了针对 Claude 的数据泄露问题。

已经到底了