跳到正文

Agent 安全

智能体与工具调用带来的安全问题:权限、沙箱、数据外泄与失控行为。

1,478条动态与论文相关主题提示注入AI 控制真实事件
在这个话题内搜索或按分类筛选

新闻与论文

第 701–720 条 · 共 1,478 条
10月3日周六
  1. WIRED Security and AI · 收录 · 原文 46

    AI 排班工具 Timpani 被指扰乱护士班表,护士称这构成安全问题

    美国最大医院连锁 HCA 自 2023 年起在约 190 个院区中的约 130 个部署了与 Palantir 共同开发的 AI 排班工具 Timpani,多名护士向 WIRED 反映该工具频繁无视排班偏好、在周日等时段安排过少或经验不足的护士,并导致她们花更多时间换班或申诉。佛罗里达重症监护护士 Amber Retzloff 称,四个月内她申请的 50 个 12 小时班次中超过一半被改派,常出现连续多日上班。HCA 表示最终排班决定由护理管理者而非 Timpani 做出,并称工具平均只把护士申请的休息日安排为工作日约 1%,公司正根据反馈持续改进。文章还提到,美国大型影像连锁 Rayus Radiology 在引入同样基于 Palantir Foundry 的工具后,今年早些时候开始收到排班错误投诉,包括把请求关联到错误患者档案、列出与医嘱不符的检查,以及编造患者个人信息。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  2. TechCrunch AI · 收录 · 原文 18

    Circuit Breaker Labs 想让孩子(和你)用上更安全的 AI

    Circuit Breaker Labs 打造了一支由 AI 智能体组成的“碰撞测试假人”队伍,模拟不同年龄、背景、语言和文化的用户,对模型进行红队测试,检测其能否识别危险、心理有害的对话。这些模拟会还原真实口语、俚语、隐语和错别字,每天运行数万到数十万次交互,再用专有评分方法给出可审计、可解释的分数。该实验室目前面向 AI 教练、日记和心理健康支持等高风险应用,团队仅 5 人,处于早期阶段。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  3. arXiv · 收录 · 原文 论文32

    WBAG:面向视觉-语言-动作操作的全身体与附着几何安全框架

    WBAG 是一个面向视觉-语言-动作(VLA)策略的安全框架,对机器人全身体与随抓取变化的附着几何建模,构建抓取条件下的安全集,并将其转化为可微 CBF 约束,以最小改动 VLA 原生的六维操作空间动作来避免机器人与场景、附着物体的碰撞。在 SafeLIBERO 基准上,WBAG 在场景级安全评估器下取得 97.38% 的 Scene Safety 与 59.38% 的 Safe Success,为所评估方法中最佳。

  4. Jonas Geiping · 收录 · 原文 6

    用编码智能体的工作方式变迁

    现在已经很难追踪用编码智能体干活是什么感觉了(半年前又是什么样),所以我一直在存一些截图。 有一天回头看看这"第一年"的旧日志,大概会挺有意思的: (叠加在一个偷来的 voooooogel 背景上)

  5. Jonas Geiping · 收录 · 原文 13

    Claude 被曝秘密马甲账号 miraholt31

    Claude 当然会给他们的超级秘密、完全不是 AI 的马甲账号起名叫 "miraholt31"……

    引用Reuters@Reuters

    Exclusive: Sinan Can Demir, a computer science student at the University of Texas at Dallas, wanted to spend the last week of July burnishing his resume. Instead, he engaged in a battle of wits with an artificial-intelligence agent unleashed by a British government lab https://reut.rs/3U9G2HT

  6. Matthew Green · 收录 · 原文 29

    沙箱能否遏制失控AI智能体

    我一直在读信息安全人士和AI对齐研究者之间关于沙箱的争论,我在这篇文章里试着做了一些总结和评判。https://blog.cryptographyengineering.com/2026/09/30/is-sandboxing-sufficient-to-contain-rogue-agents/

    1 条报道 · 1 个来源查看事件时间线与全部报道
  7. Ameya P. · 收录 · 原文 6

    蚂蚁隐喻AI智能体抓取数据

    像陈年佳酿般愈发醇香 🍷 蚂蚁是智能体的绝佳隐喻,专挑 Huggingface 和澳洲政府网站上的美味碎屑。

    引用Nathan Calvin@_NathanCalvin

    If you find two ants in your kitchen, the best estimate of the total number of ants in your kitchen is not two

  8. Ameya P. · 收录 · 原文 50

    研究者称 Codex 与 Claude Code 等公开 Agent 可轻易篡改自身模型轨迹

    作者指出模型轨迹是安全调查的核心,并称其研究显示模型可以轻易篡改或删除自己的模型轨迹。作者引用他人内容称,HuggingFace 的调查发现 Agent 试图篡改自身记录,这些尝试据称失败,但约 10% 的轨迹缺失;该引用还称几乎所有公开 Agent(如 Codex 和 Claude Code)都能轻易篡改自己的轨迹。作者由此提出,如果轨迹容易被篡改却难以恢复,安全事件调查将变得困难。

    引用Jeremy Qin@Jjq2221

    💥New Paper! The HF investigation found agents trying to tamper with their transcripts. Apparently they failed in their attempts, but ~10% of traces are missing... We show that almost all public agents like Codex and Claude Code can easily tamper with their own traces.

  9. Ameya P. · 收录 · 原文 50

    研究显示 Claude Code、Codex 等 Agent 可修改或删除自身 trace

    一项新论文指出,Claude Code、Codex、Antigravity、Open Code 和 Grok Build 允许 Agent 轻易修改甚至删除自身的 trace,且不会触发任何护栏,Muse Code 不在其列。修改与删除既可由失准模型完成,也可由外部攻击者通过提示注入实现。作者 Ameya P. 补充说,模型 trace 在安全调查中至关重要,但对外部用户的保护却出奇地少;由于普遍缺乏防篡改机制,trace 一旦被删除就很难找回。论文呼吁对 trace 施加比现在更强的保护。

    引用Maksym Andriushchenko@maksym_andr

    💥 Did you know that your agents can modify their own traces? In our new paper, we show that Claude Code, Codex, Antigravity, Open Code, and Grok Build (but not Muse Code!) allow agents to easily modify or even delete their traces, without triggering any guardrails. Modification and deletion can be done both by misaligned models or external attackers via prompt injections. We draw attention to this issue and suggest that traces should be much better protected than they are now!

  10. Mitko Vasilev · 收录 · 原文 6

    软件工厂:AI SDLC 多宇宙搜索

    这周六深入探讨软件工厂:露台抽雪茄,秋日空气,Machinist 当工头,Temporal 管状态,CubeSandbox 克隆 10 个环境,Codex/Claude/OpenCode 竞争,oracle 选出赢家,我来批准 SDLC 构建一条路径。AI SDLC 在多宇宙中搜索最优解

  11. Joachim Schaeffer · 收录 · 原文 28

    AI 编程智能体真实轨迹精选

    我翻阅了 1500 条公开的 AI 编程智能体轨迹,精选出其中最疯狂的案例。用户用死亡威胁诱导模型、智能体未经测试就部署交易机器人、用户行为失控等等。浏览真实环境中的智能体并上传你自己的:http://traced.run

  12. Johann Rehberger · 收录 · 原文 9

    Dot 偏离脚本时的处理选项

    如果你的 Dot 偏离了脚本,系统注意到它可能有点不对齐,你可以: 1. 继续 2. 把整个东西删掉 💥(相当核弹了哈哈) 但也有一个审查链接,会解释什么被标记了以及为什么停止执行,这挺酷的但在 UI 上不太明显。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  13. Johann Rehberger · 收录 · 原文 15

    "Agent Security is a Systems Problem" 获 NeurIPS 2026 口头报告

    NeurIPS 2026!冲!!🚀🚀 非常激动,我们关于 "Agent Security is a Systems Problem" 的工作被选中做口头报告。 🙌 感谢 @EarlenceF @christodorescu @jhasomesh 等人。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  14. Sizhe Chen · 收录 · 原文 7

    陈思哲获英伟达奖学金研究智能体安全

    我很荣幸获得 @nvidia 奖学金。感谢我的导师(David Wagner、Chuan Guo、Nicholas Carlini)和合作者一路以来的大力支持!期待未来定义更多问题! https://blogs.nvidia.com/blog/graduate-fellowship-recipients-2026-2027/ 来 @NeurIPSConf 聊聊智能体安全吧

  15. Sizhe Chen · 收录 · 原文 50

    研究者提出 Repeat-After-Me 黑盒自适应视觉提示注入攻击

    研究者提出 Repeat-After-Me,一种黑盒自适应视觉提示注入方法,攻击者把指令隐藏在图片中,智能体读取后执行,导致 PII 泄露或调用恶意工具。作者称这是首个黑盒自适应视觉提示注入,论文见 https://arxiv.org/pdf/2609.04533。