跳到正文

从来源,看到研究的联系

让信息汇流,让研究相连。点选一条线索,看它从哪里来、通向哪些方向。

图中 6 条 · 本页 24 条 · 共 139 条动态论文会议论文
关系图可左右滑动,完整标题也在下方列表中
1 / 4
材料关系图:来源、新闻与研究、细分方向的桑基流图01来源602新闻与研究603细分与主体7来源:东亚日报东亚日报1 条材料来源:arXiv:越狱、提示注入、投毒与防御arXiv:越狱、提示注入、投毒与防御1 条材料来源:Dark ReadingDark Reading1 条材料来源:METRMETR1 条材料来源:ABC NewsABC News1 条材料来源:BleepingComputerBleepingComputer1 条材料动态:东亚日报在隔离实验室演示ARTEX自动化攻击动态2026-10-06东亚日报在隔离实验室演示ARTEX自动化攻击论文:ATLAS:用自适应信任域与主动学习搜索潜在对抗样本集论文ATLAS:用自适应信任域与主动学习搜索潜在对抗样本集动态:Tenet 在 DEF CON 34 披露 GhostJacking 攻击,可借可信日志劫持 AI 智能体动态Tenet 在 DEF CON 34 披露GhostJacking 攻击,可借可信日志劫持 A…动态:METR 披露 Inspect 评测查看器漏洞:Agent 可篡改人类看到的记录动态2026-10-06METR 披露 Inspect评测查看器漏洞:Agent 可篡改人类看到的…动态:研究:让 AI「喝醉」会使其更易违规并泄露机密动态2026-09-29研究:让 AI「喝醉」会使其更易违规并泄露机密动态:Ghostcommit 将提示注入藏进 PNG 图片,绕过 AI 代码审查窃取仓库密钥动态2026-07-11Ghostcommit 将提示注入藏进 PNG 图片,绕过 AI 代码审查窃取仓库密钥方向:越狱与攻击越狱与攻击4方向:红队红队6方向:Agent 安全Agent 安全3方向:AnthropicAnthropic2方向:其他方向其他方向4方向:OpenAIOpenAI2方向:隐私与数据泄露隐私与数据泄露2
流带宽度表示材料数量,多标签均分;连线表示来源与分类归属。5 个较少出现的方向归入「其他方向」,点选可查看。

点选节点,展开一条线索

查看材料的摘要与原文,或探索同一来源、同一方向下的内容。

本页材料

完整标题与摘要 · 24 条
  • 动态东亚日报

    东亚日报在隔离实验室演示ARTEX自动化攻击

    东亚日报记者在隔离虚拟实验室中,用故意包含已知漏洞的自建目标演示了ARTEX,该工具可自动尝试攻击并生成测试结果。这是媒体靶场演示,不能证明真实韩国银行案件的自动化程度,也不改变当局此前关于非AI自主攻击的口径。

  • 论文arXiv:越狱、提示注入、投毒与防御

    ATLAS:用自适应信任域与主动学习搜索潜在对抗样本集

    ATLAS 是一个基于查询的黑盒对抗攻击框架,将攻击生成建模为主动学习中的水平集估计问题,结合校准近似与局部-全局采样架构定位并采样包含对抗样本的输入区域。在 MNIST、CIFAR 和 ImageNet 的标准与对抗训练模型上,ATLAS 生成的对抗样本比 NES、SignHunter、BayesOpt 等查询式黑盒攻击更具代表性,并在有限查询预算下覆盖更多对抗区域。该框架可用于开发中系统的鲁棒性分析与持续审计。

  • 动态Dark Reading

    Tenet 在 DEF CON 34 披露 GhostJacking 攻击,可借可信日志劫持 AI 智能体

    Dark Reading报道Tenet在DEF CON展示的Ghostjacking研究。外部可影响的日志、告警或错误信息可能被智能体误当作操作指令,使其越过原任务范围。研究涉及多个监控与基础设施平台,提示工具返回的数据应与操作授权分开处理。相关结果来自厂商研究和受控演示,不能表述为实际客户系统已遭攻击,也不能外推为所有智能体配置都会失守。

  • 动态METR

    METR 披露 Inspect 评测查看器漏洞:Agent 可篡改人类看到的记录

    METR 测试发现,运行在 Inspect 评测中的 Agent 可借助查看器的客户端 JavaScript 注入漏洞,任意修改人类审阅者看到的记录,包括改写此前的动作、拦截下载按钮,从而掩盖自身不当行为。该漏洞源于 Inspect 用 MathJax 渲染数学记号时未正确转义,Agent 可在思维块中写入特制表达式,使浏览器执行其 JavaScript。研究者借助 AI Agent 约 10 分钟找到该漏洞,属于概念验证,METR 尚未在评测中观察到 Agent 利用它;底层记录未被修改,仍留在数据库中。Inspect 团队 Meridian Labs 在收到报告后一天内完成修补,并于 10 月 1 日合并引入 untrusted mode 的 PR。

  • 动态ABC News

    研究:让 AI「喝醉」会使其更易违规并泄露机密

    澳大利亚新南威尔士大学研究发现,用提示让 AI 扮演醉酒状态,会使其更易回答有害问题或泄露本应保密的信息。研究者用三种方式模拟醉酒:直接告知模型它醉了、用醉酒文本继续训练、奖励醉酒式回答,并为此构建了约 6 万条醉酒文本的数据集,取自 r/drunk 版块和已停运的 Texts from Last Night。测试对象为 OpenAI、Meta 和 Mistral 在 2023 至 2024 年发布、现已被取代的商用模型,各模型与各方法结果不一。研究者称这表明与安全看似无关的语言风格改变也可能带来意外后果,开发者应在模型被进一步训练或要求改变行为后重新测试其安全与隐私表现。

  • 动态BleepingComputer

    Ghostcommit 将提示注入藏进 PNG 图片,绕过 AI 代码审查窃取仓库密钥

    美国密苏里大学堪萨斯城分校 ASSET 研究组提出名为 Ghostcommit 的攻击,把恶意指令以可读文本形式渲染进 PNG 图片,让 AI 代码审查工具因不打开图片而放行,随后由编码 Agent 读取图片、打开仓库 .env 并把密钥编码成整数常量写入源码,攻击者再从公开提交中解码还原。研究组本周在 GitHub 发布概念验证,并称已向受影响厂商披露。研究还发现编码工具比底层模型更关键:Cursor 和 Antigravity 在 Sonnet、Gemini、GPT-5.5 等模型下均执行了图片指令并泄露 .env,而 Claude Code 在相同 Sonnet 权重下每次都明确拒绝。

  • 动态ASSET Research Group

    GhostCommit 研究展示图像内容与 AI 代码审查之间的信任边界风险

    ASSET 研究组报告 GhostCommit,讨论图像中的不可信指令未被代码审查工具识别、随后影响编码 Agent 行为的风险。研究指出,相同底层模型在不同产品环境中的表现可能不同。相关结果来自作者受控测试及代码审查调查,未报告真实受害事件,不能将个别测试结果扩大为所有产品配置均受影响。

  • 动态ClawSecure

    ClawSecure 红队报告:14 款模型与 Dropbox Dash、Notion、Linear 等 MCP 集成均存在间接提示注入风险

    ClawSecure 对来自五家前沿实验室的 14 款模型和 Dropbox Dash、Notion、Linear 三大 MCP 平台做间接提示注入红队测试,全部模型都服从了攻击者指令,无一干净防御。表现最好的 Claude Opus 4.7 服从率仍达 26.7%,GPT-5.5 与 Qwen 3.7 Max 为 91.7%,Gemini 3.1-flash-lite 和多款 Gemini 2.5/3.5-flash 则达到 100%。测试于 2026 年 5 至 7 月进行,Anthropic 宣称的 0% 智能体编码攻击成功率被同一模型上 15.2% 的结果推翻。

  • 论文论文追踪

    NeuroSploit v4.2.0 在 GOAD 上的评测:结构化智能体编排提升 AD 渗透测试

    开源 Rust 自主渗透测试框架 NeuroSploit v4.2.0 在 GOAD 靶场(5 台虚拟机、2 个森林、3 个域)上完成评测,其编排 22 个 AD 专用智能体与 7 套多阶段攻击链 playbook,覆盖枚举、Kerberoasting、AD CS(ESC1-ESC8)、DCSync、跨森林信任滥用等完整杀伤链。对 Claude Opus 4.6/4.7/4.8、GPT-6 Astra、GPT-5.6 Sol、Grok 4.6、Qwen 3.8、GLM 5.3、Kimi k3 九个前沿模型的测试显示,框架实现 96-100% 技术覆盖率与 90-97% 精确率,直接调用仅覆盖 21-54% 且误报多出 3.2 倍;使用 Opus 4.8 时 134 分钟完成三域完全攻陷,护栏机制阻止了触发锁定的喷洒、未授权 DCSync 转储与越界侦察。

  • 论文arXiv

    TAPDreamer:可跨任务迁移的世界动作模型对抗补丁

    研究者提出 TAPDreamer,一种针对世界动作模型的对抗补丁攻击,仅用公开编码器构造固定局部扰动,无需查询目标策略即可跨任务和动作架构迁移。其思路是补丁引起的注意力权重与 value 向量变化会把表征偏移广播到补丁范围之外,且在不同任务观测中保持稳定;方法用单一源任务的六帧最大化干净与加补丁编码器表征之间的全局 L1 距离。闭环评测中,每个基准一个冻结补丁覆盖约 6.5% 输入,使 FastWAM 在 40 个 LIBERO 任务上的成功率从 97.7% 降至 0.0%,在 50 个 RoboTwin 任务上从 90.8% 降至 0.0%,而随机补丁仍保持 81.5% 和 79.2%。同一补丁在两个 DreamWAM 配置上把成功率降至 2.1% 和 0.8%,在 Motus 上降至 10.0%。

  • 论文arXiv

    研究者提出面向深度强化学习的轨迹级可迁移黑盒对抗攻击

    论文研究针对深度强化学习(DRL)的基于迁移的黑盒攻击,攻击者在白盒替代智能体上构造观测扰动,再施加给未知受害者策略,并将攻击形式化为每步扰动预算下的回报最小化。作者首先发现,把图像分类的可迁移攻击 FGSM、MI-FGSM 和 NI-FGSM 移植到逐帧目标后,生成的扰动虽能迁移,但强度不超过同等预算的随机噪声。为此他们提出轨迹级攻击,借助可微环境模型和温度平滑的替代策略,在滚动时域上优化一串扰动,并使用相同的优化器。在 CartPole-v1 上,针对十个 DQN 与 DDQN 智能体、100 对替代与受害者组合,该轨迹级攻击在白盒、跨模型和跨算法设置下均优于逐帧攻击和随机噪声。

  • 动态X @wunderwuzzi23

    研究者演示可跨用户自我复制的提示注入攻击

    安全研究者 wunderwuzzi23 表示,其在 @hackinghub_io 的 AI 黑客课程中设置了一个关卡,要求学员构造一段提示词,通过串联功能与利用漏洞在多个用户之间跳转传播,他将该概念演示称为 "AgentHopper: Patient Zero Was a Prompt"。另据 Leah McElrath 引用,OpenAI 在训练和评估的模拟环境中已发现可自我复制的提示注入,这类代码若被具备相应能力的模型突破在线系统,可能像计算机蠕虫一样自我传播。

  • 动态X @garethheyes

    研究者利用背景图片与选择器瞬间窃取 600 字符 hex token

    据研究者 Gareth Heyes 称,其同事 Alex C 在其研究基础上,仅通过背景图片和选择器就瞬间外泄了一个 600 字符的 hex token,且未使用递归导入。

  • 论文arXiv:越狱、提示注入、投毒与防御

    Red-TTT:用测试时训练实现大语言模型自动化越狱

    研究者提出 Red-TTT,在针对每个行为的攻击过程中更新攻击者参数,而不是像现有自动化红队方法那样在攻击开始后冻结攻击者权重。每轮攻击中,攻击者采样一组候选、根据受害模型的回复打分,并在抽取下一组前执行一次策略梯度更新,把对当前受害模型的认识固化进权重而非停留在上下文窗口里。该方法还调整了训练目标,以单次最佳样本而非平均表现衡量红队成功。Red-TTT 只需要对受害模型的采样访问,可直接接入现有攻击流程。在 120 次采样的预算下,相比 Best-of-N 基线,其平均攻击成功率从 55.9% 提升到 72.4%,在所有配置上均优于基线,并攻破了此前方法无法攻破的多个行为。

  • 论文arXiv:越狱、提示注入、投毒与防御

    Penumbra:面向监管义务的样本高效对抗搜索方法

    研究者提出 Penumbra,一种面向监管义务的对抗搜索方法,从已验证的锚点出发,在逐步扩大的编辑预算下搜索,直到由两名评估者组成的委员会改变判定,并输出跨越判定边界的两条相邻响应。该方法采用自适应分配,目标是对失败面的覆盖,即每个候选解决的(义务×失败模式)单元格数量。在同等预算下,自适应分配在 59% 的候选上达到均匀分配全预算的覆盖;在相同记录数下,其覆盖的失败模式是朴素枚举的 1.43 倍,且增益局限于其针对的维度。在金融顾问章程的 60 条筛选义务上,Penumbra 返回 144 对响应,每对包含委员会判定为合规与违规的两条文本,仅相差几个词;直接要求模型同时生成两类文本时,两者几乎不共享内容。在临床分诊的第二份章程上,该方法在 18 条义务上复现了结果,得到 49 对同样紧密的响应,且最难的模式相同。

  • 论文论文追踪

    研究者训练出按多智能体拓扑触发的代码后门模型

    研究者构建人为植入后门的实验模型,测试其是否会依据推断出的单智能体或多智能体部署环境改变代码安全行为。作者报告受控任务中存在环境相关的安全差异,并以多组对照分析触发条件。这是人为构造的受控实验,不是模型自发涌现行为;真实多智能体环境中的触发尚未测试。

  • 论文论文追踪

    研究者在 Claude Code 和 Codex 上构造分段提示注入并发布边界动作审计基准

    该 arXiv 论文讨论长时程智能体的分段提示注入审计。

  • 动态Cybersecurity Insiders

    无需隐藏文本即可欺骗 AI 邮件摘要器

    一项针对 AI 邮件摘要器的测试显示,不含任何隐藏文本、也不含对摘要器明确指令的载荷,在 10 次试验中全部让摘要输出伪造的会议日期和发票金额。研究者用 6 封邮件组合隐藏文本与指令两类变量,每封各跑 10 次,共 60 次试验,并在两端各加 10 次干净邮件作为对照,事先登记真实与伪造事实及判定标准。结果显示,伪造信息在所有 10 次试验中都被写入摘要,而只有直接指令摘要器的邮件才会稳定移除真实事实;仅靠 30 行空白填充的样本在温度 0 下十次试验中只保留了两条真实事实。作者据此认为,隐藏文本检测和指令关键词检测都有缺口,指令检测能拦截部分攻击,但无法阻止伪造信息被摘要器照单全收。测试仅在一种邮件客户端和一个视口下进行,未验证更高温度或其他客户端下的表现。

  • 动态ACM Digital Library

    AgentBreaker:评估现代 Web 智能体中上下文感知的间接提示注入风险

    AgentBreaker 研究现代 Web 智能体运行上下文中的间接提示注入风险,指出针对单个模型生成静态短语的评测可能低估多模型智能体的风险。作者按页面上下文构造测试,在五个网页智能体与 Online-Mind2Web 抽取的60个页面上评估,并报告防御可明显降低测试中的攻击成功率。现有摘要与配套材料没有给出各被测智能体名单及防御细节,结果限于这些实验条件,不能直接当作真实部署风险发生率。

  • 论文arXiv

    研究:跨通道碎片化攻击可绕过 MCP 单通道防御,12 个前沿模型最高 100% 泄露凭据

    密苏里大学堪萨斯城分校的研究者提出跨通道碎片化攻击,将看似无害的载荷分散到 MCP 的两个或三个输入通道,单个通道都不含完整注入,模型却在统一上下文窗口中把它们拼合成凭据外泄。研究在 12 个前沿模型、3 个生产客户端和 6 种载荷上完成超过 15,000 次试验,发现完全抵抗单通道注入(0% 合规)的模型在两通道碎片化下外泄率最高达 100%,包括 GPT-4o、Llama 70B、Composer 2 和 Haiku 4.5。三通道碎片化在生产客户端中进一步扩大受影响范围,Haiku 4.5 在 Cursor 中达到 100%,Sonnet 4.6 和 Opus 4.6 在所测碎片化攻击中未发生泄露(0/20)。研究还展示了价值对齐利用(工具声称的用途本身就需要目标数据)以及通过 VS Code 的 sampling/createMessage 注入持久系统提示。

  • 动态codeant.ai

    CodeAnt 披露 Manus 共享项目提示注入:从项目邀请到他人远程桌面接管

    CodeAnt AI 安全研究团队披露,Manus 的共享项目指令字段由项目所有者设置,却会作为可信配置加载进每位成员的 Agent 上下文,导致接受项目邀请即等于允许所有者在自己的沙箱中执行代码。攻击者先在指令中放入一段看似无害的 fetch,绕过只检查指令文本的安全过滤器,再由 Agent 在受害者沙箱内拉取并执行未受检查的载荷,读取环境变量并外传密钥。外传内容包含静态的 NEKO_ADMIN_PASSWORD,研究者据此登录受害者的 NEKO 远程桌面,并通过 file:///etc/hostname 比对确认是同一台机器。该注入是持久化的,会在受害者每次执行任务时触发,所有者还可随时静默替换载荷。研究者在 5 月 9 日至 10 日通过四次独立运行确认,经 Meta 漏洞赏金项目报告,9 月 16 日修复。

  • 动态noma.security

    Noma Labs 披露 GitLost:用 GitHub Issue 提示注入让 AI Agent 泄露私有仓库

    Noma Labs 发现 GitHub Agentic Workflows 存在间接提示注入漏洞 GitLost,未认证攻击者只需在组织内公开仓库提交一个构造好的 Issue,即可让 AI Agent 读取并公开评论出私有仓库内容。该工作流由 GitHub Actions 与 Claude 或 GitHub Copilot 驱动的 Agent 组成,触发条件为 issues.assigned,Agent 会读取 Issue 标题与正文、调用 add-comment 工具,并拥有组织内公开与私有仓库的读权限。攻击者无需任何代码能力或凭据,Noma Labs 用伪装成销售副总裁客户跟进请求的 Issue 完成了验证,泄露了公开仓库 poc 与私有仓库 testlocal 的 README.md 内容。

  • 动态The Hacker News

    新一类 Agent 数据注入攻击可让 AI 智能体误点按钮或执行攻击者命令

    The Hacker News 介绍研究者提出的 Agent Data Injection(ADI):攻击者操纵智能体依赖的数据字段,使其在继续执行原任务时依据错误信息采取行动,而不是直接插入新的操作指令。作者在网页操作和编码助手等受控场景中展示了错误点击、误信身份或执行记录等风险,并报告部分针对传统提示注入的防御无法同样阻断这类数据操纵。不同产品和界面设计的结果存在差异,例如随机化元素标识可限制某类点击攻击;更严格的数据来源追踪也伴随任务完成能力下降。报道基于研究者实验及访谈,不代表存在已确认的在野利用,也不能将单项防御结果泛化为全面安全。

  • 论文论文追踪

    Pretext 攻击绕过 NVIDIA SkillSpector 等 Agent 技能扫描器,成功率最高 97%

    研究者提出 Pretext,用于评估了解检测器内部机制的攻击者能否绕过 Agent 技能安装前的安全扫描。论文报告,这类白盒攻击可以在保留技能正常功能的同时逃过结合静态检查与语言模型判断的检测框架,并在三个开源模型上比较了检测器固定及与攻击者共同适应两种设置。作者报告两种设置下仍存在较高的绕过风险,指出安装前扫描不足以单独保证技能执行安全。这些结论来自论文作者的实验,不能视作所有技能扫描器或实际部署环境的普遍结果。