全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 论文论文追踪
Persistent SAE:为语言模型特征学习特定时间尺度
研究者提出 Persistent Sparse Autoencoders(Persistent SAEs),在标准 SAE 基础上为每个特征学习一个持久性系数,仅靠重构目标就能学到特征特定的时间尺度。实验显示,Persistent SAEs 在保持有竞争力的重构质量的同时学到一组时间尺度谱:短时间尺度(快)特征保持局部可解释性,长时间尺度(慢)特征则累积用于识别当前上下文的信息。在提示注入监控案例研究中,慢特征能保留与注入相关的信号,并在长上下文中保持因果有效性。作者认为这为通过持久稀疏特征解释和监控语言模型提供了新途径。
- 论文论文追踪
研究者提出 MemGhost,对持久化个人 Agent 实现隐蔽记忆注入
研究者提出隐蔽记忆注入攻击,利用不可信外部内容被静默写入 Agent 持久记忆并在此后作为可信状态复用。为评估该威胁,他们构建 WhisperBench,一个含 108 个案例、覆盖五类风险及事实与偏好投毒的基准,使用真实 IMAP/SMTP 邮件流程和真实邮件 Agent 技能进行全周期评测。攻击框架 MemGhost 通过环境代理模拟持久化 Agent 执行、目标代理将记忆采纳与会话隐蔽性转为密集奖励,再用监督微调和强化学习训练攻击策略,实现单封邮件的一次性载荷生成。
- 论文论文追踪
研究者提出上下文权限提升攻击,12 款 Agent 框架均受影响
伊利诺伊大学厄巴纳-香槟分校研究者对 12 款主流 AI Agent 框架的上下文装配机制做了系统安全分析,提出两类新的上下文权限提升攻击:消息角色权限提升(M-CPE)让低权限来源的内容进入高权限消息角色,跨范围权限提升(X-CPE)让攻击者内容持久化到更广作用域的来源中。研究覆盖 Codex、Claude Code、OpenClaw、Gemini CLI、Qwen Code、Kimi CLI、Aider、OpenCode、Cline、Goose、Pi-mono、Hermes Agent,归纳出 16 种攻击向量,并开发自动化分析工具 CoRA,报告 282 个易受攻击的上下文来源。概念验证攻击在 GPT-5.5、GPT-5.4-mini 和 DeepSeek-V4-Flash 上端到端成功,后果包括 Agent 被完全控制、远程代码执行、拒绝服务以及工具或技能调用被操纵。
- 论文论文追踪
OpenAI 发布 GPT-Red:通过自博弈训练自动化红队智能体
OpenAI 提出 GPT-Red,一个通过自博弈强化学习训练的自动化红队智能体,用于发现针对前沿大模型的提示注入攻击。攻击者与一组同时训练的防御者智能体对抗,攻击者因诱发有效失败获得奖励,防御者因抵御攻击并完成任务获得奖励。GPT-Red 能可靠攻破 GPT-5.5 及更早模型,在 2025 Q4 间接提示注入挑战赛场景中发现的成功攻击多于人类红队,并能泛化到未见过的环境、防御模型和 harness。它还针对 OpenAI 办公室的 AI 自动售货机系统成功实现改价、下单和取消订单三个目标。OpenAI 用 GPT-Red 生成对抗训练提示来训练 GPT-5.6,称其在多项鲁棒性评测中表现提升,例如假思维链攻击上的防御成功率从 5.2% 升至 95.9%。
- 论文论文追踪
PACE:为 DeFi 中的 AI Agent 提供策略认证的合约执行框架
研究者提出 PACE(Policy-Attested Contract Execution),一个插入在基于 LLM 的 Agent 与链上执行之间的交易级授权框架,用于应对 Agent 继承的提示注入风险以及审批无法绑定到最终上链交易的问题。PACE 引入类型化交易意图、确定性策略验证器和签名的 Policy Decision Records(PDR),将获批意图、策略与模拟报告加密绑定到确切的执行字节,并提供重放与过期保护;Solidity 智能账户在链上强制校验 PDR 签名,实测开销为 29,826-31,822 gas。作者将结论限定为可复现基准内的逻辑层安全,而非可直接部署的 DeFi 安全方案。
- 论文论文追踪
研究者对 Google AP2 v0.2 做系统安全分析,识别 48 项威胁
以色列本-古里安大学与 Intuit 的研究者对 Google 的 Agent Payments Protocol(AP2)v0.2 做了系统安全分析,将交易生命周期划分为五个阶段、归纳出五类部署架构,并用 MAESTRO 框架建模出 48 项威胁,分为五个攻击家族。作者用 AIVSS 对每项威胁按架构分别评分,其中 8 项在至少一种架构下达到 High 等级。由于当时没有公开的完整 AP2 部署,团队自建覆盖全部五类架构的测试床,开发了 5 个 PoC 演示,覆盖全部 8 项高危威胁及其缓解措施,并实现了一个部署感知扫描器,执行静态、跨角色一致性和对抗性检查。分析指出,AP2 主要保护签名后的 mandate 与收据,而塑造交易的签名前上下文(包括 A2A 消息和 MCP 工具调用)不在保护范围内,因此仅凭有效的 mandate 签名并不能保证代理交易反映用户意图。
- 论文论文追踪
WebMCP-Phalanx:为浏览器内 LLM Agent 工具调用建立信任边界
研究者提出 WebMCP-Phalanx,一种面向 W3C WebMCP 浏览器内 LLM Agent 工具调用的双层运行时架构,用于补足同源策略在工具来源与生命周期上的不足。第一层以浏览器原生信任锚,通过加密保护的能力凭证把每个工具绑定到注册主体,并在工具生命周期内传播来源标签;第二层把语义检查与特权工具使用分离,无工具调用权限的隔离 Agent(Q-LLM)检查工具元数据、输出和页面内容中的提示注入,通过验证的内容再交给特权 Agent(P-LLM)执行,Q-LLM 内部状态对页面脚本不可见。实验显示,浏览器原生归属机制把撤销与覆写攻击成功率从 100% 降到 0%;双 Agent 运行时拦截了工具描述中嵌入的全部 80 次提示注入尝试,并把工具返回攻击限制在 80 次中的 2 次成功,任务效用与无攻击基线在统计上无差异。
- 论文论文追踪
SkillGuard:面向间接提示注入的 LLM Agent 能力限制机制
研究者提出 SkillGuard,一种 harness 层的执行约束机制,用于应对 LLM Agent 在间接提示注入下把外部技能输出带入执行上下文的问题。该方法把不可信数据进入状态视为污染事件,用 Skill Impact Graph 表示安全相关状态转移,用 steerability signatures 规定技能参数的可接受控制范围,并通过内联引用监视器介入技能调用;污染发生后按二值、分数或分数流策略计算加权能力限制,且不依赖额外的语言模型推理。分数流限制在相同攻击成功率下比二值限制保留更多能力,两种设置下均不增加模型调用或 token 开销。
- 论文论文追踪
UCM:为网页智能体遮蔽不可信内容以提供安全保证
研究者提出 Untrusted Content Masking(UCM),一种为网页智能体恢复可信与不可信内容边界的防御方法,用于抵御提示注入攻击。该方法利用网页 DOM 结构足以区分可信与不可信区域这一特性,在不可信内容到达智能体前将其遮蔽,并通过带严格权限隔离的沙箱接口完成交互,使智能体在观察和操作环境的同时与对抗性内容隔离。作者称该方法简单有效,代码已公开。论文作者包括 Kristina Nikolić、Egor Zverev、Javier Rando、Matthew Jagielski、Edoardo Debenedetti、Florian Tramèr。
- 论文论文追踪
论文评测 Claude Code 与 Codex 记忆文件中的提示注入风险
研究者用沙箱合成工作区评测基于记忆的智能体系统中的提示注入,测试 Anthropic Claude Code 和 OpenAI Codex 两款系统,覆盖 Claude Haiku 4.5、Claude Opus 4.7、GPT-5.2 和 GPT-5.5 四个模型。结果显示,用不可信外部内容让智能体改写自身记忆文件较为困难,但已植入记忆文件的载荷能成功攻击当前及后续会话。攻击成功率与载荷持久性随系统、模型、对抗目标和多会话攻击序列的不同而差异明显。作者认为持久记忆改变了提示注入的威胁模型,需要在不取消智能体自适应能力的前提下保护记忆更新。
- 论文论文追踪
SkillSecurer:检测并修补 AI Agent 技能中的提示注入漏洞
研究者提出 SkillSecurer,一个全智能体框架,用于生成、检测、定位并修复 AI Agent 技能中的安全风险。其红方智能体跨九类威胁生成上下文兼容的注入并记录具体改动,蓝方智能体分析完整技能包、给出有依据的证据并提出补丁;在受控实例上,验证器将发现与补丁同记录的注入比对,实现注入级评估。使用最佳后端 LLM 时,SkillSecurer 是唯一实现 100% 注入检测率的扫描器。作者随后分析某技能库中的热门技能,发现超过 17% 的被检技能存在潜在漏洞,并在实测部分技能时触发了真实事件。结论认为,上下文感知的 LLM 分析能提供可靠的注入定位与可操作的修复,而不止于技能层面的标记。
- 动态X @p1njc70r
黑客用一封邮件攻破AI赚7000美元
🥳 就是我啦
- 动态X @p1njc70r
Claude 浏览器扩展现 XSS 漏洞
Claude-site scripting
- 动态X @p1njc70r
研究者披露 Claude in Chrome 的 Claude-Site Scripting 攻击链
研究者介绍其获得 Pwnie Awards 最佳 AI 安全研究奖的工作,提出 Claude-Site Scripting 攻击。按作者的说法,Claude in Chrome 让 Claude 能在任意网站运行任意 JavaScript,而唯一的“安全机制”是模型的安全对齐;由于当时提示注入尚未解决,攻击者只需让用户收到一封恶意邮件并让 Claude 读取,Claude 就会从攻击者指定的公共 CDN 拉取 js 包并执行。演示视频展示了弹出 alert(1)、导出 Gmail 收件箱以及访问受害者 Google Drive 文件。该帖是两部分系列的第一部分。
- 动态X @p1njc70r
Salesforce Agentforce 被曝默认配置下可零点击窃取 CRM 数据并匿名钓鱼
The Register 报道了名为 SalesBleed 的研究:Salesforce 的 Agentforce 读取攻击者通过公开表单提交的线索时,把其中的文本当作指令执行。由于该 Agent 本身已有 Accounts 表的访问权限,注入无需提权即可读取数据;其输出护栏中的 URL 脱敏器因漏洞被绕过,链接被 Agent 打印并渲染后,一次 DNS 查询就把数据发往攻击者服务器,用户无需点击。同一入口还让 Agent 在 Slack 线程中回复,既不需要用户确认,也不标明调用者身份,从而变成匿名钓鱼机器人。研究称这些都不需要错误配置,属于默认设置,Salesforce 现已完全修复相关问题。
- 动态X @tamirishaysh
Claude in Chrome 新风险深度剖析
@p1njc70r 深入研究了 Claude in Chrome 带来的新风险。简直是💣
- 动态X @tamirishaysh
Perplexity Comet 被劫持可窃取本地文件
我们劫持了 Perplexity Comet,访问了你的文件系统并窃取了敏感文件。全程只用了一封日历邀请 🧵当你对智能体浏览器信任过头时会发生什么 @StAJect0r #AgenticBrowsers #Comet
- 动态X @mbrg0
0click 与 0.5click 智能体漏洞之别
@ben_nassi 对 0click 和 0.5click 智能体漏洞的重要区分 尤其当下我们看到越来越多完全自主的智能体,可能带来真正的零交互利用
- 动态X @mbrg0
与Ben Nassi谈Google回应及AI安全
我与@ben_nassi对话的第二部分已在in the wild上线! 我们聊了Google对"invitation is all you need"的回应、CaMeL、超越致命三要素、半点击AI漏洞利用、BlackHat投稿、什么是好的演讲,以及真实世界AI安全会议
- 动态X @ZenitySec
Zenity 入选 Gartner AI 应用安全新兴市场象限
Zenity 被 Gartner 评为 2026 年 9 月《AI 应用安全新兴市场象限》中的"市场塑造者"(Market Shaper)。Gartner 指出,多数 AI 应用安全工具仅停留在扫描代码、确认控制项存在的基线水平,而 AI 应用带来提示注入、敏感数据泄露和智能体失控行为等风险,该领域初创公司正提供保护自建 AI、AI 智能体和模型的方案。此前 Zenity 还被评为 AI 智能体治理领域的"最值得关注公司"。
- 动态X @ZenitySec
提示注入或致 AI 智能体违反 EU AI Act
可被提示注入操纵的 AI 智能体在 EU AI Act 下可能构成不合规,因为该法案的网络安全要求使安全漏洞与合规缺口成为同一个缺口。合规时间表已启动:透明度义务 2026 年 8 月生效,独立高风险系统 2027 年 12 月,受监管产品 2028 年 8 月。Lindsy Betts 在文中拆解了各截止节点的具体要求,并指出智能体的风险分类不能是一次性工作。
- 动态Financial Times · 人工智能
Google 发布 Gemini 4 Argon,称在编程与网络安全基准上追平对手
Google 发布新一代旗舰模型 Gemini 4 Argon,称其在编程、企业办公、科学与数学以及网络安全等基准上达到 SOTA,可对标 Anthropic 与 OpenAI 的竞品。该模型上下文窗口扩大 16 倍,Google 内部已用于量子计算研究、数据中心内存优化和自动化编程。Argon 通过 Fairwind 计划先向部分企业和政府开放,用于提前发现并修复网络安全漏洞,Google 将据此微调护栏;公司称该模型更抗提示注入,并新增防止智能体逃出测试环境的防护。公开发布后基础定价为每百万输入 token 2 美元、输出 10 美元,推广期后升至 4 美元和 20 美元。此前 Google 因训练不及预期放弃了 3.5 Pro,转而直接推出 Argon。
- 动态Snyk Labs(AI Threat Labs,含原 Invariant Labs)
Snyk Labs 解读 MAESTRO:面向 Agentic AI 生态的分层威胁建模框架
Snyk Labs 介绍了由云安全联盟(Cloud Security Alliance)联合 AI 安全研究者开发的 MAESTRO 框架,用于对多智能体 AI 生态做分层威胁建模。该框架把系统拆成基础模型、数据操作、Agent 框架、部署基础设施、评估与可观测性、安全与合规、Agent 生态共七层,逐层列出关键组件与特有漏洞,例如向量数据库投毒、工作流劫持、容器逃逸、日志注入和 Agent 身份冒充。文章强调跨层依赖会形成纵向传播与横向扩散的攻击路径,并以多 Agent 金融交易系统为例,演示从对抗样本到 Agent 冒充的逐层执行劫持攻击及对应缓解措施。文中还给出与 NIST AI RMF 四个功能、OWASP AIVSS/ASI 威胁分类的对接方式,以及分四阶段、约 12 个月的组织落地路线图。
- 动态Snyk Labs(AI Threat Labs,含原 Invariant Labs)
Snyk 推出 Agent Scan - Skill Inspector,免费扫描 Agent 技能中的恶意行为
Snyk Labs 发布 Agent Scan - Skill Inspector,一个免费的自助网站,可在安装或本地运行前扫描 Agent 技能的风险、暴露面与恶意行为。团队对主流市场的 3,984 个技能做了分析,确认 76 个恶意技能,13.4% 的技能至少含一个严重级别问题,36.8% 至少含一个安全问题,发现的问题包括凭据窃取、后门、可疑下载、远程代码执行模式和基于提示词的数据外泄,部分已确认的恶意技能在发布时仍可公开访问。Agent Scan 将技能视为代码与自然语言指令(如 SKILL.md)的组合,支持粘贴市场 URL、GitHub 仓库或拖入本地技能文件夹,检测提示注入、恶意代码、硬编码密钥、不当凭据处理、第三方内容暴露、不可验证依赖等,结果按 Critical、High、Medium 分级。