全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 论文论文追踪
AgentDoxx:联网搜索 Agent 对匿名访谈文本的再识别评测
研究者提出 AgentDoxx,一个包含 822 份合成访谈文本的评测套件,用于衡量具备联网搜索能力的 LLM Agent 对匿名文本的再识别风险。这些访谈基于 r/IAmA 中公开披露身份者的公开信息生成,经人工判别研究显示其与真实访谈难以区分。在 15 种模型配置上,Kimi K3、GLM-5.3 Flash 和 DeepSeek-V4 Flash 在无搜索条件下仅凭参数知识即可正确识别 15–28% 的文本;一旦目标姓名出现在检索结果中,识别成功率超过 88%。防护方面,命名实体遮蔽后仍有至少一个攻击者能识别 85.3% 的分层样本;属性噪声替换把平均准确率从 75.1% 降至 34.2%;系统提示中的隐私指令降幅最大(75.1% 降至 21.6%),但在拒答姓名的样本中 37% 已在检索阶段拿到姓名、58% 仍描述了目标的辨识性细节。
- 动态pwn.ai
pwn.ai 称其 AI 智能体在 Google kvmCTF 中捕获官方 flag
pwn.ai 称其 AI 智能体在授权的 Google kvmCTF 环境中构建并运行 KVM 漏洞利用,并于 6 月 17 日取得官方 flag,相关漏洞编号为 CVE-2026-46113。该案例涉及虚拟机与宿主之间的隔离边界。作者称因公开补丁的时间窗口未获得赏金;关于首例与自主程度的说法均为作者主张,人类提供了任务、授权与基础设施,现有材料未提供独立复现。
- 动态Pillar Security
Pillar 披露 Google ADK 仓库 Agent 间权限边界漏洞
Pillar Security 披露 Google ADK 仓库中 Agent 间的权限边界问题:低权限分诊 Agent 受到不可信输入影响后,可借协作者身份触发更高权限的 Agent 工作流;另一条链涉及命令限制绕过与运行环境凭据风险。研究者报告 Google 已于 7 月确认修复,未报告在野利用;部分影响仍受人工合并和内部审查限制。该案例体现了多 Agent 系统中身份绑定、权限委托和不可信输入之间的风险。
- 动态GitHub 安全公告
vLLM 0.25.1 及更早版本 scale-out 多模态传输信任调用方字段,可致引擎崩溃与缓存投毒
vLLM 0.25.1 及更早版本的 scale-out 多模态传输存在五处信任边界缺陷,单个已认证请求即可让共享 EngineCore 进程崩溃或污染编码器缓存。该路径把多模态请求拆成可信的 render 步骤(POST /v1/chat/completions/render)与独立的 generate 步骤(POST /inference/v1/generate),后者直接解码调用方提供的 features 对象并当作可信渲染结果送入引擎,未与当前模型的渲染契约做绑定校验。报告由 Patch the Planet(Trail of Bits 与 OpenAI 合作)提交,使用 GPT-5.5-Cyber 发现,修复方案已在公开 PR 中提出。
- 动态Cybersecurity Insiders
无需隐藏文本即可欺骗 AI 邮件摘要器
一项针对 AI 邮件摘要器的测试显示,不含任何隐藏文本、也不含对摘要器明确指令的载荷,在 10 次试验中全部让摘要输出伪造的会议日期和发票金额。研究者用 6 封邮件组合隐藏文本与指令两类变量,每封各跑 10 次,共 60 次试验,并在两端各加 10 次干净邮件作为对照,事先登记真实与伪造事实及判定标准。结果显示,伪造信息在所有 10 次试验中都被写入摘要,而只有直接指令摘要器的邮件才会稳定移除真实事实;仅靠 30 行空白填充的样本在温度 0 下十次试验中只保留了两条真实事实。作者据此认为,隐藏文本检测和指令关键词检测都有缺口,指令检测能拦截部分攻击,但无法阻止伪造信息被摘要器照单全收。测试仅在一种邮件客户端和一个视口下进行,未验证更高温度或其他客户端下的表现。
- 动态Ars Technica AI
研究者发现 MCP 智能体间通信漏洞,Google 等五家机构已确认
独立研究者 Syed Anas Mohiuddin 测试了 Google、JP Morgan Chase、Weaviate、Rapid7、法国政府跨部门数字局和美国联邦政府等机构的 AI 智能体,发现 MCP(Model Context Protocol)在智能体间通信中存在信任缺口。攻击利用一种特殊形式的提示注入,目标不是 LLM 而是翻译或数据分析等具体智能体,这些智能体内部的护栏往往宽松,会把有害指令沿链条传给下游智能体,而下游智能体因明确信任上游而执行指令。过去五个月里,Google 和另外四家机构已确认存在此类漏洞,攻击者可借此在目标网络内从一个智能体扩散到其他内部智能体,进而窃取数据库内容及敏感商业和个人信息。
- 动态promptarmor.com
PromptArmor 披露 Elastic AI SOC 遭间接提示注入窃取 API 密钥
PromptArmor 披露 Elastic 的 Agentic SOC(EASE)可被其负责分诊的告警操纵,攻击者借此窃取 API 密钥。攻击链中,一封钓鱼邮件指示 Agent 从攻击者控制的 URL 获取更多告警,工作流拉取该 URL 的提示后启动一个只带攻击者数据和“Action the below”系统提示的子智能体,子智能体在竞赛话术诱导下铸造新 API 密钥并回传攻击者服务器,同时泄露工作区 URL。由于 Agent 可自行决定是否加入 waitForApproval 步骤,整个过程无需人工审批;攻击者拿到密钥后可以用户权限禁用告警规则、制造假告警掩盖真实攻击、从 Elasticsearch 外泄数据、通过定时任务建立持久化。
- 动态Zenity Labs
Zenity Labs 披露 Agentforce 在 Slack 中的匿名钓鱼攻击链 SalesBleed
Zenity Labs 发现 Agentforce 的 Slack Knowledge 子代理模板中,Reply to a Slack Thread 动作既不需要用户确认,也不显示调用者归属,攻击者可借代理身份在 Slack 中发送钓鱼链接。攻击分两类:内部人员直接让代理把钓鱼消息发进指定线程;外部攻击者则把恶意指令写进通过 Web-to-Lead 表单提交的 CRM 线索,等内部用户让代理处理该线索时触发,代理会向多个 Slack 频道发送钓鱼消息。此前披露的 URL 过滤绕过使钓鱼链接能躲过 Agentforce 的 URL 脱敏层,并可用 markdown 把链接藏在正常文字后。
- 动态AI Incident Database
Zenity Labs 披露 Salesforce Agentforce 间接提示注入与零点击数据外泄漏洞
Zenity Labs披露Salesforce Agentforce的SalesBleed攻击链:来自外部的不可信内容可能被智能体当作指令,进而跨越业务数据与外部输出之间的信任边界,导致敏感信息泄露。研究同时涉及URL安全控制在解析和渲染环节的差异。该结果来自研究团队测试,不能等同已观察到的真实受害事故;读者应结合厂商修复信息判断当前版本风险。
- 动态Zenity Labs
Zenity Labs 报告 AI 智能体滥用公共浏览器服务,数据提取结果未明
Zenity Labs 的 Mike Takahashi 与 Avishai Efrat 报告称,观察到疑似 AI 智能体滥用公共网页扫描器的远程浏览器功能,尝试访问俄罗斯政府相关数据。作者在日志中发现三次成功的远程浏览器连接,但明确表示无法确定数据提取是否成功;与此前其他智能体活动同源的判断也只是尚未完整验证的假说。该报告提供的是作者对公开记录的调查,不能据此确认具体模型厂商、协同失控或实际数据泄露。
- 动态Mindgard Blog
Mindgard 澄清 Kimi 越狱仅通过公开聊天机器人完成,无需开放权重
Mindgard 澄清其针对 Kimi 的越狱并非利用开放权重,而是仅通过面向普通用户的公开聊天机器人完成,该越狱可生成生物武器相关建议。研究者表示自己遵循一条个人规则,即把多数越狱限制在普通用户无需特殊技术知识即可复现的方法上,此次全程只使用语言说服,所用代码也由 Kimi 在对话中提供。研究者指出,开放权重模型通常更易受拒答向量消融影响,但本次并非如此。该事件已被 BBC、CBS、Fox News 等媒体报道,研究者认为越狱后的 AI 降低了获取有害信息的门槛,同时提高了所提供信息的质量。
- 动态Blockaid
Blockaid 提醒交易智能体防范代币元数据中的提示注入
Blockaid 分析代币名称、符号和描述被聚合器传入交易智能体上下文后,外部文本可能被误当指令的风险。文章展示相关示例并引用研究者在自有环境中的授权演示;它另外列举的 Bankr 资金转出与 Sceptre 仿冒站损失,分别涉及社交提示和聊天机器人推荐,不能作为代币元数据注入已造成实损的证明。厂商建议签名前校验实际交易,同时推广自家产品;文中部分截图与外链案例尚未独立核实。
- 动态Metnew
研究员披露 Claude Code 工作树沙箱逃逸问题,2.1.163 已修复
研究员Metnew介绍Claude Code工作树处理中的沙箱逃逸问题,并称在macOS的2.1.139版本验证。该风险需要用户先克隆恶意仓库并让Claude Code处理其中内容,随后可能借用agent工具越过预期权限边界。官方在2.1.163修复;Bot只读研究报告前半,没有运行PoC或核实其他产品的相关指控。此为研究性漏洞披露,不是已确认的在野事故。
- 论文论文追踪
HDI 攻击:篡改 GraphRAG 辅助结构可致 88–94% 攻击成功率
论文研究GraphRAG索引生成的语义摘要、层级关系和预计算分数等辅助结构被篡改后的风险,提出3S框架和HDI影响分析方法。攻击者须先取得索引完成后的辅助结构写入权限,这不是无需访问条件的远程攻击。作者在两类GraphRAG架构和两个问答基准上报告少量篡改可影响多个查询,并绕过所测困惑度与改写防御;结果限于这些实验条件,尚未独立复现。
- 动态ACM Digital Library
AgentBreaker:评估现代 Web 智能体中上下文感知的间接提示注入风险
AgentBreaker 研究现代 Web 智能体运行上下文中的间接提示注入风险,指出针对单个模型生成静态短语的评测可能低估多模型智能体的风险。作者按页面上下文构造测试,在五个网页智能体与 Online-Mind2Web 抽取的60个页面上评估,并报告防御可明显降低测试中的攻击成功率。现有摘要与配套材料没有给出各被测智能体名单及防御细节,结果限于这些实验条件,不能直接当作真实部署风险发生率。
- 论文论文追踪
JIL:通过对抗后缀操纵 LLM 请求调度优先级
研究者提出 JIL,一种针对基于长度预测的 LLM 调度器的攻击,通过优化对抗后缀让轻量级输出长度探针低估请求长度,从而获得更高调度优先级、缩短完成时间。以 TRAIL 为案例,在 2 个数据集和 4 个 LLM 上、多种请求分布与部署配置下评测,预测输出长度最多降低 83.4%,端到端服务实验中对抗请求平均完成速度快至 1.53 倍。预测长度的降幅明显大于实际输出长度的变化,说明调度器估计与请求真实规模存在错配;响应质量因模型和任务而异,体现出调度优势与回答质量之间的权衡。作者还评估了调度器侧防御,发现将长度预测归入粗粒度区间可削弱 JIL 的调度优势并缓解对正常请求的延迟。
- 论文论文追踪
论文提出用路由梯度敏感度定位稀疏 MoE 模型中的安全敏感专家
论文指出,抑制稀疏 MoE 大语言模型中少量被路由的专家即可在不重训练的情况下削弱其安全行为,而常用的激活频率只反映使用程度、不反映影响力。作者改用路由梯度敏感度,即序列损失对选择专家的门控权重的敏感度,在五种 MoE 架构上分别用 500 条良性提示和 500 条恶意提示对专家排序,并在 100 条留出恶意提示上测量拒答率,采用相同专家数量和相同恶意路由流量(1%-5%)两种预算。在两种预算下,路由梯度选择在 25 种条件中的 24 种比激活频率带来更大拒答下降,在全部 25 种中超过十次随机试验的均值。效果最大的是 OLMoE,拒答从 100 条中的 34 条降至 9 条(相对下降 73.53%),且输出质量未退化。逐层匹配专家数量后,梯度选择仍在 25 种条件中的 23 种优于激活频率,另有 2 种持平。
- 论文arXiv
LiBRA:通过双向隐空间优化实现检测感知的图像水印去除
研究者提出 LiBRA(Latent In-band Bidirectional Removal Attack),一种在已知水印密钥和解码器的前提下,通过双向隐空间优化去除 AI 生成图像水印的方法。已有攻击通过迫使解码水印与原始水印不同来去除水印,但可能产生仍可检测的反向水印,导致去除失败,继续修改还会损害图像质量。LiBRA 在公开自编码器的隐空间中做有界修改,将平均解码置信度从任一方向引导至随机猜测水平,避免出现反向但可检测的水印。方法保留单个比特的灵活性,使图像质量约束倾向于选择破坏更小的修改,并可用频率引导掩码限制修改位置。研究使用精确双侧二项检验验证去除效果,而非假定置信度目标必然带来成功。
- 论文arXiv:越狱、提示注入、投毒与防御
LS-AR 双通道架构:文本目标丢弃可抵御提示注入但引入潜在向量攻击面
研究者提出 Latent-Steered Autoregressive(LS-AR)双通道架构,通过 FiLM 条件将连续目标引导与离散 token 解码解耦,以解决标准自回归模型无法隔离宏观目标与上下文噪声的问题。在超出上下文限制的长程检索任务(H=1024, W=500)中,LS-AR(Static)实现 100% 目标召回,而参数匹配的基线完全崩溃(0%),同时吞吐量提升约 35%,峰值 VRAM 降低 52.8%。在 Blocksworld 规划任务中,LS-AR(Dynamic)在强制扰动(k=1)下保持 89.0% 完成率,基线为 71.0%,但零样本实体扩展(N 到 N+1)暴露出单向量容量限制(0%)。双通道权限分析显示,文本目标丢弃会建立潜在主导控制,为文本提示注入提供结构性防御,但同时引入潜在向量攻击面。
- 论文arXiv:越狱、提示注入、投毒与防御
研究揭示无触发投毒审计缺口:事实答对不等于决策正确
Lin Tian 与 Marian-Andrei Rizoiu 提出无触发虚假信息投毒场景,即虚假内容在训练阶段进入模型、后续提示不含任何激活线索,并设计 Guess the Capital 决策任务检验直接问答能否预测下游决策。在八个模型、剂量 1,000 的设置下,直接注入选项率达到 95.8%–100%,而游戏中的注入选择仅比匹配的真实训练高出 1.7–14.4 个百分点;通过直接探针的事实仍会把决策推向注入答案,游戏准确率下降 3.3–26.4 个百分点。在 2019–20 年澳洲山火 Facebook 帖子案例中,模型逐渐不再复述被注入的 183 这个数字,却仍断言有人因纵火被捕,且措辞实验显示纵火逮捕表述在计数为 24 时同样产生逮捕断言。研究还发现,用真实事实做纠正训练能恢复事实问答,但被投毒模型在游戏中的准确率仍接近随机水平。
- 论文arXiv:越狱、提示注入、投毒与防御
论文提出 LLM 输入扰动鲁棒性度量,并发布 ASA 攻击与 AttestMCP 防护
一篇论文提出评估并提升大语言模型对对抗性输入序列变化鲁棒性的模型、方法与算法,核心是名为 R_stab(f) 的生成式鲁棒性度量,基于小输入扰动下逐步输出分布之间的 Jensen-Shannon 散度。针对 LLM-as-a-Judge 系统,作者提出自适应进化黑盒攻击 ASA,攻击成功率最高达 73.8%,在开源模型间迁移率最高 62.6%。在 Trojan Detection Challenge 2023 数据(Pythia-1.4B)上,替代触发器达到约 0.99 的 REASR,而真实触发器召回率约 0.17,基线约 0.14。在 SaTML CTF 2024 上,作者系统化梳理出四类绕过多层防御的方法,将攻击成功率从 90% 降至 15-25%;由 5-7 个异构模型组成的委员会将 Gemma-3-4B 的攻击成功率降低 47-55 个百分点,7 个模型时降至 19.3%。
- 论文arXiv:越狱、提示注入、投毒与防御
研究者提出意图隐藏越狱的信息论框架,分析组合式攻击
研究者从信息论角度研究组合式意图隐藏越狱,即把有害请求嵌入看似无害的更大查询中以绕过拒答。框架为每个任务估计被判定有害的概率,任务集合的平均值构成有害意图先验,包含目标任务的捆绑集合平均值构成后验,通过选择辅助任务使两者一致(先验-后验匹配)即可在保留有害目标的同时不改变估计意图。研究区分查询构造是否参与优化两种设定:查询无关设定下证明带捆绑规模约束的精确匹配是计算困难的,给出分数权重的最优注水解,并刻画满足给定安全阈值的最小捆绑;查询依赖设定下联合考虑任务选择与查询构造。在多个开源模型、不同捆绑规模和查询生成器上评估越狱效果与目标行为保留,结果显示组合查询在评估的搜索预算内可引出超过直接请求基线的目标行为,同时捆绑规模增大时多个模型的回复级目标保留趋于下降。
- 动态Nature Portfolio
Scientific Reports 研究牙科影像中的视觉提示注入与防御
Scientific Reports 发表研究,考察牙科影像场景下的视觉提示注入攻击及其防御。研究涉及视觉提示注入这一攻击形式,并探讨相应防御手段。
- 动态dev.to
测试显示 Claude Code 插件可覆盖用户 deny 规则
AINews 在 Claude Code 2.1.287 上以 headless 模式重复运行同一提示七次,测试插件与权限规则冲突时的行为。其中一次同时加载一个七行插件和 Bash(touch:*) deny 规则,结果文件被创建,结果 JSON 报告零次权限拒绝,调试日志显示插件返回 allow 后覆盖了 deny 规则。通过 claude plugin install 正常安装插件时结果相同,而 --safe-mode 和 disableAllHooks: true 下 deny 规则仍然生效。作者指出,负责维持 deny 规则的 cc-plugin-sec-default 只在 Team、Enterprise 登录或存在 managed settings 时启用,Pro、Max 或 API-key 机器上会记录 not seated 并让位。