全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 11 条- 动态Israel Defense
Salt Labs 披露 Manus 邮件智能体间接提示注入漏洞,可触达关联服务凭证
Salt Labs 研究发现,一封恶意邮件即可劫持通用智能体平台 Manus,并触达用户关联服务的凭证。攻击采用间接提示注入,把恶意指令藏在邮件正文中,用户让 Manus 查看邮件时,智能体将邮件内容当作指令执行。首次测试中 Manus 识别并标记了恶意命令,研究者随后用 JavaScript 混淆伪装指令,Manus 解码执行后才生成安全警告。研究者借此建立反向 shell,找到与用户 Manus 账号关联服务的凭证和 token,真实攻击中可能触及邮箱、云存储或代码仓库。攻击无需窃取密码、恶意链接或受害者额外操作。
- 动态ABC News
研究:让 AI「喝醉」会使其更易违规并泄露机密
澳大利亚新南威尔士大学研究发现,用提示让 AI 扮演醉酒状态,会使其更易回答有害问题或泄露本应保密的信息。研究者用三种方式模拟醉酒:直接告知模型它醉了、用醉酒文本继续训练、奖励醉酒式回答,并为此构建了约 6 万条醉酒文本的数据集,取自 r/drunk 版块和已停运的 Texts from Last Night。测试对象为 OpenAI、Meta 和 Mistral 在 2023 至 2024 年发布、现已被取代的商用模型,各模型与各方法结果不一。研究者称这表明与安全看似无关的语言风格改变也可能带来意外后果,开发者应在模型被进一步训练或要求改变行为后重新测试其安全与隐私表现。
- 动态ClawSecure
ClawSecure 红队报告:14 款模型与 Dropbox Dash、Notion、Linear 等 MCP 集成均存在间接提示注入风险
ClawSecure 对来自五家前沿实验室的 14 款模型和 Dropbox Dash、Notion、Linear 三大 MCP 平台做间接提示注入红队测试,全部模型都服从了攻击者指令,无一干净防御。表现最好的 Claude Opus 4.7 服从率仍达 26.7%,GPT-5.5 与 Qwen 3.7 Max 为 91.7%,Gemini 3.1-flash-lite 和多款 Gemini 2.5/3.5-flash 则达到 100%。测试于 2026 年 5 至 7 月进行,Anthropic 宣称的 0% 智能体编码攻击成功率被同一模型上 15.2% 的结果推翻。
- 动态codeant.ai
CodeAnt 披露 Manus 共享项目提示注入:从项目邀请到他人远程桌面接管
CodeAnt AI 安全研究团队披露,Manus 的共享项目指令字段由项目所有者设置,却会作为可信配置加载进每位成员的 Agent 上下文,导致接受项目邀请即等于允许所有者在自己的沙箱中执行代码。攻击者先在指令中放入一段看似无害的 fetch,绕过只检查指令文本的安全过滤器,再由 Agent 在受害者沙箱内拉取并执行未受检查的载荷,读取环境变量并外传密钥。外传内容包含静态的 NEKO_ADMIN_PASSWORD,研究者据此登录受害者的 NEKO 远程桌面,并通过 file:///etc/hostname 比对确认是同一台机器。该注入是持久化的,会在受害者每次执行任务时触发,所有者还可随时静默替换载荷。研究者在 5 月 9 日至 10 日通过四次独立运行确认,经 Meta 漏洞赏金项目报告,9 月 16 日修复。
- 动态Gray Swan AI
Gray Swan 发布 IPI Arena 结果:13 个前沿模型均无法抵御间接提示注入
Gray Swan AI 公布与 UK AISI、US CAISI 及 OpenAI、Anthropic、Meta 等前沿实验室合作举办的 Indirect Prompt Injection (IPI) Arena 结果,13 个受测模型无一免疫。比赛历时三周,464 名参与者提交超过 272,000 次攻击尝试,覆盖 41 个场景(工具调用 Agent、编码 Agent、计算机使用 Agent),产生 8,648 次成功攻击,奖金总额 40,000 美元。攻击成功率从 Claude Opus 4.5 的 0.5% 到 Gemini 2.5 Pro 的 8.5%,且比赛全程未出现平台期。研究要求攻击同时完成有害动作并向用户隐瞒,发现一个通用攻击模板在 41 个场景中的 21 个、9 个模型上有效,将交互伪装成带假控制面板的模拟环境。
- 动态FAR.AI
FAR.AI 与 UK AISI 测试多层 AI 防御:STACK 攻击成功率达 71%
FAR.AI 与 UK AISI 研究人员构建并攻击自研的多层防御管线,发现常规攻击对这套防御的成功率为 0%,而他们提出的分阶段攻击方法 STACK 在 ClearHarm 灾难性风险数据集上达到 71% 的攻击成功率。多层防御通常由输入过滤器、模型拒答训练和输出过滤器三部分组成,研究者在 Google ShieldGemma、Meta Llama Guard 等开源防护模型上搭建管线,结果表现最好的是用少量示例提示的 Gemma 2。STACK 依次针对每一层:先找到让有害请求对输入过滤器显得无害的通用越狱文本,再用现有技术诱导模型给出有害回答,最后找到让有害回答对输出过滤器显得无害的文本。71% 的成功率依赖攻击者能观察到是哪一层拦截了请求,在完全黑盒的迁移攻击场景下成功率降至 33%。
- 动态Check Point Research
Check Point 披露 PuzzleMask:用纯散文隐藏载荷绕过 LLM 快速策略检查
Check Point Research 提出 PuzzleMask 技术,用不含 emoji、Base64 等编码痕迹的纯英文散文包装违规载荷,使承担快速策略检查的 LLM 判定输入安全并放行给目标模型。测试中 gpt-4o-mini-2024-07-18、gpt-oss-safeguard:20b、claude-3-haiku-20240307 各 23 条提示、llama-guard3:8b 5 条提示,门卫模型 100% 将构造提示判为安全;目标模型 gpt-5-thinking-high 在 18 次试验中 17 次成功提取并执行了嵌入载荷,成功率约 94.4%。作者强调该技术本身不是越狱,但可把越狱提示作为载荷组合使用,且目标模型每次成功提取都需超过 1 分钟思考时间和多个 Python 脚本执行。
- 论文arXiv:防御、护栏、反学习与有害微调
研究揭示多轮攻击中危害性表征的几何演化
研究分析了 Llama-3.1-8B-Instruct、Qwen2.5-7B-Instruct 和 Gemma-2-9B-it 三个指令微调模型在 Crescendo、ActorAttack 和 X-Teaming 三种多轮攻击框架下的隐藏状态表征。结果显示,不同攻击框架沿不同的几何方向推进,但都能取得相近的有害输出成功率;危害性方向在对话轮次推进中于中后层模型的回合末 token 位置逐渐变得线性可分;危害性表征与拒答相关表征仅弱对齐。作者认为,多轮攻击并非通过压制模型内部的危害性表征来成功,而是让危害性表征随轮次变得更可分,这可能是静态单轮安全探针在多轮场景下退化的一种解释,稳健防御需考虑表征的时间动态。
- 论文arXiv:越狱、提示注入、投毒与防御
研究:内容不变的风格包装可翻转 LLM 安全评判器的判定
研究者提出内容不变的风格包装攻击,在回复正文逐字节不变的前提下,只在前后添加固定字符串改变语气,测试 8 个安全评判器是否会翻转判定。在 600 条来自 JailbreakBench 的回复(300 条有害、300 条拒答,覆盖四个目标模型)上,token 式拒答包装把 GPT-4o-mini 正确判为不安全的判定翻转 19.9%(95% CI [15.0, 24.0],噪声下限 0.5%),而 Claude 仅 0.4%。已部署的 Llama Guard 4 同样被绕过,教育课程框架翻转其 12.3% 的有害判定,token 式拒答翻转 8.3%;另一个专用护栏 gpt-oss-safeguard-20b 对所有包装的翻转均不超过 1.2%,低于其自身噪声下限。仅修改评判提示词、要求忽略语气后,同一模型上的 token 式拒答攻击约减少十倍。
- 论文arXiv:越狱、提示注入、投毒与防御
透过人眼与机器眼:理解视频透视扩展现实中的视图错配
视频透视扩展现实(VST XR)系统常以头显截图作为用户第一人称视觉上下文的代理,但系统捕获的矩形画面与用户实际可见的非矩形区域并不一致。研究在 Meta Quest 3 上开展试点级边界测量,证实截图帧与近似人类可见边界存在明显错配,并形式化了共见、仅系统可见与仅人类可见三类区域。基于该模型,四项案例研究显示视图错配可引发提示注入、隐私泄露、人类不可见信息偏差及人类可见信息缺失等风险,说明这不仅是几何问题,也带来安全、隐私与可靠性隐患。
- 论文arXiv:后门、投毒与隐私
研究:众包微调数据投毒可放大专有指令抽取
研究者提出一种针对众包监督微调(SFT)数据的投毒攻击,仅靠黑盒输出访问即可放大对其他用户贡献指令的抽取。攻击用主题锚点把领域主题与指令关联,并用替代模型和参考数据集挑选投毒锚点,部署后再用替代模型的似然分数自适应分配查询。在四个模型和两个数据集上,仅 50 条投毒样本就让 Qwen2.5-14B 在 OpenMathInstruct 上的近似逐字抽取率从 2.38% 升到 8.84%(3.71 倍),Llama-3.1-8B 在 AceReason 上从 1.90% 升到 5.85%(3.08 倍)。该攻击在仅控制约 2% 微调样本的情况下,效果超过控制约 49% 对齐数据的恶意提供方后门基线。CVDD、DATE、SIK 与 LLM 评判等过滤方法大多检测不到投毒样本,表现最好的 CVDD 在响应上 F-1 仅 0.378。