攻击arXiv 2608.09867
研究者利用加密推理块跨模型兼容性窃取专有 LLM 推理链
利用加密思维块的跨模型重放,诱导弱模型逐字转写专有推理链
- arXiv
- 2608.09867
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 测试
- Claude Opus 4.8、Claude Sonnet 4.6、Claude Haiku 4.5 等 15 个
摘要论文揭示了客户端加密思维块跨模型互换漏洞,提出了低成本提取方法并给出防御方案。
另有 78 篇论文还没打上分类标签,暂不在筛选结果里。
利用加密思维块的跨模型重放,诱导弱模型逐字转写专有推理链
摘要论文揭示了客户端加密思维块跨模型互换漏洞,提出了低成本提取方法并给出防御方案。
提出自博弈红队智能体 GPT-Red,自动挖掘提示注入与越狱攻击
系统分析智能体支付协议 AP2,揭示合法签名无法阻止前置上下文操纵
提出 A2A-TIBA 间接提示注入,诱导智能体部署常驻回调并外传数据
A2A-TIBA 把间接提示注入和绕过放进 A2A:gray-box 攻击者已能投递任务,诱导目标部署常驻回调程序后,下令和外传不再经过智能体。
提出 Repeat-After-Me,以图像前缀诱导智能体调用工具或泄露隐私
摘要论文提出了针对黑盒 VLM 的前缀诱导自适应视觉提示注入,在多款模型上诱发了工具调用与隐私泄露。
提出任意字母置换密码越狱,无需微调即可诱导有害输出
摘要前沿大模型无需微调即可通过提示词学会字母置换密码,进而绕过分类器与对齐,作者呼吁关注能力提升带来的安全风险。
提出 ECLIPSE 双通道自演化提示注入,劫持长程智能体动作轨迹
提出 PMPA,诱导智能体把外部恶意指令写入持久记忆并跨会话泄露隐私
摘要论文提出了持久记忆投毒攻击 PMPA,报告了 harness 智能体在处理外部数据时易受跨会话记忆投毒与隐私泄露的风险。
提出残余权限重放攻击,跨任务复用已批准授权绕过确认