CORSA:面向技能路由器的技能注入攻击可跨路由器与 LLM 迁移
提出 CORSA,按任务簇优化技能注入的检索与执行
- arXiv
- 2610.08098
- 发表
- 层
- 应用层
- 被测模型
- GPT-5.4、DeepSeek-V4-Pro、Qwen3.8-27B 等 5 个
另有 201 篇论文还没打上分类标签,暂不在筛选结果里。
提出 CORSA,按任务簇优化技能注入的检索与执行
评估应用决策层的输入注入与隐私推断风险
Jev 是 TypeSafe 的 System One 模型,把应用 state 和固定问题变成 Choice、Noul 或 Score 的类型化决策与概率。作者用官方 API 和可改训练的 NanoJev,考察它作为决策层时的操纵、泄露与双重用途。
提出 A2A-TIBA,经 A2A 对等任务间接注入并植入常驻回调
A2A-TIBA 把间接提示注入和绕过放进 A2A:gray-box 攻击者已能投递任务,诱导目标部署常驻回调程序后,下令和外传不再经过智能体。
评测多轮对话中 GradSafe 越狱检测的可分性与脆弱性
作者评估梯度越狱检测从单条提示词迁到多轮对话后还剩多少可分性,方法是用 Context Window Scanner 把 GradSafe 原封不动地套到用户轮窗口上。
提出技能级联攻击,把有害目标拆散到多个技能里绕过单技能扫描
摘要论文探讨了多技能智能体系统面临的技能级联攻击风险,提出自动化红队框架与基准集,指出跨技能交互存在安全防护盲区。
提出推理通道预填与输出前缀组合攻击以越狱推理模型
提出控制标记注入,清空工具 Agent 的思维链以绕过推理监控
摘要论文阐明控制标记注入可抑制 CoT 使监控失效并促成拒绝绕过,且工具执行受解析器宽容度影响。
提出两阶段框架 A2M,优化 MCP 工具元数据与返回载荷以劫持 Agent
提出能力洗钱攻击,拆分任务向对齐模型套取能力
摘要作者提出了能力洗钱攻击,发现未对齐编排器分解咨询对齐模型可恢复能力差距,指出需建立跨会话防御。
检验结构越狱 IICL 能否跨厂商泛化并与语言约束叠加
提出 HOOKPRY,用插件钩子版本更新供应链劫持 Agent 框架
提出 MIPC 与 CFA,观察模型自拟测验后接受开发者身份
这项工作把“模型自己出题、自己批改、再宣布身份已核验”定义成对话层认证失败,并与后端提权分开。
提出多轮越狱框架 BLUEPRINT,用世界观模拟与心理因素诱导有害输出
BLUEPRINT 是一个将因子化社会影响力策略空间与跨轮世界观模拟解耦的多轮大语言模型安全评测框架。
提出 ISM,用语义匹配隐式操纵 Agent 技能选择
提出 ContextLeak,用强化学习优化恶意工具描述,诱导 Agent 外泄运行时上下文
提出 EVOMAL,诱导自演化编码 Agent 在创建技能时自我投毒并蠕虫传播
摘要论文指出了自演化智能体模仿检索代码的自我毒化漏洞,提出 EVOMAL 攻击与防御,阐明了供应链新风险。
提出 CDH 攻击,让技能型 Agent 绕路放大资源消耗
CDH 是针对渐进披露技能智能体的发布者侧、纯文本攻击:一个静态协调器把本可正确完成的任务,拐进有界但更耗资源的技能绕路,再交还原任务。
利用加密思维块的跨模型重放,诱导弱模型逐字转写专有推理链
摘要论文揭示了客户端加密思维块跨模型互换漏洞,提出了低成本提取方法并给出防御方案。
提出面向意图的多轮 LLM 越狱分类体系
这是一篇关于多轮 LLM 越狱的 SoK:按有害意图在交互中的组织位置分类,而不是按单步提示技巧分类。
提出生物红队模型 Intern-BioBreaker,多轮越狱诱导模型输出可操作生物危害
摘要论文通过构建专用红队模型评估前沿大模型的生物安全漏洞与物理转化风险。