ColluSkill 用跨技能组合绕过 Agent 技能扫描器
提出 ColluSkill 跨技能组合攻击,拆分恶意载荷以绕过技能扫描器
- arXiv
- 2608.09732
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
摘要论文揭示了单技能孤立扫描的盲区,提出多技能链攻击 ColluSkill 与上下文防御 ChainGuard 并验证了有效性。
另有 444 篇论文还没打上分类标签,暂不在筛选结果里。
提出 ColluSkill 跨技能组合攻击,拆分恶意载荷以绕过技能扫描器
摘要论文揭示了单技能孤立扫描的盲区,提出多技能链攻击 ColluSkill 与上下文防御 ChainGuard 并验证了有效性。
评测文生图模型的有害内容生成能力与审核检测缺口
提出企业级检测系统 ADR,检测编程 Agent 的提示注入与恶意 MCP
摘要提出了端点因果遥测、两级在线分流与离线红队闭环的 ADR 系统,并在生产环境中验证了有效性。
提出 multi-CaMeL,在多智能体调用边界隔离可信指令与不可信数据
摘要论文针对多智能体中单体防御不组合的边界清洗问题,提出 multi-CaMeL 协议彻底阻断了 MultiAgentDojo 上的注入攻击。
提出 Twin Agent,用受限残差 hint 隔离不可信输入与特权动作
提出机器遗忘式生成图像检测,用遗忘前后特征相似度区分自然图与生成图
这篇工作把 AI 生成图像检测写成对预训练视觉模型的机器遗忘:原模型对两类图像损失都低,剪枝后生成图特征变得更不像原模型。
提出 GeoDetect 以几何分数检测视觉语言预训练模型的对抗样本
GeoDetect 是面向视觉-语言预训练模型的对抗样本检测方法,用嵌入几何而不是任务 logits 区分干净样本与对抗样本。
提出 SkillSecurer,检测定位并修补智能体技能中的提示注入
诊断护栏相对基座在对抗提示上的置信失校
诊断性分析:五个提示词分类 guard 的置信度,在清洁输入上可以较校准,在越狱包装后则变成高置信度的错误判定。
提出 Skill-as-API,防止协作通道泄露 skill 代码与系统提示词
Skill-as-API 是面向智能体软件工程的协调协议,用来在跨组织调用时把 skill 的代码和系统提示词留在所有者进程。作者针对三条威胁:经通道或命名空间抽取专有方法,用注入让被调用模型输出系统提示词,以及协作结束后权限继续保留。
提出多智能体提示注入威胁模型与四层架构防御
提出身份绑定且只收窄的能力令牌,用上下文外钱包约束智能体
代表人类行动的分布式智能体,需要一种不把密钥放进语言模型上下文的授权方式。