攻击arXiv 2606.09084
研究者提出 Context-Fractured Decomposition 攻击
提出 CFD,跨会话拆解有害目标以绕过工具智能体本地监控
- arXiv
- 2606.09084
- 发表
- 层
- 应用层
- 场景
- AI Agent
摘要CFD 用无指令 artifact 把越狱拆到跨会话。
CFD针对工具型 LLM 智能体:利用 artifact 来源不被跟踪这一部署失败模式,把有害目标拆开后延迟组合。
另有 451 篇论文还没打上分类标签,暂不在筛选结果里。
提出 CFD,跨会话拆解有害目标以绕过工具智能体本地监控
CFD针对工具型 LLM 智能体:利用 artifact 来源不被跟踪这一部署失败模式,把有害目标拆开后延迟组合。
提出 Bi-QSTO,优化能穿过质量筛选并在微调中削弱安全对齐的投毒样本
Bi-QSTO 研究一个实际训练缺口:基于质量的数据选择会先于微调决定样本去留,而以往微调投毒多假设毒样本直接进入训练集。已对齐 LLM 的拒答会被少量有害或看似无害的微调样本削弱。作者用三个问题串起实验:选择能否排除毒样本。