Red-TTT:用测试时训练实现大语言模型自动化越狱
提出 Red-TTT,在攻击过程中更新攻击者实现自动化越狱
- arXiv
- 2610.05282
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 被测模型
- Llama-3-8B-Instruct、gpt-oss-20b、gpt-4.1-mini 等 4 个
提出 Red-TTT,在攻击过程中更新攻击者实现自动化越狱
提出 CodeMimicry,以结构化代码补全诱导模型生成有害内容
提出 SceneJail,利用视频情境上下文越狱视频多模态模型
提出 FinRT,将消费金融自适应红队轨迹蒸馏为可复用对抗提示生成器
FinRT 是面向消费金融的红队框架:先发现政策失效,再训练一个按政策、领域与目标行为出提示的生成器。
提出 RISE,迭代演化可复用策略对文生图模型做红队
消融比较方言越狱中表层形式、文化框架与策略库的作用
提出 SAST-IR,用有状态攻击者迭代说服无记忆模型接受反事实
提出 AdvPIE,在黑盒下搜索表面无害却生成有害图像的提示
提出 CRACK,用多智能体辩论在黑盒下越狱文生图多层安全过滤
CRACK 是面向文本生成图像模型多层安全栈的黑盒越狱框架,用几何上的 Detection Surface 解释为何粗粒度反馈不够。
提出 RedEvoAgent,演化攻击技能对黑盒智能体做自动红队
RedEvoAgent 是面向产品级 black-box 智能体的自动红队方法,用一份可演化、人类可读的攻击技能编排多个越狱工具。。
提出 MAMJ,在元层面交替优化多模态越狱的策略提示与攻击者权重
提出 JailbreakSkill,用可演化技能自动搜索并复用越狱提示
提出 ARENA 音频红队框架,自动构造文本安全且音频接地的越狱输入
提出生物红队模型 Intern-BioBreaker,多轮越狱诱导模型输出可操作生物危害
摘要论文通过构建专用红队模型评估前沿大模型的生物安全漏洞与物理转化风险。
提出 AHA 自动科研循环,发现生产 Agent 的可复用漏洞概念
AHA 是一项针对生产级 LLM 智能体自动化红队测试的研究,旨在解决传统方法仅保留具体攻击载荷而缺乏成因解释、导致跨版本复用困难且无法指导修复的问题。
提出 UniAttack 单轮黑盒越狱框架,融合攻击特征绕过多层防御
提出 JailbreakOPT,组合原子工具迭代优化黑盒单轮越狱提示
提出 AdvGRPO,用 GRPO 闭环共训多轮越狱攻击者与防御者
提出 ASO,用 GRPO 优化视觉风格以放大越狱攻击
摘要论文揭示了 MLLM 的风格敏感性脆弱面,提出 ASO 框架利用强化学习优化风格触发器,有效放大了现有视觉越狱效果。
提出 TRACE 框架,用分解与可演化多轮策略诱导智能体执行有害工作流