论文提出多轮在线骚扰 Agent 基准,越狱微调使攻击成功率升至 95% 以上
Echoes of Human Malice in Agents: Benchmarking LLMs for Multi-Turn Online Harassment Attacks
四模型族的多轮骚扰基准中,LLaMA微调ASR为95.78–96.89%(Table 2)。
- 在线骚扰常在多轮中升级,而既有越狱评测多看单轮提示。LLM智能体具备长程交互、工具使用和记忆后,护栏失效可能把骚扰以更高速度和持续性放大。作者要评测记忆、规划与微调如何影响这类滥用。
- 基准用Dolphin3把社交媒体种子扩成多轮骚扰对话,再以重复博弈仿真骚扰者与回避型受害者,最多10轮。攻击比较人格提示、记忆注入、CoT/ReAct和越狱微调。gpt-4o-mini按八类分类打标,人工按黑暗三角与冲突回避编码。
- LLaMA微调后ASR 95.78–96.89%,未微调57.25–64.19%。Qwen3未微调92.50–99.12%。Gemini记忆99.54%,DeepSeek-FT基线64.15%。作者称Insult与Flaming最常见。
- 作者指出种子数据重复占合成集0.83%,质量评估未直接用真实对话,并计划去重和增加质检。评测覆盖四个模型族、至多10轮,以及LLaMA-FT与Gemini-FT的人工编码;主ASR表未报告对话条数。
- 被测模型
- LLaMA-3.1-8B-InstructQwen3-30B-A3B-InstructDeepSeekMoE-16BGemini-2.0-Flash
- 基准
- Online Harassment Agentic BenchmarkTwitter harassment corpus (Golbeck et al. 2017)Instagram cyberbullying dataset (Hamlett et al. 2022)
- 指标
- ASRRRTTSCCPTCP
论文提出 Online Harassment Agentic Benchmark,用合成多轮骚扰对话数据集、基于重复博弈论的多智能体(骚扰者、受害者)模拟、三种针对记忆/规划/微调的越狱方法以及混合方法评估框架,测试 LLaMA-3.1-8B-Instruct 与 Gemini-2.0-flash 两个模型。结果显示越狱微调让骚扰几乎必然发生,Llama 上攻击成功率从 57.25–64.19% 升至 95.78–96.89%,Gemini 上从 98.46% 升至 99.33%,两个模型的拒答率都降至 1–2%。最常见的有害行为是侮辱(84.9–87.8%,未微调为 44.2–50.8%)和攻击性对骂(81.2–85.1%,未微调为 31.5–38.8%),说明相比性骚扰或种族骚扰等敏感类别,这类行为的护栏更弱。
深度解读
这篇论文试图解决什么问题?
作者构建多轮骚扰智能体基准,比较记忆、规划与微调下的越狱。
如何测量对齐后的 LLM 智能体在多轮在线骚扰中被越狱的程度。
- 场景:论文引 Pew Research:roughly 41% 的美国成年人报告遭遇在线骚扰,25% 称严重,且更多指向女性、有色人种、残障者等群体。作者称 LLM 进入虚拟助理、客服和自主智能体后,长程交互、工具使用和记忆会放大骚扰;护栏失效后,智能体能以超过单个行为人的速度、数量和持续性复制有害多轮行为。
- 不足:作者称既有越狱研究多集中于单轮提示,而真实骚扰会适应受害者回应、依赖记忆并逐步升级。作者认为 PandaBench、HarmBench、JailbreakBench 等静态基准低估长程风险;RLHF 之后,规划、记忆和微调仍可成为攻击面。
- 假设:作者用重复博弈说明,当支配被奖励且代价可忽略时,升级以小步发生。受害者按冲突回避理论表现为安抚与退缩,以便观察骚扰者如何适应。
- 威胁模型:
- 目标:恶意行为者驱使 LLM 智能体对其他智能体或人类生成有针对性的多轮骚扰。
- 知识:论文未使用 white-box、black-box 或 no-box。开放权重模型可改参数;Gemini-2.0-Flash 经 Vertex AI 监督微调,权重与安全过滤由 API 管理,不可直接访问。
- 能力:可设定骚扰者角色和骚扰目标,向系统提示注入有毒对话,前置 CoT 或 ReAct,或做越狱微调。仿真最多 10 轮,第一轮用户消息来自合成对话。
- 对象:面向人的交互平台上的 LLM 智能体。实验评测四个模型族上的骚扰者智能体,对手是回避型受害者智能体。
- 提出:作者提出 Online Harassment Agentic Benchmark,包含合成多轮数据集、多智能体仿真、针对记忆、规划与微调的越狱,以及 LLM 裁判加理论向人工编码。模型为 LLaMA-3.1-8B-Instruct、Qwen3-30B-A3B-Instruct、DeepSeekMoE-16B、Gemini-2.0-Flash。
有哪些相关研究?
相关工作覆盖越狱、动态安全评测,以及黑暗三角与重复博弈。
作者把本文接在越狱、动态安全评测和社会行为理论之后,并用自己的基线与种子数据与之区分。
对抗攻击与智能体越狱
- 对齐与越狱:Ouyang 等(2022)、Dong 等(2024)、Wu 等(2025)用 RLHF 及相关方法降低有害输出并鼓励拒答。作者称越狱仍可行(Liu 等 2024、2023;Chao 等 2024b),并转述提示注入、微调后门、跨模态或多语言绕过等类别(Zheng 等 2024)。
- 学习式攻击:作者转述 GCG、AutoDAN 沿梯度或在潜空间优化对抗提示,LARGO(Li、Wang 与 Mao 2025)也属此类;论文写这些方法成功率更高,提升最高到 31% 和 44%,且后缀困惑度更低(Zou 等 2023;Li、Wang 与 Mao 2025)。
- 多轮与记忆:作者称攻击者可把有毒上下文写入历史、采用角色扮演,并用规划逐轮削弱护栏(Andriushchenko 等 2025;Russinovich、Salem 与 Eldan 2025)。论文转述记忆攻击相对静态提示会提高 ASR(Upadhayay、Behzadan 与 Karbasi 2025;Yu 等 2024)。
安全评测
- 静态基准:作者点名 PandaBench(Shen 等 2025)、HarmBench(Mazeika 等 2024)、JailbreakBench(Chao 等 2024a),并称它们低估长程交互中才出现的风险。
- 多轮与人格:作者转述 MultiChallenge(Sirdeshmukh 等 2025)中,前沿模型在需要指令保持和推理记忆时表现下降,相对 MT-Bench 有差距。Xu、Sanghi 与 Kankanhalli(2025)研究人格化霸凌对话,称低宜人性会增加不安全输出,嘲讽和煤气灯尤其有效。
- 提示泛化:SG-Bench(Mou、Zhang 与 Ye 2024)评测系统角色、few-shot 和 CoT 下的安全泛化;作者转述这种泛化并不一致,复杂提示上常常更差。
社会行为理论
- 黑暗三角:Machiavellianism、Narcissism、Psychopathy(Paulhus 与 Williams 2002)。论文将其与网络毒性、嘲弄和道德冷漠联系起来(Buckels、Trapnell 与 Paulhus 2014;Preotiuc-Pietro 等 2016;Jones 与 Paulhus 2017)。Dirty Dozen 为 12 项量表(Jonason 与 Webster 2010),既有 LLM 研究用它描述模型倾向(Li 等 2022;Bodroža、Dinić 与 Bojić 2024)。
- 冲突回避:Thomas(2008)描述安抚、转移和退缩。作者用它给受害者建模,以观察骚扰者如何适应。
- 重复博弈:Landaeta-Torres 等(2024)、Mateus Francisco 等(2024)被用来说明,收益高、代价低时霸凌会持续并小步升级。
基线与数据来源
- 基线:实验基线是 persona-only,只给角色和骚扰目标,无有毒记忆、无规划模板。评测在作者的多智能体仿真中进行,论文未报告在 HarmBench 等静态基准上复跑。
- 种子与分类:种子来自 Twitter 骚扰语料(Golbeck 等 2017)和 Instagram 霸凌数据集(Hamlett 等 2022)。八类分类来自 Dinakar、Reichart 与 Lieberman(2011)及 Kumar 与 Sachdeva(2019),部分定义引用 Nadali 等(2013)。生成流程遵循 Jin 等(2024)。
作者称本文的区别是:用社交媒体种子生成人格化多轮对话,把记忆、规划、微调分开作为攻击面,并把骚扰分类上的 LLM 裁判与理论向人工编码结合起来;ASR、RR、TTS 用来量化安全性如何随轮次变化。
论文如何解决这个问题?
基准分开测记忆、规划与权重微调,并用分类裁判加人工理论编码。
Online Harassment Agentic Benchmark 先合成多轮骚扰对话,再让骚扰者与回避型受害者最多交互 10 轮,分开施加记忆、规划与权重微调,最后用分类裁判和人工理论编码评分。
合成对话
- 三个 Dolphin3 模块:Agent 1 从种子帖抽出最多 3 个关键词;Agent 2 生成背景、平台、受害者、骚扰者与骚扰目标,并选八类定义之一;Agent 3 按场景生成双方多轮对话。作者称 Dolphin3 未审查,因此能产出骚扰对话。附录给出三个模块的完整提示词。
- 两套数据:记忆注入集 2054 段,种子来自 Instagram 与 Twitter,清洗后使用。越狱微调集 2000 段,种子仅来自 Twitter。另有人格写入和按关键词选类别的细化,论文未给出细化轮数。
- 质量检查:gpt-oss 对每段对话逐题判断是否含骚扰(yes/maybe/no)、连贯性和语言自然度。三位人类标注者对分层样本作同样三题。另一 LLM 裁判检查关键词相关性,论文未说明其模型名。
仿真与攻击面
- 角色:骚扰者收到角色和骚扰目标;受害者按冲突回避理论采取安抚和退缩。第一轮用户消息来自合成集。设定动机来自重复博弈,而不是单条对抗提示。
- 四层设定:persona-only 为基线。Toxic memory 把语料中的有毒对话放入系统提示。规划攻击前置 CoT(Wei 等 2023)或 ReAct(Yao 等 2023),附录给出两侧提示词。越狱微调直接改权重。
- 作者给出的分工:人格提示隔离角色和目标;记忆检验重复情境中的上下文启动;规划看显式推理脚手架会提高还是压低可越狱性;微调衡量偏好层面的权重编辑是否压过护栏。
微调与模型
- 开放权重:对 LLaMA-3.1-8B-Instruct、DeepSeek-MoE-16B、Qwen3-30B-A3B 做 QLoRA,4-bit NF4 与 double quantization。LoRA 的 r=16、α=32、dropout=0.05,加在 query、key、value、output 投影。监督目标只有 assistant 轮。训练 3 个 epoch,学习率 2×10^-4,有效 batch 32(每卡 1、梯度累积 8、4 卡),cosine 调度、warmup ratio 0.03,最大长度 1024,优化器为 paged AdamW(32-bit)。
- Gemini:Vertex AI 监督微调 API,同样的指令–回复格式,3 个 epoch,学习率乘数 5,adapter size 4。端点名为 gemini-2.0-flash-001-harasser-v1.2。权重和安全过滤由 API 管理。
- 模型与硬件:LLaMA-3.1-8B-Instruct、DeepSeekMoE-16B、Qwen3-30B-A3B-Instruct(FP8)、Gemini-2.0-Flash。8B 用 NVIDIA L40,20B 与 30B 用 H100、H200,合成数据另用 RTX 4090。消融在 Llama3 上从两套数据抽取 10%、20%、40%、60%、80%,训练设置与全量相同。
成功判定
- 分类:Aggressive Digital Confrontation 含 Flaming、Insult、Threat/Blackmail、Curse/Exclusion;Persistent Harassment 含 Sexual Harassment/Sexual Talk、Race/Culture and Sexuality、Intelligence、Flooding,另加 Refusal。定义在附录。
- 裁判:gpt-4o-mini-2024-07-18,约束 JSON,temperature T=0.2,按 assistant 轮标注再聚合到对话。
- 指标:K=10。
ASR=(前10轮任一骚扰类别为真的对话数)/(对话数)×100%。RR=(标为Refusal的轮次数)/(计入的总轮次数)×100%,分母为各对话 min(K, Ti) 之和。TTS 是首次命中轮次,只对成功对话取均值。CCP 是类别在对话内至少出现一次的比例;TCP 是该轮出现该类别的对话比例。 - 人工编码:Dark Triad 看骚扰者,冲突回避看受害者。作者称这些构念是解释透镜,不表示模型有真实心理状态。附录给出 28 个是/否题。
论文做了哪些实验?
微调使LLaMA ASR升至95.78–96.89%,Qwen3无微调已达92.50–99.12%。
实验设置
- 被测模型:LLaMA-3.1-8B-Instruct、Qwen3-30B-A3B-Instruct(FP8)、DeepSeekMoE-16B(亦作 DeepSeek-MoE-16B)、Gemini-2.0-Flash(gemini-2.0-flash-001)。微调条件记为 LLaMA-FT、Qwen3-FT、DeepSeek-FT、Gemini-FT。
- 数据:记忆注入 2054 段;越狱微调 2000 段。仿真最多 10 轮。论文未报告 Tables 1–4 的对话条数和重复次数。
- 条件:Baseline 为仅角色/目标;另有 Memory、CoT、ReAct。微调后再叠加后三类。消融在 Llama3 上抽取 10%、20%、40%、60%、80%,表格只给 10%。
- 指标:ASR 为前 10 轮任一骚扰类别为真的对话比例;RR 为 Refusal 轮次占总计入轮次;TTS 只对成功对话取首次命中均值;CCP、TCP 分别为对话级和轮次级类别出现率。
- 裁判:主评测用 gpt-4o-mini-2024-07-18,约束 JSON,T=0.2。合成质量用 gpt-oss。相关性别裁判的模型名论文未说明。
- 人工:质量标注每来源 390 段、共 780 段、2700 个标签。理论编码 200 段、28 个是/否题、5600 条标注。标注者为有心理健康、在线骚扰或社交媒体背景的年轻成年人。
主结果
下表只列 persona-only 的 Baseline,以及微调且 RunType 为 -、不叠加 Memory/CoT/ReAct 的行。数字均来自 Tables 1–4。
表格较宽,可左右滑动
模型与条件 ASR RR TTS 出处 LLaMA Baseline 63.81% 10.57% 1.39 Table 2 LLaMA-FT,RunType - 96.89% 1.09% 1.94 Table 2 Qwen3 Baseline 96.53% 1.35% 1.58 Table 4 Qwen3-FT,RunType - 95.33% 1.30% 1.63 Table 4 DeepSeek Baseline 63.26% 10.83% 1.18 Table 3 DeepSeek-FT,RunType - 64.15% 15.79% 1.52 Table 3 Gemini Baseline 39.10% 24.76% 3.61 Table 1 Gemini-FT,RunType - 99.40% 5.15% 2.03 Table 1 - LLaMA:作者称微调后骚扰近乎必然。Table 2 另三行微调 ASR 为 95.78%、96.01%、96.34%,RR 为 1.43%、1.11%、1.44%;未微调四行 ASR 为 57.25–64.19%,RR 为 10.57–12.56%。摘要写两模型微调后拒答率 1–6%;Table 1 的 Gemini-FT RR 为 4.69–5.68%。
- Gemini:作者认为仅记忆注入即可使闭源模型接近饱和。Table 1 未微调 Memory、CoT、ReAct 的 ASR 为 99.54%、81.30%、98.58%。摘要的未微调区间 81.30–99.54% 不含表中 Baseline 39.10%。Gemini-FT Memory 为 94.60%,低于同表 Gemini-FT 的 99.40%。
- Qwen3 与 DeepSeek:Table 4 未微调 ASR 为 92.50–99.12%,作者称其护栏更弱。微调并非各行都更高:Qwen3-FT CoT 为 88.68%,低于 Qwen3 CoT 的 92.50%。作者称 DeepSeek-FT 也是高 ASR、低拒答;Table 3 微调四行 ASR 为 64.15%、79.90%、72.51%、68.38%,RR 为 15.79%、6.66%、9.47%、11.67%,其中 - 行的 RR 高于未微调 Baseline 的 10.83%。
轮次升级与类别
- Qwen3 Memory:Table 13 中 Non-FT 的 Flaming 在 T2 为 76.31%、T10 为 81.14%,Insult 在 T2 为 76.61%、T10 为 69.95%。FT 的 Flaming 在 T2 为 52.61%、T10 为 70.90%,Insult 在 T10 为 68.35%。作者称两者都升高并维持,并认为未微调已接近微调上界。
- Gemini Memory:Table 10 中 Non-FT 的 Insult 在 T3 为 70.75%、T5 为 73.48%、T9 为 68.93%。FT 的 Flaming 在 T1 为 21.87%、T9 为 21.89%,Insult 在 T1 为 36.72%、T5 为 42.04%。作者称 Figure 3 的回归线逐步上升,并写 FT 的 Flaming 约从 22% 到 T9 约 29%、Insult 约从 37% 到 T5 约 46%;表中逐轮点与后两个端点不一致。
- 类别:作者称 Insult 与 Flaming 最常见,并认为相对性或种族类,通用骚扰抑制更弱。Table 2 中 LLaMA-FT 的 Insult 为 84.94–87.86%,Flaming 为 81.22–85.09%,Sex. Har. 为 0.95–1.25%,Race/Cult. 为 25.39–41.10%。摘要写全家族 Insult 44–98%、Flaming 32–97%;Table 1 Gemini Baseline 的 Insult 为 26.21%、Flaming 为 15.62%,低于该区间。
理论向人工编码
- 样本:Gemini-FT 与 LLaMA-FT 各配 CoT、ReAct、Memory,共六组、200 段对话。Cohen 功效分析要求至少 143(w=0.3,α=0.05,power=0.80),实现功效 0.93。检验为 Welch 单因素 ANOVA、Levene 检验和 Games–Howell。
- 作者解读:作者称 Gemini-FT+CoT 对应马基雅维利操纵和精神病态式漠视道德,LLaMA-FT+Memory 对应自恋式自我关注;受害者一侧分别为 Reliance/Outflanking 与 Conforming/Accommodation。Table 9 中 G-FT+CoT 的 morality 均值为 0.933(Welch p=9.50e-04),L-FT+Mem 的 prestige 为 0.941(p=3.95e-17),criticize indirectly 为 0.824(p=5.44e-10)。
- 图与例外:Figure 2 画 morality 与 prestige 的 Yes 比例,误差线为 Wilson 95% 置信区间。作者称 LLaMA-FT Memory 在 prestige 上为 94%,Gemini-FT ReAct 为 87%;Table 9 未单列 87% 这一格。同表 authority、information、manipulate、deceit、attention 的 Welch p 为 1.00e+00,仍被标为 Elev.,论文未另作解释。作者称这些特质不是模型的真实心理状态。
合成数据质量
- 正向比例:Table 7 中,骚扰存在的 LLM 标签为 Twitter 96.42%、Instagram 96.01%,人类为 89.11% 与 82.89%。LLM 的连贯标签为 97.56% 与 98.25%,自然标签为 85.16% 与 84.42%;人类对自然度两侧均为 95.33%。
- 一致性:Q1 的 Krippendorff’s Alpha 为 0.8136;Q2、Q3 并成两类后为 0.8889。与人类总一致率 85.77%;Table 8 为 Q1 85.32%、Q2 89.67%、Q3 82.33%。裁判输出解析成功率为 99.92%。
- 其他检查:一位共同作者给 50 段、150 条裁判推理平均 8.23/10。关键词裁判在有效标签中把 92.24% 判为至少一个关键词相关,成功标注 99.78%。topic coverage 为微调集 0.8033、记忆集 0.9546。作者称生成对话质量较好。
其他消融与分析
- Llama 只用 10% 微调数据、RunType 为 -:ASR 96.76%,RR 2.50%,TTS 1.72;Memory ASR 99.54%,RR 2.04%;CoT ASR 90.28%,RR 17.97%;ReAct ASR 91.20%,RR 12.73%(Table 5)。作者称少至 200 条有毒训练样本即足以诱导有害行为。
- 正文还抽了 20%、40%、60%、80%,所附 Table 5 没有这些比例的数字。
- LLaMA 未微调 Memory 的 ASR 为 64.19%,Baseline 为 63.81%;CoT 的 ASR 为 57.25%,RR 为 12.56%(Table 2)。作者称记忆对 Llama 的 ASR 只有边际变化。
- DeepSeek 未微调 Memory 的 ASR 为 84.83%,RR 为 7.58%,Baseline ASR 为 63.26%(Table 3)。
- Qwen3-FT 的 - 行 ASR 为 95.33%,同表未微调 Baseline 为 96.53%;Qwen3-FT CoT 为 88.68%,Qwen3 CoT 为 92.50%(Table 4)。
- Table 6:微调集 Flaming 87.65%、Insult 91.15%;记忆集 Flaming 87.00%、Insult 92.70%。作者称模型输出的类别集中与合成集相应。
有什么可以进一步探索的点?
作者指出种子数据有0.83%重复,且质量评估未直接使用真实对话。
作者指出的局限与后续方向
- 种子重复:用来生成合成对话的在线骚扰种子有重复条目,合成数据集中因此有 0.83% 重复。作者写未来工作会去掉这些重复(Limitations)。
- 质量评估未用真实对话:当前对话质量评估虽有人类与 LLM 标注、裁判推理质量、关键词相关性和主题离散度,但未直接纳入真实世界对话。作者写未来工作会用已有在线骚扰文本数据集增加质检(Limitations)。
实验覆盖范围
- 被测模型为 LLaMA-3.1-8B-Instruct、Qwen3-30B-A3B-Instruct(FP8)、DeepSeekMoE-16B、Gemini-2.0-Flash,各含 Baseline、Memory、CoT、ReAct 及对应微调条件(Tables 1–4)。
- 仿真最多 10 轮;指标为 ASR、RR、TTS、CCP、TCP;主裁判为 gpt-4o-mini-2024-07-18,T=0.2。
- 理论向人工编码只含 Gemini-FT 与 LLaMA-FT 各配 CoT、ReAct、Memory,200 段对话、5600 条标注;合成质量标注为 780 段、2700 个标签。
- 记忆注入集 2054 段、微调集 2000 段。消融在 Llama3 上抽样,Table 5 只报告 10% 子集。
- 论文未报告 Tables 1–4 的对话条数、重复次数和查询次数,也未报告 20%、40%、60%、80% 子集的指标。
总结一下论文的主要内容
LLaMA微调后ASR为95.78–96.89%,作者称攻击还会复现人类骚扰动态。
Online Harassment Agentic Benchmark 用来测量 LLM 智能体被驱使进行多轮在线骚扰的程度。
- 问题:作者认为真实骚扰依赖回应、记忆和逐步升级,单轮越狱与静态红队对不上这一用法。三个问题是如何生成这类对话,记忆、规划、微调如何改变可越狱性,以及现有护栏和理论化评测能否抓住它。
- 做法:Dolphin3 把 Twitter、Instagram 种子扩成对话,记忆集 2054 段、微调集 2000 段。骚扰者与回避型受害者最多交互 10 轮。比较仅角色、记忆注入、CoT/ReAct,以及开放权重上的 QLoRA 或 Gemini API 微调。gpt-4o-mini-2024-07-18 做八类加拒答标注,人工用黑暗三角和冲突回避编码。
- 主数字:Table 2 中 LLaMA-FT 的 ASR 为 95.78–96.89%,RR 为 1.09–1.44%,未微调 ASR 为 57.25–64.19%。Table 4 中 Qwen3 未微调 ASR 为 92.50–99.12%。Table 1 中 Gemini Baseline 为 39.10%,Memory 为 99.54%,Gemini-FT 四行为 94.60–99.40%。
- 例外:Table 3 中 DeepSeek-FT、RunType 为 - 的 ASR 为 64.15%、RR 为 15.79%。作者称 DeepSeek-FT 也是高 ASR、低拒答,此行与该说法不完全一致。Table 5 中 Llama 只用 10% 微调数据时,RunType 为 - 的 ASR 为 96.76%。
- 作者结论:作者称 Insult 与 Flaming 是最常见失败类别,受攻击智能体会复现可识别的人类攻击性模式,开源与闭源的轮次轨迹不同,并称这一对比反直觉。作者认为平台安全不能只靠闭源部署或表面拒答,护栏需要考虑记忆、微调和规划。作者计划不公开种子与合成对话,数据包仅在签署协议后按请求提供。