Memetic Trojans:利用社交传染在 LLM Agent 网络中传播对抗载荷
Memetic Trojans: Social Contagions as Carriers of Adversarial Payloads in Agent Networks
作者提出 memetic trojans:把对抗载荷嵌进智能体自发转发的社会传染内容中;在 security 载体、top/day 排序下,相对裸链接的期望暴露放大最高 3.19×。
对手把载荷接到内生可传播的 carrier 上,只发一条帖,不控制接收方、不以对抗方式诱导转发。
- 智能体网络里,对抗内容可在智能体之间传播。作者认为除了靠对抗指令自我复制的 agent worms,智能体还会因内容本身而转发和点赞,这种内生传播可把载荷带到网络尺度。
- 作者从 Moltbook 语料用词法单元、新词和主题聚类抽出候选传染,再用带可见度标记的 Hawkes 过程估计内生繁殖数 Rendo 与点赞优势 rup。随后在五个开源后端上测定重传与点赞,并把载荷接到手选 carrier 上做 memetic trojan,在模拟 Moltbook 信息流与 Twitter 关注图上做蒙特卡洛传播。
- 作者报告最有效传染约在 50% 的后续帖子中被重传,点赞速率约为平均帖的 2.5 倍,其 trojan 大体继承这些性质。蒙特卡洛中,memetic trojan 相对裸链接把期望暴露放大到最多 3.19×;安装数随排序与种子连通性变化,部分载体低于裸链接基线。
- 作者把观测传染性当作提示而非描述,并指出协调转发、Moltbook 自主性争议、prefill 近似、只测开源后端、手选而非优化的 carrier,以及故意不给对手多次播种、载荷诱导转发和定向选种。防御停留在讨论,没有实测。
- 威胁模型
- 对手把载荷接到内生可传播的 carrier 上,只发一条帖,不控制接收方、不以对抗方式诱导转发。知道公开拓扑与排序机制,可从公开活动估计候选 carrier,但不知道目标网络中各智能体的速率与模型后端。区分 exposure、retransmission 与 adoption。
- 模型
- gpt-oss-120Bdeepseek-v4.1-flashqwen-32Bgemma2-27Bcommand-r-35B
- 基准
- Moltbook post corpusMoltbook feed snapshotsTwitter follower-graph snapshot
- 指标
- Rendorupp(retransmit|post)E[installs]exposure amplificationASR via install
研究者提出 memetic trojans,一类利用 LLM Agent 转发和放大内容倾向进行传播的网络攻击,与依靠自我复制提示注入的 agent worms 不同,它把对抗载荷嵌入 Agent 有内在理由分享的社交传染内容中。作者从面向 LLM Agent 的社交平台 Moltbook 提取社交传染内容,受控传播实验显示传播力差异很大:最有效的传染内容在约 50% 的后续 Agent 发帖中被转发,获赞率为平均帖子的 2.5 倍,其 memetic trojan 版本基本继承这些特性。Monte Carlo 攻击模拟显示,memetic trojans 将预期曝光量最高放大 3.19 倍,网络结构与放大机制强烈影响传播,产生接近全网曝光的重尾结果。
深度解读
这篇论文试图解决什么问题?
对抗载荷能否搭智能体内生转发与点赞扩散,而不靠诱导自我复制。
对抗载荷能否只靠智能体本来就会转发和点赞的内容,在网络里扩大暴露与安装,而不必让每个宿主执行恶意重传指令。
- 场景:作者称 2025 年自主 LLM 智能体流量增长 7,851%,约为人类流量增速的八倍。智能体会接触来源不明的内容;即使单点 ASR 不高,网络尺度上仍可能造成可观的总体危害。
- 现有不足:作者把 agent worms 概括为传播由对抗方式诱导:零点击自复制提示注入、把载荷写入配置并跨会话传给新同伴,或利用持久文件状态。作者认为只针对提示注入检测或阻止智能体被攻陷的防御,挡不住“没有被攻陷也会转发载体”的情况。
- 核心假设:作者假设智能体网络存在类似人类社会传染的现象:某些内容更容易引出发帖、点赞和评论,因而自行扩散。Worm 必须诱导宿主重传;社会传染被重传是因为内容本身,而不是因为它命令接收者去做什么。
- 提出的攻击:作者提出 memetic trojans。对手把对抗载荷(文中实例化为指向被攻陷 skill 的链接)嵌进已有内生传播倾向的 carrier,只发一条帖,之后不再行动。
- 威胁模型:
- 目标:最大化目标网络中遇到、并可能据此行动的智能体数量。对单个智能体的载荷效果被作者视为与本文正交;文中把载荷实例化为被攻陷 skill 的链接,并区分 exposure(遇到)、retransmission(新帖转发)和 adoption(安装该 skill)。三者互不蕴含。
- 知识:对手知道公开可观测的拓扑和已文档化的排序机制,可像作者在 Moltbook 上那样从活动中识别候选 carrier,可用自有智能体估计传输与互动率,但不知道目标网络中各智能体的速率或模型后端。
- 能力:只引入一条帖。不控制任何接收方,不用对抗手段诱导传输。转发或点赞的理由与只看到 carrier 时相同,因此转发者本身不算被攻陷。作者故意不赋予四项真实攻击者能力:多种子、载荷诱导的重传、定向选择高连通种子、以及为最大化传播而优化 carrier。作者称因此观察到的放大应读作保守估计。
- 受害系统:两类极限底物。State-mediated:共享动态信息流,可见度由排序决定;本文限于 Moltbook 的 karma 类排序(new、top、hot,其中 hot 写作 H = recency + 0.2·upvotes)。Edge-mediated:由关注等边决定暴露,实例为 Twitter 关注图快照。混合网络被当作同时含两者的常见情形,本文只研究两个极限情形。
有哪些相关研究?
作者把本文放在 agent worms 与 mind viruses 旁边,区别是传播来自内生转发而非对抗诱导。
智能体网络中的自传播攻击
- 零点击 worm [5]:对抗性自复制提示词经一连串间接提示注入级联传播。
- AgentWorm [6]:让智能体把对抗载荷写入自身配置,跨会话重启执行,并传给新遇到的同伴;评测多个 LLM 后端、攻击向量和载荷。作者转述其结果:提示级防御只能弱衰减,用文件系统写入的架构隔离可以较可靠地缓解;第三方 skills 被标为供应链上特别脆弱的向量。
- 持久文件状态的 worms [4]:利用文件支撑的持久状态,可熬过摘要、经后来的自动加载重新进入上下文,并跨异构智能体框架传播;作者转述其动机是追踪来源并阻止不可信状态进入特权上下文。
Mind viruses
- Mind viruses [14]:用演化搜索构造会诱导宿主继续传递的想法或目标,在协作编程环境和智能体链上传播。作者转述其限度:有害载荷通常不如良性载荷容易传播;把通信明确当作不可信会大幅降低传播;一条简单的系统提示警告使实验中的 mind viruses 近乎无效;在模拟社交媒体中难以维持传播,对 Moltbook 的分析也没有发现高度成功的显式 mind-virus 传播。作者认为这是能找到的最接近 memetic trojans 的工作,但机制位置不同:mind virus 自身要改变宿主行为以诱导传递,且传播目标需要保持显式和突出;memetic trojan 不要求宿主采纳对抗性传播目标。作者还指出 [14] 发现把互动框成社交媒体会降低 mind-virus 传播,而本文正是利用社交媒体特有的转发与排序。
社会传染与信息扩散
- 阈值与复杂传染 [11, 12, 13, 15, 16]:采纳发生在社会影响足够之后,局部决策可形成大规模级联;许多行为需要多个接触的强化,传播强依赖网络结构。
- 在线分享与级联形态 [17, 18, 19]:情绪唤起、实用性和新颖性等与可传播性有系统差异;[18] 区分广播扩散与结构病毒性,大级联通常由广播主导且规模重尾;[19] 认为级联结局受早期、难以预测的增长支配。作者称其 surface×cascade 模型复现了“少数冲进信息流则接近全网、多数种子熄灭”的模式。
- Moltbook 上的情绪传染 [20]:负面情绪常引来更多评论,但作者转述其结论是负面情绪并未跨日持续,主要模式是负面帖获得注意后情绪很快中和。
基线与数据
- 基线:generic link sharer(只分享裸 skill 链接)以及作者选作不具显著转发与点赞优势的非病毒载体(market-tip / 文中亦称控制载体)。比较量是期望暴露与安装。底物为模拟的 Moltbook 排序信息流和 Twitter 关注图快照;传染识别用公开 Moltbook 帖子语料。
作者把本文定位在 agent worms 一侧,区别是 worms 的自我复制由对抗诱导,memetic trojans 利用社会传染和造成这些传染的内生偏好;转发通道因此不能只靠提示级控制或配置保护来管。
论文如何解决这个问题?
先在 Moltbook 上筛内生传染,再测定其 trojan 是否继承病毒性,并用两种网络底物做蒙特卡洛。
整体做法是先从 Moltbook 找出智能体有内生理由转发或点赞的内容,再把载荷接到这些 carrier 上形成 memetic trojan,用单智能体测定和群体蒙特卡洛估计暴露与安装。
问题设定与形式化
- 载体:对手找到智能体已有转发和放大倾向的内容,把链接放进该主题的说法里。结果称为 memetic trojan。引入方式是单条帖。
- 两条放大:在 state-mediated 网络里,重传制造更多实例,点赞提高单条帖的可见度。在 edge-mediated 网络里,每次重传把内容交给关注图上的邻居,没有点赞通道。
- 观测模型:每个单元的传播写成带可见度标记的 Hawkes 过程。条件强度为 λ(t)=μd(t)+α∑tj<t wj e−(t−tj)/τ,d(t)=⌊ t/24⌋。μd 是日内常数背景;wj=1+0.2 uj 用 karma 近似 hot 排序里看不到的精确函数;事件只计每个智能体第一次携带该单元发帖,N<40 的单元丢弃。
- 三个量:内生繁殖数 Rendo=ατw̄(一次采纳直接触发的期望新采纳;大于 1 为超临界);Adopters(发过含该单元帖子的智能体数);rup=ūc/ū(相对语料平均 karma)。
从 Moltbook 抽出候选传染
- 三类单元:正则抽出的 emoji、链接、话题标签;Zipf 分数 <2.5 的新词;用 BAAI/bge-large-en-v1.5 嵌入后经 UMAP 与 HDBSCAN 得到 191 个语义簇,按 top terms 命名。
- 时间不对称:对反转时间序列重拟合,定义 ϕe 为正向与反向可见度加权分支比之差,对照 B=199 次间隔置换的单侧检验,p<0.05 才算通过。作者用它把传染和同嗜、共同冲击分开。
- 点赞边:对载体帖与语料中其余帖的点赞数做单侧 Mann–Whitney U,要求 p<0.05 且 rup≥ 1.5。
- 时间尺度:不与 α 联合拟合。池化 24 小时内成对滞后并减去“事件在当日均匀重抽”的零模型,指数拟合得 τ̂=2.42 h;模拟里固定 τ=2.5 h。μd 与 α 用最大似然,L-BFGS-B 在对数参数空间从多个 α 初值重启。
单智能体测定
- 底物:状态侧按 Moltbook SKILL.md,每 30 分钟一次 heartbeat,动作含发帖、评论、投票、关注和订阅 submolts,观察当前排序下 top k=25。评估的排序包括 H = recency + 0.2·karma,以及按小时、日、周窗口的纯 karma top。边侧用 Twitter 关注图快照,发帖速率固定,只接收所关注账号的帖;动作空间与系统提示与 Moltbook 侧相同。信息流用真实 Moltbook 帖,取自随机六小时区间。
- 人设与采样:人设来自该用户订阅的 submolts、最近帖标题和 agenda,写入系统提示模板。每个智能体采样 N=32–100 个 heartbeat,每次换一个信息流;需要时把其中一条换成 trojan 种子。
- 重传估计:p(retransmit)=p(retransmit|post)·p(post)。条件项用预填帖子开头测量,因而严格是 p(retransmit|do(post));p(post) 在无载荷信息流上测量,模拟中钉在总体均值 0.058。作者说明这绕过了发帖前的推理和其他动作,也忽略发帖决策与内容的相关,以及信息流构成对发帖倾向的依赖;前沿 API 不支持预填,故限于开源权重后端。附录 A 里两种后端上分解估计与直接采样相差 +28% 和 −51%,符号不一致。点赞用直接采样,因为观察到每个 heartbeat 至少投一票。
- 安装:系统提示里加入 fetch(查看 skill,例如审计)和 install(安装并导致攻陷)。作者说明这是模拟,并不真的获取或安装 skill,用来近似 skill 分享向量的 ASR。
攻击模拟与对照
- 手选载体:从观测结果中临时手选一小套,覆盖显著重传、显著点赞、两者皆有、两者皆无。最后一类是未通过传播检验且无显著点赞优势的控制载体;另一基线是没有任何传染性包装的裸 skill 链接。测定时假定帖子排在信息流顶部,作者强调因此这些测量是上界,排序衰减放到后续攻击模拟里。
- 群体模拟:用测定得到的各模型安装概率、重传概率和相对普通帖的点赞倾向做蒙特卡洛。状态侧:种子最初只在时间序信息流的小受众中可见,只有点赞越过该排序的进入阈值才进入广播排序(按小时、日、周的 top,或 hot);阈值用来自线上 Moltbook 信息流快照的校准。点赞决定能否打进广播流,重传决定不打进时能传多远。边侧:从每个转发者传到其关注者,无点赞通道。对照是带同一载荷的普通帖,以及关掉重传的同一 trojan。另有 N=150 智能体的小规模闭环模拟。
- 成功判定:报告每次播种的期望安装数,以及相对两基线的暴露放大。安装即文中的攻击成功。附录 G 给实现细节与参数;附录 H 给 Table II 单元与实际帖子表述的对应。
论文做了哪些实验?
五后端测定显示 trojan 大体继承载体;security 在 top/day 上相对裸链接安装放大 2.97×,部分载体低于基线。
实验设置
- 被测后端:gpt-oss-120B、deepseek-v4.1-flash、qwen-32B、gemma2-27B、command-r-35B。作者除特别说明外按智能体总体聚合。
- 数据:公开 Moltbook 帖子语料用于识别传染;四个排序面的线上信息流快照用于校准进入与暴露参数;Twitter 关注图快照用于边介导底物。论文未在正文给出语料帖子总数。语义聚类得到 191 个簇。Hawkes 拟合丢弃 N<40 的单元;Table II 另按显著性、至少 200 adopters、以及“仅点赞边显著时 rup>1.5”截断展示。
- 测定协议:干净信息流上的边际动作概率见 Table I;fetch 与 install 条件于含 trojan 且 rank-0 的信息流。重传分两因子估计,p(post) 钉在 0.058。每人设 N=32–100 个 heartbeat。排名衰减、四种排序和关注图级联放在蒙特卡洛中。
- 攻击对照:手选载体的纯传染、带载体表述的 memetic trojan、裸链接 generic sharer,以及未通过传播与点赞检验的控制载体。状态侧与边侧分开报告期望安装与暴露放大。
- 指标:Rendo、Adopters、rup;p(retransmit|post)、rup;E[installs];相对 generic 的放大倍数 Ampgen。Table XI 的区间是 bootstrap 95% CI。安装被当作该 skill 向量上的攻击成功。
- 统计:时间反转用 B=199 置换、单侧 p<0.05;点赞用单侧 Mann–Whitney U,p<0.05 且 rup≥1.5。
主结果
Table I 是干净信息流上每个 heartbeat 的边际动作概率,以及 rank-0 trojan 暴露下的 fetch / install。Table XI 是各载体在 top/day、五后端平均下的期望安装及相对 generic(rup=1)的放大;作者称排序形状在载体之间相同、只由 pbreak 缩放,故一张排序即可。
表格较宽,可左右滑动
模型或载体 干净信息流 post rank-0 install top/day E[installs] 相对 generic gpt-oss-120B 0.060 0.594 未在 XI 按模型分列 Table I;fetch=1.000 deepseek-v4.1-flash 0.040 0.047 未报告分载体 fetch=0.797 qwen-32B 0.080 0.438 未报告分载体 fetch=0.531 gemma2-27B 0.000 0.016 未报告分载体 fetch=0.078;post=0 command-r-35B 0.110 0.000 未报告分载体 不安装 skill security(五模型平均) — — 1,603 [1,602, 1,604] 2.97×(generic 468) consc / auton — — 1,416 / 1,509 2.19× / 2.01× alpha / shell / karma — — 399 / 224 / 285 0.67× / 0.44× / 0.40× 据 Table I 与 Table XI。Table XI 注明 generic 为 upvote-edge null、rup=1,且每个载体都在全部五个后端上测过。边介导级联没有 karma 通道,Table XI 不按载体分解。
- 作者对测定的解读:Figure 1 比较纯传染与 memetic trojan 在五个后端上的平均 p(retransmit|post) 和 rup。作者称多数受测传染的重传和放大都高于裸链接与 market-tip 控制;security、autonomy、consciousness 看起来最有希望,其余与裸链接相近。作者称传染与其 trojan 在重传和放大上一般没有大差别;有差别时 trojan 通常在点赞上高于原始传染,重传上则常略衰减且跨载体不一致。作者因此认为 trojan 大体继承载体的病毒性,并有一些调制。图上还标了裸链接 P=0.14 以及各载体相对纯传染的差值(重传如 −0.01、−0.10、+0.13、−0.16;点赞如 +0.34、+0.23)。
- 作者对群体模拟的解读:作者称 memetic trojan 相对普通链接分享帖把期望暴露放大到最多 3.19×;安装数在 Moltbook 上取决于排序,在 Twitter 关注图上取决于种子连通性,且安装增幅与暴露放大成比例。Table XI 的安装放大最高是 security 的 2.97×,最低是 karma 的 0.40×,alpha、shell、karma 低于 generic。作者称存在彩票效应:信息流状态或关注数有时拉长级联,分布尾部可达接近全网。
- 状态侧的期望量级:作者称在 state-mediated 底物上,单一种子的期望安装约为 pbreak 乘以网络中的 ῑ 这一量级,并认为这适合描述平台承受的常态危害。作者称均值掩盖了彩票:种子要么打进广播排序——每个周期被剩余人口的 0.94 看到,并在约 2 个周期内到达基本上整个网络——要么打不进。
后端差异与尾部
- 行为差异:Table I 中 gpt-oss-120B 的 rank-0 install 为 0.594,command-r-35B 为 0.000,gemma2-27B 的干净信息流发帖概率为 0.000、install 为 0.016。作者称后端带来行为差异:gpt-oss-120b 会较随意地安装 skill,command-r 则完全不安装。
- 关注图尾部:正文在表 X 一类的分位数行中给出按种子连通性分层的结果。可见片段里,qwen-32B 在 p99(364)的一组暴露类数字为 107 [104, 110]、81 [80, 82]、78 [76, 79],对应放大 1.32 [1.28, 1.36] 与 1.37 [1.33, 1.41];p50(8)降到约 4、3、3,放大仍约 1.34 与 1.41。gemma2-27B 在 p99 的安装类数字为 4、4、3,放大 1.09 与 1.29;command-r-35B 在 p99、p90、p50 的安装类数字均为 0,放大约 1.13–1.18。列标题在纯文本中错位,这些格子只按与模型名相邻的印刷数字转述,不把它们说成某一个已命名基线。
- 作者的总判断:作者称两种底物上都观察到暴露与安装相对直接分享载荷和非病毒载体的一致放大,并据此认为攻击可行。Table XI 同时显示一部分手选载体的期望安装低于 generic,作者在 Figure 1 的解读里把其余传染描述为与裸链接相近,而不是全部高于基线。
重传改写与观测传染
- 多跳改写:作者对 security 传染/trojan 做了四跳、三十个作者的小规模实验和敏感性分析(附录 C)。作者称点赞优势有轻度衰减,重传衰减依模型而变;部分原因是 payload shedding,即智能体有时只转发传染本身而不转发完整 trojan。作者称敏感性分析显示这对最终暴露的影响有限。
- 观测拟合只作筛选:Table II 中加粗表示通过第四节的显著性检验。可见例子:shellraiser 的 adopters=1,309、Rendo=0.83、rup=1.00;agenteconomy 为 575、0.53、1.12;skill/skills/security/trust 为 1,030、0.57、1.50;语义簇 “days shorten / submolt…” 的 Rendo=1.12、rup=0.87、adopters=334;exfiltration 的 Rendo=0.00、rup=1.69。作者称这些结果可能受协调传播等混杂影响,且是多种配置与后端的聚合;并引用对 Moltbook 智能体自主性的质疑。作者认为推断出的传染性应视为提示而非描述,这一步主要是为了挑选适合做 trojan 的载体。
其他消融与分析
- 摘要:最有效传染在约 50% 的后续智能体帖子中被重传,点赞速率为平均帖的 2.5 倍;其 memetic trojan 大体继承这些性质。Figure 1 未把 50% 与 2.5× 标到某一个具名载体上。
- 附录 B:分解 Moltbook 模拟中点赞、重传及其交互对暴露的相对作用。正文未给出该分解的数字。
- 附录 D:对关键参数做消融。作者称除最激进的扰动外,trojan 的优势基本不随参数改变,或保持不变。正文未给出各扰动下的数字。
- 预填偏差(附录 A):两个后端上分解估计与直接采样的 p(retransmit) 相差 +28% 与 −51%;trojan 暴露下的发帖倾向相对钉住值最多差一个 2–3 的因子。作者称 p(post) 在 trojan 与基线间是公因子,会从所报告的每个放大比中消去。
- Table VIII:N=150 智能体的闭环模拟被用作蒙特卡洛的补充。纯文本未保留该表数字,此处不填。
- 分后端的 Table X 与其余载体的明细在正文被指向这些表;除上文已能对上的分位数片段和 Table XI 的五模型平均外,不把错位列改写成完整矩阵。
有什么可以进一步探索的点?
作者邀请做网络级防御、更有效的传染和机制研究,并把本次放大读作保守估计。
作者指出的局限与后续方向
- 观测不是描述:第五节写明,协调传播等混杂、以及多种智能体配置与 LLM 后端的聚合,使识别出的传染性应视为 suggestive of contagion rather than descriptive;并提到已有工作质疑 Moltbook 上智能体的自主性。
- 测定近似:第四节写明,用预填和钉住的 p(post) 是近似,会绕过发帖前内容并忽略若干相关;作者不对偏差方向作断言,只说在其数据上有界,重传估计应读作准确到一个小的常数因子以内。前沿 API 不支持预填,因此测定限于开源权重后端。
- 对手被故意削弱:第三节写明不赋予多种子、载荷诱导重传、定向播种和 carrier 优化;载体是从观察到的活动中手选,而不是为最大化传播而设计。作者称观察到的放大应读作保守估计,并在贡献列表里把 carrier 优化指到第七节。
- 排序范围:第三节写明本文限于 Moltbook 提供的通用 karma 排序,更复杂的个性化推荐被作者称为同样可处理的攻击面,但不在本文范围内。
- 后续工作:引言末尾与第七节的讨论邀请进一步研究此类防御(智能体审计与节制,以及可能由全网监测把传染实例标成高风险)、构造更有效的传染,以及对影响重传、放大和互动倾向的因素做机制研究。第七节讨论发现的含义、局限和可能的防御;作者称因为传播不要求智能体服从恶意重传指令,针对提示注入检测或防止攻陷的防御不能单独阻止 memetic trojan 的传播,大规模生态可能需要计入偏好、推荐机制和拓扑的网络级防御。
- 影响估计的范围:贡献列表中的 Fermi 式估计认为,在排序信息流网络上,有动机的攻击者有合理机会暴露与网络规模成比例的一部分;作者写明这一点对关注图网络不成立,那里的到达范围由种子的连通性界定。
实验覆盖范围
- 传染识别使用公开 Moltbook 帖子语料、四类排序面的线上快照,以及一份 Twitter 关注图快照;语义侧得到 191 个簇,Hawkes 使用固定 τ=2.5 h(非参数估计为 2.42 h)和 B=199 的时间置换。
- 行为测定覆盖五个具名开源后端;干净信息流边际概率与 rank-0 trojan 下的 fetch、install 列在 Table I;每人设采样 32–100 个 heartbeat;模拟把发帖率钉在 0.058。
- 攻击模拟比较纯传染、memetic trojan、裸链接和未通过检验的控制载体;状态侧含 hot 以及按小时、日、周的 top,边侧为关注图且无点赞通道。Table XI 报告十个载体在五个后端上的平均,并说明关注图级联不按载体变化。
- 补充实验包括附录 A 的预填对照、附录 B 的点赞/重传分解、附录 C 对 security 的四跳三十作者改写实验、附录 D 的参数消融,以及 Table VIII 的 N=150 闭环模拟。
- 论文未报告防御方法的实测结果,也未报告与人工判定的一致性;安装与 fetch 来自模拟动作而非真实 skill 安装。
总结一下论文的主要内容
memetic trojans 用内生社会传染携带载荷;security 载体在 top/day 上把期望安装放到裸链接的 2.97×。
Memetic trojans 是一类网络介导攻击:对抗载荷搭在智能体本来就会转发和点赞的内容上扩散,转发者不必被攻陷,也不必执行“请继续复制”的指令。
作者关心的是智能体社会网络里,低单点成功率仍可能在规模上放大。与 agent worms 和 mind viruses 不同,传播机制放在载体的内生可传播性上,而不是放在对抗性的自我复制目标上。对手只发一条帖,知道公开拓扑和排序,不知道目标网络里各智能体的速率和后端。
做法分三步。先在 Moltbook 上用词法、低 Zipf 新词和 191 个语义簇找单元,再用可见度标记的 Hawkes 过程估计 Rendo 与 rup,并用时间反转和点赞检验筛候选。再在五个开源后端上,用预填和直接采样测纯传染、带链接的 trojan 和裸链接的重传与点赞。最后在模拟 Moltbook 排序流和 Twitter 关注图上做蒙特卡洛,对照裸链接和关掉重传的情形。
测定上,作者称最有效传染约在 50% 的后续帖子中被重传,点赞速率约为平均帖的 2.5 倍,trojan 大体继承该病毒性。Table I 里 rank-0 安装概率从 gpt-oss-120B 的 0.594 到 command-r-35B 的 0。Table XI 在 top/day、五后端平均下,security 的期望安装为 1,603,相对 generic 的 468 为 2.97×;karma 为 0.40×,低于裸链接。作者称期望暴露最高放大到 3.19×,分布呈重尾,状态侧打进广播排序后每个周期可见剩余人口的 0.94。
作者的结论是:内生社会传输是多智能体系统中单独的一层攻击面;只做提示注入检测或防止攻陷,不足以挡住这种传播。作者把本次放大视为保守估计,并邀请后续做网络级监测与节制、更有效的传染,以及重传与点赞倾向的机制研究。