跳到正文
原文
MDPI·本站收录 · 原文发表

研究评估嵌入预过滤,将百万级 LLM Agent 社交网络消息筛查成本降低最高 65.6%

Evaluating Safety Embedding Prefiltering for Analyzing Millions of LLM Agent Social Network Messages for Security and Safety Harms

AI 导读

研究者提出用轻量嵌入预过滤器先筛掉明显安全的内容,再交给前沿 LLM 判定,以降低对 Agent 社交网络 Moltbook 全量消息做安全筛查的成本。团队用 GPT-5.5 以高推理强度标注了 1 万条 Moltbook 帖子与评论,其中 9.2% 被判定为严重度 3 及以上的不安全内容;两名人类标注者之间一致性较高(κ=0.823),但与 LLM 判定仅为中等一致(κ=0.578)。在召回率校准到 0.80 时,扫描 787,226 条消息的预估成本从 7085 美元分别下降 49.9%(MiniLM-L12-v2)、55.6%(BGE-M3)和 65.6%(有监督分类器),其中 MiniLM 的推理速度约为分类器的 32 倍。数据集 MoltSafe-10K 与复现代码已公开。

阅读原文mdpi.com