跳到正文
原文
论文追踪· arXiv:2605.25893·本站收录 · 原文发表

D²-Monitor:基于犹豫信号的扩散大语言模型动态安全监控

D²-Monitor: Dynamic Safety Monitoring for Diffusion LLMs via Hesitation Signals

AI 导读

D²-Monitor 是一种针对扩散大语言模型(D-LLM)的动态安全监控方法,利用中间隐藏状态反复接近探针决策边界的"安全犹豫"信号来判断样本难度。轻量探针先对每个样本给出基础预测和犹豫估计,再决定是否升级到更强探针,后者仅读取至少出现一次犹豫步骤的轨迹最小片段。在 WildGuardMix、ToxicChat、OpenAI-Moderation 3 个数据集和 4 个 D-LLM 上,该方法以不超过 0.93M 参数取得 SOTA 表现,并在 8 个基线中实现最佳效果与效率权衡。

阅读原文arxiv.org