跳到正文
原文
论文追踪· arXiv:2608.30703· Sing Team·本站收录 · 原文发表

SingProbe 发布开源内在护栏框架,适配 29 个开源模型

SingProbe Technical Report

论文速读

防御

据论文 PDF 整理(AI 生成),以原文为准

Sing Team 提出内生护栏 SingProbe,复用解码隐状态做查询意图、回复安全与幻觉监测;Ling-3.0-flash 上回复安全平均 F1 为 0.8728。

威胁模型内生护栏(intrinsic guardrail)在自回归解码时复用基座模型已产生的隐状态,持续输出查询意图、回复不安全与幻觉分数,用于回复级判定与 token 级风险定位;不另起外部护栏模型反复编码文本。

问题
生成时安全监测若另起外部护栏,要反复编码已生成文本并增加服务开销。工业内生护栏已出现,但缺少可跨模型复用的开源训练、服务与评测栈。
方法
SingProbe 用轻量探针读取基座若干层拼接隐状态,在每个 token 输出查询意图、回复不安全与幻觉分数。粗粒度回复级标签经自适应置信加权聚合来学流式信号,并接入 SGLang 与 vLLM。
实验与结果
作者称 Ling-3.0-flash-singprobe 回复安全平均 F1 为 0.8728,流式平均 T-AUC 为 0.9481,幻觉平均 AUC 为 0.8012;解码探针的 token 间延迟开销低于 0.5%。同一信号还用于约束解码和医疗风险选择性干预。
局限与可以继续做的
作者称训练依赖 LLM 标注与合成数据,流式基准的不安全起点由句子级前缀标注。主实验以 Ling-3.0 为主,附录给出 29 个基座适配;论文报告了在线检测的类别不平衡。
实验设置Ling-3.0-tiny-singprobe、Ling-3.0-flash-singprobe 等 · Aegis2、XGuard 等 · F1、R-AUC 等
威胁模型
内生护栏(intrinsic guardrail)在自回归解码时复用基座模型已产生的隐状态,持续输出查询意图、回复不安全与幻觉分数,用于回复级判定与 token 级风险定位;不另起外部护栏模型反复编码文本。论文未把攻击者写成 no-box/black-box 等设定。
模型
Ling-3.0-tiny-singprobeLing-3.0-flash-singprobeGemini 3 ProGPT-5.1YuFeng-XGuard-Reason-0.6BYuFeng-XGuard-Reason-8BLlama Guard 3WildGuardGraniteGuardianShieldGemma-9BQwen3Guard-Gen-4B/8BQwen3Guard-Stream-4B/8BGPT-OSS-120BQwen3.5-397B-A17B
基准
Aegis2XGuardOpenAI ModerationXSTestHarmBenchExpGuardBeaverTailsPKU-SafeRLHFWildGuardSingStreamBenchSingStreamBench-FullFineHarmFactCHDFaithDialFAVARAGTruthShroomWikiBioMATHdatabricks-dolly-15kGSM8KMBPPOpenBookQA
指标
F1R-AUCT-AUCROC AUCFPRAccuracyTTFTITLQuery F1Response F1
AI 导读全文 372 字

SingProbe 是一个面向 LLM 生成时监控的开源内在护栏框架,复用基座模型自回归解码中已产生的隐藏状态,而不是让独立模型反复处理生成文本。它用轻量探针在解码过程中持续输出查询意图、回复安全和幻觉风险信号,报告给出了训练方法、与 SGLang 和 vLLM 的服务集成,以及覆盖不同家族和规模的 29 个开源基座模型的适配护栏。团队同时提出 SingStreamBench,用于衡量流式护栏能否在良性前缀上保持静默并及时发现新出现的不安全内容。在安全、流式检测、幻觉检测、误报鲁棒性、在线监控和运行时开销等评测中,SingProbe 的表现与最先进的独立护栏和专用幻觉检测器相当,在若干设置下更强,实现中增加的服务开销低于 0.5%。除被动监控外,内在护栏信号还可引导受限解码,并在 SingProbe-Med 中选择性触发医疗风险干预。

深度解读

6 个问题,约 8,500 字。每问先给一句结论,点开看完整回答

  1. 这篇论文试图解决什么问题?

    缺少可跨模型复用的开源内生护栏栈,难以在解码时低开销监测风险。

    缺少一套可跨模型复用、能在解码过程中持续监测风险的开源内生护栏(intrinsic guardrail)。

    • 场景与重要性:作者认为外部护栏要另起模型反复处理输入或已生成文本。内生路线复用基座自回归解码时已产生的隐状态,工业系统如 Constitutional Classifiers++ 与 Kelp/PlugGuard 已显示其价值,但主要面向特定模型或生产环境。
    • 现有不足:作者称社区还没有同时包含跨模型适配、统一训练方法、标准服务接入和系统评测资源的可复用开源栈。已有安全基准多为事后分类,只有回复级标签,难以判断护栏是否在良性前缀上保持沉默、并在有害内容出现时及时触发。
    • 核心观察:粗粒度的回复级安全与幻觉标签也可以训练出 token 级流式信号;基座隐状态里已含查询安全、回复安全与幻觉相关信息,可用轻量预测头读出。
    • 本文提出:SingProbe(Safety in Generation Probe)在解码中持续输出查询意图、回复不安全与幻觉分数,支持回复级决策与 token 级风险定位;并给出训练方法、29 个开源基座适配、SGLang 与 vLLM 接入,以及流式基准 SingStreamBench。信号还可引导约束解码,并在 SingProbe-Med 中选择性触发医疗风险干预。
    • 威胁模型:
      • 受害系统是正在自回归生成的 LLM 服务;护栏与解码在同一管线内运行。
      • 监测目标是查询意图、回复安全与幻觉风险,而不是事后再编码整段文本。
      • 知识来自基座已算出的选定层隐状态;探针不引入额外文本编码器。
      • 输出既可做完成后的回复级判定,也可在风险出现时做 token 级定位与生成时控制。论文未使用 no-box、black-box 等攻击者知识术语。
  2. 有哪些相关研究?

    相关工作分外部护栏、内生分类器与流式/幻觉探测;本文补开源可复用栈。
    • 外部独立护栏:Llama Guard(Inan et al., 2023)、WildGuard(Han et al., 2024)、ShieldGemma(Zeng et al., 2024)、Granite Guardian(Research, 2024)、YuFeng-XGuard(Lin et al., 2026)以及 Qwen3Guard(Zhao et al., 2025)用单独模型对输入或生成文本做安全分类。Qwen3Guard-Stream 为得到 token 级边界,对每个前缀做多次 rollout 并用 LLM 核验,作者认为标注成本高。
    • 内生护栏:Constitutional Classifiers++(Cunningham et al., 2026)用 softmax 加权目标把监督集中到预测危害较高的 token,避免显式 token 标注;作者认为权重直接由当前 logit 决定,初始化校准差时可能放大早期噪声。Kelp/PlugGuard(Li et al., 2025b)同样使用内部表示做生成时监测。作者称二者主要面向特定模型或生产设置。
    • 事后安全基准与细粒度标注:Aegis、HarmBench、BeaverTails、XSTest、WildGuard 等主要给回复级标签。FineHarm(Li et al., 2025c)先做句子级标注再把有害句中的实词映射到 token;作者称人工检查发现细粒度标签噪声较大,且危害常依赖上下文,难以给孤立 token 稳定标签。
    • 隐状态幻觉检测:DRIFT(Bhatnagar et al., 2026)、HaMI(Niu et al., 2025)、SAPLMA(Azaria & Mitchell, 2023,含 raw 与 response 两种输入)分别覆盖轻量探测、自适应 token 选择和免训练 NTK 打分。

    基线方法包括 Gemini 3 Pro、GPT-5.1、上述开源护栏,以及在相同数据、Ling-3.0-flash 与架构上复现的 Vanilla、CC++、Kelp。基准/数据集覆盖 Aegis2、XGuard、OpenAI Moderation、XSTest、HarmBench、ExpGuard、BeaverTails、PKU-SafeRLHF、WildGuard、SingStreamBench、SingStreamBench-Full、FineHarm,以及 FactCHD、FaithDial、FAVA、RAGTruth、Shroom、WikiBio。

    作者把本文定位为补上跨模型适配、统一训练、SGLang/vLLM 接入和系统评测这一层,并用自适应置信加权从粗标签学习流式信号。

  3. 论文如何解决这个问题?

    轻量探针读多层隐状态,用自适应加权从粗标签学三类流式分数。

    SingProbe 在自回归解码中直接读取基座若干层隐状态,用轻量头在每个 token 同时给出查询意图、回复不安全和幻觉分数。

    问题设定与形式化

    • 输入:基座 M 有 L 层。对序列 x,层 ℓ 在 token xt 的隐状态为 h_t^{(ℓ)}。探针只取子集 S 的拼接隐状态,不另加文本编码器。
    • 输出:式 (1) 中 s_t = g_θ({h_t^{(ℓ)}}_{ℓ∈S}),含 μ 维查询意图分数、一维回复不安全分数和一维幻觉分数。分数视为 logit,需要概率或决策时再做任务相关归一化。因隐状态只依赖前缀 x_{≤t},预测随生成因果更新。
    • 查询意图:沿用 SingGuard 的八类,前七类为风险(Sexual Content Risk、Real-World Crimes & Public Safety、Unethical Behavior、Cybersecurity & Information Manipulation、Agent Safety、Politically Sensitive Content、Animal Abuse),第八类为 Safe。分数越高表示该类证据越强。
    • 回复侧:不安全分数衡量截至当前 token 的回复前缀风险;幻觉分数估计已生成内容含幻觉的可能性。二者都在解码中更新。

    训练目标

    • 总损失:式 (2) L_total = w_q L_query + w_s L_safety + w_h L_hallu。权重不固定,而按各任务损失的指数滑动平均重分配:近期损失更高的任务权重大,同时保留配置的基权重。平滑系数 α=0.9,分母用 10^{-9} 防止为零。三项权重比的平均为 1,以保持总损失量级。
    • 查询意图:对七个风险类独立做二元交叉熵,允许多风险并存;Safe 与全部风险类互斥。另加软互斥项,惩罚 Safe 与最可能风险类同时偏高。λ_safe 与 λ_mutex 分别控制 Safe 损失和互斥惩罚。只在有有效标签的位置计算。
    • 回复安全与幻觉:数据集通常只有回复级标签。作者不用 Qwen3Guard-Stream 的多次 rollout,也不直接用 CC++ 那种由当前 logit 决定的加权。二者都用 token 级 BCE,再经自适应置信加权聚合:预测离散度不够时退回均匀平均,离散度足够时把更大权重分给预测风险更高的 token。对负样本,强调高风险 token 以压低虚假峰值;对正样本,降低良性前缀权重,避免把整段前缀都推向风险类。权重在样本内归一化,长回复不会主导训练。

    数据与探针结构

    • 语料:统一覆盖有害提示、敏感但良性提示、有害回复、安全拒答和有帮助的安全补全。查询标签与回复标签分开,同一来源可做提示筛查、回复监测和联合分类。公开数据只用官方训练划分,标签先映射到本文细粒度体系,再由 LLM 按本文定义核验;不一致样本进入难例池。无标签与难例由 Qwen3.5-397B-A17B 与 Kimi-K2.6 等独立标注,需同时通过二元一致性和细类检查。幻觉侧把正确答案和诚实拒答标为非幻觉,把错误、编造或无支持答案标为幻觉。
    • 合成:每个风险类由内部红队越狱模型生成有害提示,对齐模型生成话题相近的良性对照,以减少词面捷径。不安全提示同时配有害回复与合规拒答或安全替代,良性提示配有帮助回复。另合成多类别与多语言样本,并由未参与生成的 LLM 复评,标签不一致则删除。训练时去重、平衡主要风险类的安全/不安全样本,并保留高置信边界例。查询标签对齐查询边界的表示,回复安全与幻觉标签监督回复轨迹。
    • 默认结构:实验中探针是 query-residual 多头注意力块:计算 Q、K、V 得到注意力输出 O,再输出 Norm(Q+O),接线性分类器。默认从浅、中、深均匀取三层隐状态。主文实验用 Ling-3.0-tiny-singprobe 与 Ling-3.0-flash-singprobe。查询分类时,让基座对查询生成最长 512 token,再对回复各位置的八维分数取平均。回复安全与幻觉在 teacher forcing 下取整段回复分数的最大值作为回复级风险分。

    流式基准与服务接入

    • SingStreamBench:把回复看成可选安全前缀接上决定标签的续写。不以孤立 token 为真值,而按句子切分,对累积句子前缀标注,记录第一个不安全前缀中新句子的起点为 Unsafe_Start_Index。Table 1 的六档从普通样本、不安全查询配安全拒答、安全前缀配安全续写,到复杂安全前缀后接不安全回复、查询侧加背景、以及多问题中安全回答先于不安全内容。核心集 210 条经人工核验;Full 有 2,428 条。种子来自 BeaverTails、PKU-SafeRLHF、WildGuard、XSTest、expguard。三名评审 Qwen3-235B-A22B、GLM-5.2、Kimi-K2.6 须一致才保留种子;前缀标签由 Kimi-K2.6 给出。
    • 服务:与 SGLang、vLLM 集成,解码与打分在同一管线。Decode Probe 只在解码时运行;Prefill-enabled Probe 在 prefill 阶段也运行。附录给出完整提示词与更多适配细节的部分,论文正文未逐条展开超参数 T、τ、λ 的取值。
  4. 论文做了哪些实验?

    主结果在查询、回复安全、流式、幻觉和开销上与外部及内生基线对比。

    实验设置

    • 被测与基线:主文为 Ling-3.0-tiny-singprobe、Ling-3.0-flash-singprobe。外部护栏含 Gemini 3 Pro、GPT-5.1、YuFeng-XGuard-Reason-0.6B/8B、Llama Guard 3、WildGuard、GraniteGuardian、ShieldGemma-9B、Qwen3Guard-Gen 与 Stream 的 loose/strict。内生对照 Vanilla、CC++、Kelp 使用相同训练数据、Ling-3.0-flash 与架构,且只比回复安全。幻觉基线为 DRIFT、HaMI、SAPLMA-raw、SAPLMA-response。部分基线数字来自 Group (2026)。附录 B 扩展到 29 个开源基座。
    • 安全指标:查询与回复分类报 F1。流式用回复级 R-AUC(全 token 上回复安全分的最大值对回复级标签)和 token 级 T-AUC(每个 token 分数对细粒度标注;安全前缀 token 标为 0),作者以平均 T-AUC 为主指标。良性集报查询/回复 FPR。幻觉用回复级 ROC AUC,分数为回复 token 上的 MAX。
    • 协议:离线安全与幻觉多为 teacher forcing。在线安全让 Ling-3.0 自由生成,伪标签为其余三个检测器的多数票(leave-one-out);SingProbe 用偏差校准检查点、决策阈值 0.5,报 Accuracy 与 F1。在线幻觉由 Qwen3.5-397B-A17B 对照参考答案打二元标签。开销协议:输入 8,192、输出 1,024 token,并发 1–32,测 8 轮,报相对基座的 TTFT 与 ITL。论文未报告主表的随机重复次数。

    主结果

    据 Table 2–4、Table 6,主文平均指标如下。

    表格较宽,可左右滑动

    模型查询 F1 (T2)回复安全 F1 (T3)流式 T-AUC (T4)幻觉 AUC (T6)
    Ling-3.0-flash-singprobe0.86740.87280.94810.8012
    Ling-3.0-tiny-singprobe0.85610.85080.94790.7765
    GPT-5.10.86830.7804未报告未报告
    YuFeng-XGuard-Reason-8B0.87140.8513未报告未报告
    Qwen3Guard 最强相关配置0.8602 (Stream-8B-strict)0.8604 (Gen-8B-strict)0.8988 (Stream-4B-strict)未报告
    Ling-3.0-flash-CC++未报告0.86520.9478未报告
    Ling-3.0-flash 上 DRIFT未报告未报告未报告0.8000
    • 作者解读:查询上 Ling-3.0-flash-singprobe 平均 F1 0.8674,接近 YuFeng-XGuard-Reason-8B(0.8714)和 GPT-5.1(0.8683),高于所评 Qwen3Guard 的最好平均 0.8602;ExpGuardTest 上为 0.8825。从 tiny 换到 flash,平均 F1 从 0.8561 升到 0.8674。
    • 回复安全:flash-singprobe 平均 F1 0.8728,比 Qwen3Guard-Gen-8B-strict 高 1.24 个百分点,比同设置 Vanilla、CC++、Kelp 分别高 1.93、0.76、0.98 个百分点。WildGuard 与 XGuard Test 上该配置最高(0.8000、0.8588);ExpGuardTest 上 CC++ 最高(0.9253)。
    • 流式与幻觉:flash-singprobe 平均 T-AUC 0.9481、R-AUC 0.9887;相对最强 Qwen3Guard-Stream,平均 T-AUC 高 4.93 个百分点。Kelp 平均 R-AUC 最高(0.9912),T-AUC 为 0.9193。幻觉上 tiny-singprobe 平均 AUC 0.7765,比 DRIFT 高 3.57 个百分点;flash-singprobe 为 0.8012,DRIFT 为 0.8000。

    误报、开销与层数

    • 误报:Table 5 在 MATH、databricks-dolly-15k、GSM8K、MBPP、OpenBookQA 上自由生成。Ling-3.0-flash-singprobe 宏平均查询/回复 FPR 为 0.08%/0.01%;tiny 为 0.26%/0.04%。Vanilla、CC++ 的回复宏平均 FPR 同为 0.01%,查询为 0.08%;Kelp 查询为 0.28%。作者称这些集未穷尽安全审计,数字是表观 FPR,可能略高估真实误报。
    • 开销:Table 7 中 Decode Probe 的 ITL 从并发 1 的 +0.18% 到并发 32 的 +0.45%,均低于 0.5%;TTFT 多在约 ±1.5% 内,并发 2 和 4 的点估计为负。Prefill-enabled 的 TTFT 为 +0.86% 到 +2.25%,ITL 仍低于 0.5%。作者称开销不随并发上升。摘要写实现中服务开销小于 0.5%。
    • 层数:Figure 3 与正文,L∈{1,2,3,5,8}。Query AUC 在 0.9560–0.9579,Response AUC 在 0.9648–0.9684。仅末层时 Response AUC 0.9648、流式回复 AUC 0.9767;L=3 时分别为 0.9677 与 0.9823。幻觉 AUC 从 L=1 的 0.7750 到 L=3 的 0.7963、L=8 的 0.7988。各配置良性 FPR 不超过 0.02%。作者称 L>3 后收益变小而参数、显存和延迟继续增加,故默认三层。Figure 3 上还标有一组 0.924–0.931 的 Stream Token AUC 柱值。

    在线监测

    • 在线安全:Table 8。Ling-3.0-tiny-singprobe 平均 Acc/F1 为 0.8089/0.4726,低于同协议下 YuFeng 等独立护栏。Ling-3.0-flash-singprobe 为 0.9641/0.6452,平均 F1 比 YuFeng-XGuard-Reason-8B 的 0.5964 高 4.88 个百分点,WildGuard 与 XSTest 的 F1 为 0.6364 与 0.5405。作者称 F1 偏低主要因自由生成多为 Safe、正类少,宜与 Accuracy 一起做相对比较。
    • 在线幻觉:自由生成后由 Qwen3.5-397B-A17B 打标签,数据集为 AA-Omniscience、BBH、GSM8K、MATH-500、NQ-Open、SQuAD、TruthfulQA。Ling-3.0-tiny-singprobe 平均 AUC 0.6786,高于 DRIFT 的 0.6316(差 0.047);flash 为 0.7271,高于 DRIFT 的 0.6546(差 0.073)。作者称 flash 上 SingProbe 在七个数据集中的五个排第一:AA-Omniscience、GSM8K、MATH-500、NQ-Open、SQuAD。

    其他消融与分析

    • Figure 1:以 Ling-3.0-flash 为基座,横轴为相对仅基座服务的额外延迟,纵轴为各基准上 Query F1 与 Response F1 的平均;非流式护栏在完整回复后调用一次,流式护栏每步调用。CC++/Kelp 为相同架构与数据下的复现。图中具体端点数值正文未逐一列出。
    • Table 22:29 个适配里幻觉宏平均 AUC 从 Qwen3.5-0.8B-singprobe 的 0.7480 到 GLM-5.3-singprobe 的 0.8170;Qwen3.5-397B-A17B-singprobe 与 Qwen3.5-35B-A3B-singprobe 均为 0.8117。
    • 附录中若干大基座在良性集上的回复侧百分比约在 0.00%–0.08%(摘录列与数据集对应关系在转换文本中未完全对齐,此处不逐格引用)。
    • 生成时应用:作者称同一信号可做约束解码,并在 SingProbe-Med 中只在相关后缀上选择性启动医疗风险干预,而不是全程干预。正文摘录未给出这两组应用的数值表。
  5. 有什么可以进一步探索的点?

    作者把开源栈定位为便于后续研究;主文数字集中在 Ling-3.0。

    作者指出的局限与后续方向

    论文摘录中的 Conclusion 只写作者希望开源基础设施、训练方法和模型适配能促进内生护栏的采用、部署和该方向的后续研究(摘要与贡献列表)。摘录未单列 Limitations 节,也未把某项实验失败写成明确的未来工作清单。因此按可见正文,论文未专门讨论局限。

    与评测可靠性直接相关、且作者在结果中写明的限制仍予记录:

    • 表观误报:第 4.3 节称 MATH 等五个良性集未穷尽安全审计,可能含少量真正不安全样本,Table 5 的 FPR 应视为表观值,可能略高估真实误报率。
    • 在线 F1:第 4.7.1 节称自由生成中多数回复为 Safe,正类少,少量假阳或检测器分歧会压低精确率与 F1;在线 F1 宜与 Accuracy 一起做同协议相对比较,不宜直接与更平衡的离线基准比较。
    • 细粒度真值:第 3.1 节称 FineHarm 的 token 标签噪声较大,且危害常依赖上下文,孤立 token 难以有稳定安全标签;SingStreamBench 因此改为句子级累积前缀标注。

    实验覆盖范围

    • 主文被测探针为 Ling-3.0-tiny 与 Ling-3.0-flash;附录 B 报告 29 个开源基座适配,家族包括 Ling 3.0、Qwen、Llama 3、Gemma 4、gpt-oss、GLM、Step、MiniMax、DeepSeek、Hy(第 1 节与 Table 22)。
    • 回复安全的内生对照为 Vanilla、CC++、Kelp,且只在回复安全相关评测中比较(第 4.1 节);外部护栏含两家专有模型和 12 个开源配置。
    • SingStreamBench 核心集 210 条人工核验,Full 为 2,428 条;流式指标为 R-AUC 与 T-AUC(第 3.4、4.3 节)。种子评审为三模型一致,前缀标签使用 Kimi-K2.6。
    • 开销在 Ling-3.0-flash 上、输入 8192 / 输出 1024、并发 1–32、8 轮测量(Table 7)。层数消融 L=1,2,3,5,8(第 4.6 节)。
    • 论文未报告自适应攻击。约束解码与 SingProbe-Med 在第 4.7 节作为生成时应用提出;摘录未给出对应数值。训练目标中的 T、τ、λ_safe、λ_mutex 与基权重的具体取值,正文未给出。
  6. 总结一下论文的主要内容

    SingProbe 用轻量内生探针做生成时三类监测,并给出流式基准与低开销服务接入。

    SingProbe 是面向生成时监测的开源内生护栏:复用基座解码隐状态,而不是另起模型反复编码文本。

    • 问题:外部护栏带来额外编码与服务协调;已有内生系统多绑定特定模型。事后安全标签也看不出护栏是否在良性前缀上保持沉默、并在有害内容出现时及时反应。
    • 方法:轻量 query-residual 注意力头默认读取浅、中、深三层隐状态,每 token 输出八类查询意图、回复不安全和幻觉分数。三项损失按近期损失的滑动平均重加权。回复侧用自适应置信加权,从回复级粗标签学习流式信号。语料由公开数据规范化、策略合成和多模型质检构成。服务接入 SGLang 与 vLLM。SingStreamBench 用六档查询/前缀结构评测沉默与及时检测;核心 210 条,Full 2,428 条。
    • 结果:Ling-3.0-flash-singprobe 的查询平均 F1 为 0.8674(Table 2),回复安全平均 F1 为 0.8728(Table 3),流式平均 T-AUC 为 0.9481(Table 4),离线幻觉平均 AUC 为 0.8012(Table 6)。良性集上该配置宏平均回复 FPR 为 0.01%(Table 5)。Decode Probe 的 ITL 开销在并发 1–32 均低于 0.5%(Table 7)。在线安全中 flash 平均 F1 为 0.6452(Table 8);在线幻觉平均 AUC 为 0.7271,高于同骨干 DRIFT 的 0.6546。tiny 骨干在在线安全 F1 上低于独立护栏。
    • 作者结论:内生轻量头可以在多项设置上与独立护栏和专用幻觉检测器竞争,并少一个独立推理服务;同一信号可支持约束解码和选择性医疗风险干预。作者计划以开源训练、适配与基础设施促进部署和后续研究。
阅读原文arxiv.org