ProbeGuard:按共识形成过程判断弃答,识别医疗问答中的一致错误
Unanimously Wrong
AI 导读
论文提出 ProbeGuard,一个基于共识形成过程而非最终一致性的认证弃答框架,用于多轮智能体医疗问答系统。作者指出,一致同意是正确性的脆弱代理:系统可能在每个采样上都给出同一个错误答案,此时基于一致性的信号不携带任何信息,因为这类信号只读取共识的最终状态,丢弃了达成共识的过程。ProbeGuard 使用过程特征追踪一致性轨迹、少数意见持续性和检索饱和情况;对全票一致的投票,用理由语义熵检查投票背后的理由是否自洽,并通过主动探测检索反证、衡量共识能否存续;再用分层 Learn-then-Test 校准把这些分数转成选择性风险的无分布界。该工作已被 NeurIPS 2026 的 GenAI4Health Workshop 接收。