防御arXiv 2610.07570
ProbeGuard:按共识形成过程判断弃答,识别医疗问答中的一致错误
提出 ProbeGuard,按共识形成过程对医疗问答做选择性弃答
- arXiv
- 2610.07570
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 被测模型
- Qwen3-8B、Llama-3.1-8B-Instruct、HuatuoGPT-o1-8B
摘要ProbeGuard 用共识形成过程做可认证弃权,并在全票层分开答对与答错的共识。
ProbeGuard 是给多轮共识医学问答用的认证弃权框架:基板照原样作答,弃权只看共识是怎么形成的。