防御arXiv 2609.34857
CREDO:用可微读出替代文本采样校准推理模型置信度
提出 CREDO,用保留 token 对的可微读出校准推理模型置信度
- arXiv
- 2609.34857
- 发表
- 场景
- 模型与 API
- 测试
- Qwen3-8B、Qwen3-1.7B、Qwen3-4B
- 防御模型加固
摘要CREDO 用可微两 token 读出替代口头置信,在数学和代码上同时拉高准确率与校准。
CREDO 把 RLVR 里的置信从“采样一个数字”改成“读一对保留 token 的相对概率”,并用可微回归和差异加权同时拉准确率与校准。。