新论文称 Lean 验证不能为 OpenAI 的 Navier-Stokes 自然语言证明背书
论证 Lean 编译通过不能保证自然语言数学证明语义忠实
完整解读
论证 Lean 编译通过不能保证自然语言数学证明语义忠实
揭示类型化决策模型按选项标签而非定义规则作答
揭示检索生成中文本水印诱发事实幻觉的机制并提出 FPTI 与 FPAI 干预
论文研究生产级文本水印对大语言模型事实准确性的影响,分析了水印诱发幻觉的失效模式并评估了针对性缓解方案。
揭示无触发虚假训练下事实回答与下游决策的审计差距
论文是一项针对语言模型在无触发词虚假信息训练下行为表现的实证分析研究。
诊断护栏相对基座在对抗提示上的置信失校
诊断性分析:五个提示词分类 guard 的置信度,在清洁输入上可以较校准,在越狱包装后则变成高置信度的错误判定。
因果解耦来源依从与用户迎合的内部机制