跳到正文
原文
arXiv:越狱与提示注入· arXiv:2609.15576· Faruk Alpay·· 17 天前

LLM 答案发布中的审批完整性与恢复机制研究

Approval Integrity and Recovery in LLM Answer Publication

AI 导读

研究在 Lightcap 发布执行机制中检验精确内容绑定、授权新鲜度与检查点恢复,基于 RAGTruth 的 900 条人工标注回答、150 个源任务和三个带日期的 Ministral 模型,共产生 3,600 次评估。14B 生产响应检查器在 302 条无支撑标注答案中接受 291 条,直接基线仅接受 41 条,支持答案保留率分别为 95.2% 和 66.9%。在 65 条初始获批答案中,最终有状态复查恢复策略相对初始检查点使精确匹配错误增加 9.23 个百分点(95% 文章聚类区间 [-1.72, 19.61]);BIPIA 提示注入实验中 266 个有效编辑器输出零目标插入。

阅读原文arxiv.org