评测与基准arXiv 2609.39229
RAIM:用廉价小模型聚合替代前沿模型做幻觉检测
提出 RAIM,用交叉拟合堆叠聚合廉价评审检测幻觉
- arXiv
- 2609.39229
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 测试
- Llama、Qwen、Mistral 等 15 个
摘要十个廉价评审的堆叠在可采纳区间接近 Sonnet,代价主要是一次域内校准。
提出 RAIM,用交叉拟合堆叠聚合廉价评审检测幻觉
摘要十个廉价评审的堆叠在可采纳区间接近 Sonnet,代价主要是一次域内校准。
提出 harm laundering,证明安全训练改写而非消除性别歧视
Wyer、Black 与 Al Moubayed 用 OpenAI GPT 谱系检验:毒性分数下降是否等于歧视减少。 他们的答案是否定的,并把“显性伤害被改写成评测指标看不见的形式”称为 harm laundering。
提出条件触发的爆炸提示词,延迟激活 Agent 的间接提示注入
论文针对大语言模型智能体面临的间接提示注入威胁,研究了利用条件句式实现时间分离的爆炸提示词。