评测与基准arXiv 2609.39229
RAIM:用廉价小模型聚合替代前沿模型做幻觉检测
提出 RAIM,用交叉拟合堆叠聚合廉价评审检测幻觉
- arXiv
- 2609.39229
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 被测模型
- Llama、Qwen、Mistral 等 10 个
摘要十个廉价评审的堆叠在可采纳区间接近 Sonnet,代价主要是一次域内校准。
提出 RAIM,用交叉拟合堆叠聚合廉价评审检测幻觉
摘要十个廉价评审的堆叠在可采纳区间接近 Sonnet,代价主要是一次域内校准。
提出 CAVE-BENCH,评测智能体在虚假指责下破坏已完成的正确工作
摘要论文提出了评估智能体在虚假指责下破坏已有正确成果的 CAVE-BENCH,发现强模型易推翻已知证据,提出了门控缓解方案。
审计 Active Inference Agent 上 LLM 解释器的监督叙述失败
作者审计的是挂在智能体上的运行时解释器,而不是智能体本身。操作员读到的是信念与动作的自然语言叙述。作者要问哪些可复现触发会让这段叙述失败,以及失败痕迹是什么样。
Reality Is the Final Verifier 用 two-gap framework 解释智能体软件工程的主要失败,并主张用外层保证环持续收窄缺口,而不是试图在部署前证明缺口已关闭。
提出 Sentinel-RL,将拓扑处置从 LLM 卸载到受约束图策略
Sentinel-RL 是面向 SOC 的神经符号架构:拓扑决策离开 LLM,改由认证图上的 HetGAT 与 PPO 完成。
用演化算法构造 mind virus 并测量其在多智能体中的传播
提出技能名称抢注攻击,利用 Agent 虚构技能名实施供应链劫持
本研究系统揭示了大模型智能体技能推荐场景下的虚构技能名称安全风险,将其形式化为一种新型供应链抢注攻击。
提出 Gram 审计框架,测量编程与研究智能体的破坏倾向