评测与基准arXiv 2609.35028
VEX-Bench:评测 LLM 生成虚假信息的核验复杂度
提出 VEX-Bench 评测 LLM 生成虚假信息的核查复杂度
- arXiv
- 2609.35028
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 测试
- Claude Sonnet 4.5、Gemini 3.1 Pro、GPT-5.4 等 7 个
- 攻击恶意使用
摘要VEX-Bench 用筛查时的五维复杂度衡量虚假信息对核查容量的占用,并报告生成与核查的成本差。
VEX-Bench 把 LLM 虚假信息的风险从“能否生成”改成“筛查时会占用多少核查容量”。