评测与基准arXiv 2608.20554
aiXamine:跨维度评测 LLM 安全、安全(security)与隐私权衡
提出 aiXamine 黑盒基准,统一评测 LLM 安全、稳健与隐私权衡
- arXiv
- 2608.20554
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Phi-4、openai/gpt-5-mini、openai/gpt-4o 等 15 个
摘要aiXamine 用九服务黑盒协议比较百余个模型,作者称单轴信任度进展可能削弱其他轴。
aiXamine 是一套黑盒评测协议,用来在同一条件下比较 LLM 的 safety、security 与 privacy,而不是再产出一个能力分。