防御arXiv 2609.39107
MASCRDM:面向大语言模型训练过程的合规风险检测与缓解多智能体系统
提出 MASCRDM,在监督微调中实时检测并缓解偏见
- arXiv
- 2609.39107
- 发表
- 场景
- 模型与 API
- 测试
- Qwen3-8B-Base、Llama-3.1-8B
摘要MASCRDM 在 SFT 中按法规图谱检测数据、结构与损失风险,BBQ 总准确率在两模型上最高。
MASCRDM 把 AI 法律规章编成知识图谱,再由五个智能体在 LLM 训练中做实时合规检测与缓解,实验以偏见与歧视为代表风险。