防御arXiv 2610.04412
论文研究 LLM 数字孪生参与增强民主时的提示注入脆弱性
提出检测、结构化与 GSPO 流程,降低共识生成的提示注入错位
- arXiv
- 2610.04412
- 发表
- 层
- 应用层
- 被测模型
- LLaMA-2 7B、LLaMA-3 8B、GPT 3.5 Turbo 等 14 个
摘要三章依次做个体偏好预测、政党知识图谱审议,以及共识生成对提示注入的脆弱性与一条防御流程。
这是一篇把 LLM 数字孪生放进增强民主的博士论文,分个体表示、政党聚合和共识生成的提示注入三章。