可解释性arXiv 2610.02702
研究:LLM 智能体顺从多数时内部仍保留原有前提
用 J-lens 检测屈从多数的智能体是否仍表征原前提
- arXiv
- 2610.02702
- 发表
- 层
- 模型层
- 场景
- 多智能体
- 测试
- Qwen3.5-4B、Qwen3.6-27B、Gemma-4-E4B-it 等 4 个
- 组件推理链
摘要揭示 LLM 智能体屈从多数时内部仍表征原推理前提,指出辩论表态共识可能夸大真实认同。
用 J-lens 检测屈从多数的智能体是否仍表征原前提
摘要揭示 LLM 智能体屈从多数时内部仍表征原推理前提,指出辩论表态共识可能夸大真实认同。
提出 SAKIKO 框架,审计工具调用 LLM 的定向激活干预是否构成修复
SAKIKO 审计工具型 LLM 在执行前 K 路动作上的内部干预:行为净增益、到达正确动作、保住原本正确的决策、以及统计证据充分,是四件分开的事。