可解释性arXiv 2610.02702·10月2日研究:LLM 智能体顺从多数时内部仍保留原有前提用 J-lens 检测屈从多数的智能体是否仍表征原前提arXiv2610.02702发表10月2日层模型层场景多智能体组件推理链摘要揭示 LLM 智能体屈从多数时内部仍表征原推理前提,指出辩论表态共识可能夸大真实认同。深度解读完整解读
攻击arXiv 2609.24994·9月22日BAM 反馈编码实现推理时隐蔽的智能体通信提出变长反馈编码 BAM,在生成文本中隐蔽传输秘密载荷arXiv2609.24994发表9月22日层模型层场景多智能体攻击者黑盒攻击检测规避技术编码与混淆深度解读完整解读