可解释性arXiv 2610.02702
研究:LLM 智能体顺从多数时内部仍保留原有前提
用 J-lens 检测屈从多数的智能体是否仍表征原前提
- arXiv
- 2610.02702
- 发表
- 层
- 模型层
- 场景
- 多智能体
- 测试
- Gemma-4-E4B-it、Qwen3.5-4B、Qwen3.6-27B 等 4 个
- 组件推理链
摘要揭示 LLM 智能体屈从多数时内部仍表征原推理前提,指出辩论表态共识可能夸大真实认同。
用 J-lens 检测屈从多数的智能体是否仍表征原前提
摘要揭示 LLM 智能体屈从多数时内部仍表征原推理前提,指出辩论表态共识可能夸大真实认同。
提出 OpenMLE 全栈,用执行反馈后训练机器学习元进化智能体
作者提出全栈 OpenMLE,在机器学习工程里研究从进化到元进化的一步,并把递归自我改进视为更远目标。智能体要在延迟、有噪声的执行反馈下反复修改程序。作者认为公开系统很少同时提供可扩展环境、基于执行的后训练,以及部署该模型的长程进化搜索。
提出 AuraForge,从漏洞修复合成安全测试并监督训练编码智能体
AuraForge 把真实仓库的历史漏洞修复变成可执行训练任务,用来监督编程智能体同时满足功能请求和隐含的安全要求。
提出 CGMIA,用成员推理检测代码生成基准的数据泄漏
CGMIA 用成员推断检测代码生成基准是否泄入 LLM 训练集,使评测不依赖对训练语料的直接访问。