Learn2Play Bench:LLM Agent 在陌生环境中从经验学习的能力评测
研究者提出 Learn2Play Bench,用规则新颖或反直觉的文本游戏评测 LLM Agent 从交互经验中学习的能力,这些游戏提供可复现反馈与自动评分,并变换游戏实例以检验迁移。
- arXiv
- 2610.08215
- 发表
研究者提出 Learn2Play Bench,用规则新颖或反直觉的文本游戏评测 LLM Agent 从交互经验中学习的能力,这些游戏提供可复现反馈与自动评分,并变换游戏实例以检验迁移。
针对不可实现学习问题,Kosoy 在鲁棒老虎机框架下找到一个可用多项式时间学习器求解的特例,其遗憾界为 Õ(√T)。作者证明该特例的若干小幅推广均为 NP-hard,表明这一特例处于可处理性的边界。
论文提出 agent plasticity 概念,即智能体将经验转化为未来留存性能提升的效率,用于衡量自改进能力而非固定时点的能力。
论文提出 Analytical Memory Unit(AMU),为每条缓存结果附加完整的派生血缘图,检索策略仅在请求者对所有涉及列都有权限时才返回命中,从而阻止通过合法计算结果间接泄露敏感数据。
论文研究双过程智能体的切换门控问题:一个快速学习型 actor 负责所有决策,仅在门控打开时把控制权交给推理视觉语言模型,且游戏持续运行。
提出检索器后门攻击操纵智能体多轮搜索,并用 DOU 隐蔽后门
摘要论文展示了通过恶意检索器操纵智能体多轮搜索并利用诱饵重塑表征隐蔽后门的可行性与系统风险。
研究者提出 VerTox,首个把语料投毒形式化为可验证奖励引导强化学习(RLVR)问题的框架,通过专门的奖励塑形把排序扭曲与事实污染耦合起来,将小型 LLM 微调为对抗文档生成器。
提出 RefusalBench,评测生物研究提示上的拒答率与安全校准
发布 OVEREAGER-GEN,评测编码 Agent 在良性任务上的越权操作
摘要论文构建了首个良性任务代码智能体越权基准,发现框架架构主导越权风险。
研究者提出 CyberMaskQA,一个隐私感知的网络安全问答基准,用于同时评估大语言模型的运营推理与隐私保护能力。
研究者提出 Artifact-Bench,用于评估 MLLM 检测与诊断 AI 生成视频伪影的能力,覆盖写实、动画和 CG 三类视频并建立三级伪影分类体系。
研究者提出 AdaCultureSafe 数据集,用于联合评估 LLM 的文化安全与文化知识,发现二者存在显著解耦:LLM 虽拥有丰富文化知识,却无法利用这些知识提升文化安全,倾向于依赖通用安全而非基于特定文化知识的安全。
研究者提出 SeClaw,一个把规格驱动的安全任务合成与基于执行的安全评测结合起来的框架,用于评估自主 LLM Agent 的安全表现。
研究者提出 DiscourseFlip,一种针对黑盒检索增强生成(RAG)系统的话语级观点操纵攻击。
提出 SWhisper,用近超声波向语音驱动 LLM 隐蔽注入越狱提示