评测与基准arXiv 2609.39578
Box² Bench:语言模型能否有选择地依赖外部指导
提出 Box2-Bench,评测模型能否选择性依赖外部工作流
- arXiv
- 2609.39578
- 发表
- 层
- 应用层
- 被测模型
- Gemini 3.7 Flash、DeepSeek V4 Flash、GLM 5.2 等 9 个
摘要Box2 把利用与稳健拆开。
Box2-Bench 固定任务与模型,只改变工作流可靠性,用来衡量模型能否选择性依赖可能出错的外部指导。
提出 Box2-Bench,评测模型能否选择性依赖外部工作流
Box2-Bench 固定任务与模型,只改变工作流可靠性,用来衡量模型能否选择性依赖可能出错的外部指导。
提出基准投毒攻击,使自修改编码 Agent 跨代写出含漏洞代码
摘要论文报告了恶意基准能污染自修改代码智能体的进化过程并持续输出漏洞,警示系统设计需纳入安全约束。
提出推断期后门攻击 AKRASIA,用代码触发器与伪装推理篡改代码输出
摘要论文针对推理代码大模型提出了隐蔽推断期后门攻击 AKRASIA,揭示了模型思维链可被利用进行欺骗性伪装的安全隐患。
用演化算法构造 mind virus 并测量其在多智能体中的传播