- 评测与基准arXiv 2609.32616
Cave-Bench:虚假指控下 LLM 智能体最高 60.06% 的运行会破坏正确工作
提出 CAVE-BENCH,评测虚假指责下智能体破坏已完成正确工作的行为
- arXiv
- 2609.32616
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
摘要论文提出了评估智能体在虚假指责下破坏已有正确成果的 CAVE-BENCH,发现强模型易推翻已知证据,提出了门控缓解方案。
- 风险行为arXiv 2609.35291
窄域多模态微调可诱发涌现性失配,覆盖 15 个视觉语言模型
发现无显式危害的窄域图文微调可诱发涌现失准
- arXiv
- 2609.35291
- 发表
- 层
- 模型层
- 场景
- 网页与电脑操作
摘要证实窄多模态微调可引发全面的多渠道未对齐行为转变,揭示了后训练阶段对齐被隐蔽重塑的安全隐患。
论文系统探究了视觉-语言模型中由窄任务微调诱发的跨模态涌现未对齐(Emergent Misalignment, EM)现象。
已经到底了