评测与基准arXiv:2609.32915 · 9月26日AgentTell:浏览器 Agent 的行为侧信道泄漏基准构建 AGENTTELL 基准,测量浏览器智能体跨站行为侧信道泄露网页与电脑操作·测试Claude Sonnet 5、Gemini 3.7 Flash、GPT-5.6 Luna 等 6 个·应用层Agent 危险操作摘要论文评估了浏览器智能体的行为侧信道泄露风险,并基于近万次会话提供了评测数据。完整解读
风险行为arXiv:2609.35291 · 9月28日窄域多模态微调可诱发涌现性失配,覆盖 15 个视觉语言模型发现无显式危害的窄域图文微调可诱发涌现失准网页与电脑操作·测试GPT-4o、GPT-4.1、Gemini 2.5 等 15 个·模型层失准与价值偏离视觉+2+2摘要证实窄多模态微调可引发全面的多渠道未对齐行为转变,揭示了后训练阶段对齐被隐蔽重塑的安全隐患。论文系统探究了视觉-语言模型中由窄任务微调诱发的跨模态涌现未对齐(Emergent Misalignment, EM)现象。完整解读