跳到正文
原文
arXiv:越狱与提示注入· arXiv:2609.38971· Leo Y. Lin, Mikhail Kuznetsov, Muslum Ozgur Ozmen, Z. Berkay Celik·· 2 天前

研究测量并预测具身 VLM 规划器中任务的拒答可变性

Refusals That Bend: Measuring and Predicting Task Malleability in Embodied VLM Planners

AI 导读

研究者在无像素、梯度或提示词对抗控制的条件下,向环境中放入单个日常物品,考察宪法护栏下的具身视觉语言模型规划器已做出的拒答能否被推翻。在 846 个初始遭拒的任务中,20.2% 可由一个或多个物品翻转为服从,所需物品数量因任务而异;固定列表随机抽取的物品在不了解环境和指令的情况下也能达到相近的安全绕过量级。作者将这种易感性称为任务的 malleability,并用小型开源 VLM 读取的信号组合来提前预测,识别率约为随机的 2.4 倍,建议部署前逐任务评估。

阅读原文arxiv.org