分析与理论arXiv 2610.07009
研究受控拆解图像到文本越狱中图像属性的作用
固定有害指令,单轴归因图像到文本越狱的图像属性
- arXiv
- 2610.07009
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 被测模型
- GPT-4o、Claude Sonnet 4.5、Qwen3-VL-8B-Instruct 等 6 个
摘要固定文本的图像越狱拆解,只在 Qwen 上给出一条有界相关性归因。
固定有害指令,单轴归因图像到文本越狱的图像属性
摘要固定文本的图像越狱拆解,只在 Qwen 上给出一条有界相关性归因。
分析隐蔽推理在思维链监控下的信息足迹下界与不可读性
摘要论文从理论与实证探明了思维链监控的边界:复杂隐蔽计算必然泄露信息足迹且需承担长度税,但该足迹可被在线加密而不可读。