攻击arXiv 2610.09920
研究:多向量视觉文档索引可被反演还原页面内容
提出流匹配逆向框架,从多向量视觉文档索引重构页面
- arXiv
- 2610.09920
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 被测模型
- Tomoro-ColQwen3-8B、ColQwen3.5-4.5B、Tomoro-colqwen3-embed-4b 等 13 个
提出流匹配逆向框架,从多向量视觉文档索引重构页面
提出危害窗口与区间指标,统一评测分解攻击和提示注入下的智能体滥用监视
摘要统一智能体滥用监视框架,动作视角兼顾两类威胁但危害定位仍存瓶颈。
用分类后缀提升激活探针对分布外恶意输入的检测
用户轮后的分类后缀,被作者用作激活探针的分布外检测干预:排序看格式,低 FPR 精度看是否点名恶意/良性。
提出 DART,用去噪表征转移检测多轮智能体攻击并注入提醒
用能量势垒信号检测扩散语言模型的越狱
Bach 等提出用去噪能量景观解释 masked diffusion 语言模型上的越狱,并由此得到三个免训练检测信号。。
提出局部稀疏无监督安全检测,标记偏离安全分布的输入
提出 HERALD,用跨层有害投影轨迹检测越狱提示
摘要HPD 用跨层投影形状区分有害与良性提示。
提出 PMA,用流形对齐从 E2EO 混淆向量恢复明文
在写入点定位拒答方向,经刚性旋转跨架构迁移并门控放大
作者研究拒答表示是否随架构改变,结论是表示共享、读取位置随架构变。
提出嵌入推断攻击 EIA,在黑盒 IR 中识别所用嵌入模型
EIA 是在黑盒 IR 上识别所用嵌入模型的攻击。。
提出 D²-Monitor,按犹豫步数把难提示路由到更强探针