攻击arXiv 2610.09920
研究:多向量视觉文档索引可被反演还原页面内容
提出流匹配逆向框架,从多向量视觉文档索引重构页面
- arXiv
- 2610.09920
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 被测模型
- Tomoro-ColQwen3-8B、ColQwen3.5-4.5B、Tomoro-colqwen3-embed-4b 等 13 个
提出流匹配逆向框架,从多向量视觉文档索引重构页面
评测文生图模型的有害内容生成能力与审核检测缺口
提出 Persona Guardrail,强制客服智能体守住功能边界
Persona Guardrail 是客服向智能体的同步运行时防御:先写明功能边界,再决定放行或拦截,而不是只检测某一攻击类。
提出 PMA,用流形对齐从 E2EO 混淆向量恢复明文
提出嵌入推断攻击 EIA,在黑盒 IR 中识别所用嵌入模型
EIA 是在黑盒 IR 上识别所用嵌入模型的攻击。。
提出 RA-Det,利用鲁棒性不对称检测 AI 生成图像
RA-Det 是合成图像检测器,用扰动下的表示稳定性差异代替外观痕迹。
提出 SciGuard 外部护栏与 SciMT 基准,控制化学科学 AI 误用
这篇工作把化学科学 AI 的误用控制做成外部智能体,而不是改模型权重。作者担心合成规划、毒性预测和科学语言模型被用来获取有害物质信息、规避监管或传播危险知识,同时合法工业用途又不能靠一律拒绝来处理。SciGuard 由 LLM 担任中介,把原则和指南放进短期记忆,把分子库、危害库、法规和交互历史放进可检索的长期记忆,再按 Chain of Thought 调用 Chemprop、LocalRetro 等工具,或用 RAG 补法规片段,最后回答、追问或拒绝。