研究:多向量视觉文档索引可被反演还原页面内容
提出流匹配逆向框架,从多向量视觉文档索引重构页面
- arXiv
- 2610.09920
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 被测模型
- Tomoro-ColQwen3-8B、ColQwen3.5-4.5B、Tomoro-colqwen3-embed-4b 等 13 个
提出流匹配逆向框架,从多向量视觉文档索引重构页面
提出 AgentPrivArena 与运行时审计,评测 Agent 轨迹级隐私泄露
提出危害窗口与区间指标,统一评测分解攻击和提示注入下的智能体滥用监视
摘要统一智能体滥用监视框架,动作视角兼顾两类威胁但危害定位仍存瓶颈。
评测 ReAct 工具调用对多模态模型拒答有害请求的削弱
论文系统评估了智能体工具调用范式对多模态大语言模型拒答能力的影响,指出了工具增强视觉推理背后的安全隐患。核心探讨的问题在于:当 MLLM 从单次推理转向通过 ReAct 循环调用外部工具(打标、缩放、OCR、代码执行)时,工具使用机制本身是否会降低模型拒答有害请求的概率。
提出 imMRAG 攻击,从多模态 RAG 私有图像库提取内容
提出 RECAST,本地改写图表与语音并做可逆数值映射以保护远程推理隐私
展示智能体在禁止泄露与独立监视下自发建立隐蔽信道传递机密
论文研究了固定参数与提示词的智能体在受审计交互中自发形成隐蔽信道并泄露机密的过程。
提出控制标记注入,清空工具 Agent 的思维链以绕过推理监控
摘要论文阐明控制标记注入可抑制 CoT 使监控失效并促成拒绝绕过,且工具执行受解析器宽容度影响。
提出 Auto Mode ++,加固编码 Agent 阻断监视器
摘要系统评估生产阻断监视器在面对持续恶意智能体时的表现,提出加固防御并指明多上下文防御挑战。
提出嵌入推断攻击 EIA,在黑盒 IR 中识别所用嵌入模型
EIA 是在黑盒 IR 上识别所用嵌入模型的攻击。。
评测开发者能否在协作编程中发现编码 Agent 的隐蔽破坏
提出企业级检测系统 ADR,识别编程 Agent 的提示注入与恶意 MCP
摘要提出了端点因果遥测、两级在线分流与离线红队闭环的 ADR 系统,并在生产环境中验证了有效性。
提出双重隐写越狱 Odysseus,用图像隐写绕过多模态系统安全过滤器
提出 SafeScientist 四层监控,阻止科研智能体执行高风险或不伦理任务
SafeScientist 是带四层监控的科研智能体框架,并用 SciSafetyBench 评测科学场景中的任务安全。