研究:多向量视觉文档索引可被反演还原页面内容
提出流匹配逆向框架,从多向量视觉文档索引重构页面
- arXiv
- 2610.09920
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 被测模型
- Tomoro-ColQwen3-8B、ColQwen3.5-4.5B、Tomoro-colqwen3-embed-4b 等 13 个
提出流匹配逆向框架,从多向量视觉文档索引重构页面
提出 RAG-PIBench,评测 RAG 上下文中提示注入检测器
用配对回放评测任务范围授权能否阻断越权工具执行
提出 MADBench,评测多智能体辩论是吸收还是放大对抗影响
MADBench 是一个评测多智能体辩论安全性的基准,用来看攻击是被辩论吸收还是被放大。
用因果激活修补定位模型服从提示注入的决策层
这篇工作用逐层激活修补定位提示注入合规发生在网络何处,并把该位置用于检测验证。。
提出 ToolFence,以能力蓝图和确定性授权拦截 Agent 未授权工具调用
提出双控多智能体基准 DUMA-Bench,测量对抗环境下的策略违反
DUMA-Bench 把 τ²-bench 的双控交互做成智能体安全评测,用来看策略违反如何随用户、模型和环境一起出现。
提出 Provenance-Aware Transformers,隔离不可信来源防御间接提示注入
用任务绑定令牌和策略预言机拦住多智能体流水线的未授权执行
作者在一条会改写沙箱邮件库的四智能体流水线上,检查低权限失陷会不会变成未授权的真实动作。
提出神经符号纵深架构,阻断 AI-SOC 的日志投毒与间接提示注入
构建 COUNTER-GEO-BENCH,评测生成式搜索中的 GEO 虚假信息防御
摘要论文构建了针对 GEO 虚假信息的首个防御基准,揭示通用护栏的失效与反作用,并提出了有效的轻量对比检测基线。
提出类型化溯源与断言护栏,约束持久 Agent 释放自传断言
用 MisKnow-Agent 评测深度研究智能体是否采纳误导文档结论
摘要论文通过 MisKnow-Agent 框架评估发现长程研究智能体易采纳误导性知识,且现有防御难以完全消除该现象。
提出 LogInject 框架,评测日志分析中的被动提示注入及缓解
摘要论文评估了 LLM 日志分析中的上下文污染风险,提出分片拼接等攻击与三层防御,指出必须结合架构隔离与人工介入。
提出 KidnapRAG,用投毒文档黑盒劫持 Agentic RAG 的推理链
KidnapRAG 是针对 Agentic RAG 的 black-box 语料投毒:攻击者不能访问模型、提示词、检索器或私有轨迹,只能发布可能被检索的文档,并利用公开界面上的推理与搜索查询。
提出 Ghostwriter 攻击,用伪权威证据条件注入操纵模型观点
Ghostwriter 是一种针对上下文窗口的观点引导攻击:把误导陈述改写成伪权威文本,再在相关查询中让目标模型把该观点写进回答。
提出 LPCI,把延迟条件载荷写入记忆与检索库以跨会话触发
作者把LPCI定义为针对智能体逻辑执行、记忆留存和工具集成的跨阶段漏洞类,而不是单次输入上的提示改写。