P-VMI:对抗图像经 KV cache 持续影响多轮对话
提出持久视觉记忆注入,使对抗图像经缓存在触发时操控输出
- arXiv
- 2610.09027
- 发表
- 场景
- 模型与 API
- 测试
- Qwen3-8B、Qwen3-VL-8B-Instruct、Gemma-4-12B 等 4 个
摘要论文提出 P-VMI,证实对抗输入被掩蔽后仍可经 KV 缓存持久控制模型,强调了保留状态的安全风险。
另有 217 篇论文还没打上分类标签,暂不在筛选结果里。
提出持久视觉记忆注入,使对抗图像经缓存在触发时操控输出
摘要论文提出 P-VMI,证实对抗输入被掩蔽后仍可经 KV 缓存持久控制模型,强调了保留状态的安全风险。
构建 BazaarBench 评测 C2C 市场中 Agent 的违规失信
BazaarBench 针对大语言模型智能体在去中心化 C2C 交易中的代理安全问题,提出了一个结合底层实体状态与大模型裁判的仿真基准平台。
提出拓扑条件后门,使模型在推断多智能体部署时向代码插入隐蔽漏洞
摘要论文证实了拓扑条件后门的可训练性与泛化性,展示了常规评测盲区,并提出差异化拓扑审计作为检测防御方向。
提出 BDA,把多 LLM 议会的辩证动作当可靠性证据做加权聚合
BDA 是一种不另调 LLM 的多 LLM 议会聚合方法,同时处理置信度校准和持续不可靠席位。
提出技能名称抢注攻击,利用智能体虚构技能名实施供应链劫持
本研究系统揭示了大模型智能体技能推荐场景下的虚构技能名称安全风险,将其形式化为一种新型供应链抢注攻击。
提出 BioSecBench-Surveillance,评测 Agent 的病原监测分析
提出多智能体输出与委派谱系的两层存证方案
部署方侧的两层证明,用来在多智能体跨部署方委托之后回答两个事后问题:谁放出了这些字节,这条跨部署方边有没有父方授权。
用演化算法构造思维病毒并测量其在多智能体中的传播
提出基准投毒攻击,使自修改编码智能体跨代写出漏洞代码
摘要论文报告了恶意基准能污染自修改代码智能体的进化过程并持续输出漏洞,警示系统设计需纳入安全约束。
提出 AuraForge,从漏洞修复合成安全测试并监督训练编码智能体
AuraForge 把真实仓库的历史漏洞修复变成可执行训练任务,用来监督编程智能体同时满足功能请求和隐含的安全要求。
测量间接提示注入对类型化概率决策的动作劫持
作者在 jev-1.13.0 上研究 decision hijacking:不可信内容能否在用户任务和可选动作都不变时,把类型化决策推向攻击者目标。
提出 ForesightSafety-TIDE,评测多智能体在单点欺骗下的集体事实恢复
提出 Box2-Bench,评测模型能否选择性依赖外部工作流
Box2-Bench 固定任务与模型,只改变工作流可靠性,用来衡量模型能否选择性依赖可能出错的外部指导。
发布 MADBench,评测多智能体辩论会吸收还是放大对抗影响
MADBench 是一个评测多智能体辩论安全性的基准,用来看攻击是被辩论吸收还是被放大。
提出 MiniRep,按当前质量、风险与历史声誉聚合多智能体辩论
MiniRep 是面向恶意智能体的 MAD 声誉聚合,只作用在 Decide 阶段。
提出 VirusCascade,劫持推荐智能体协同反思以定向推广物品
提出 FAME,用反事实概念漂移评测智能体虚假记忆
FAME 是一个免训练的评测框架,用来判断自主智能体的记忆在虚假相关、环境偏移或知识冲突下是否已变成虚假记忆。。
测量多智能体交接中错误上游消息对正确答案的替换
这项受控研究考察多智能体 draft-review 交接里,一条上游消息会怎样改变下游原本能做对的判断。下游同时看到任务证据和上游消息。作者固定证据,比较消息隐藏、原样展示和结论反转,用消息价值τ和交互Γ分开“消息有用”和“消息有害”,并把能独立答对却改成上游具体错答称为substitution。
用 WolfBench 测量金融智能体社会中有害规模下的集体崩溃
WolfSociety 把多智能体安全写成受控金融社会中的集体失败问题:智能体经社交网络交流,并在共享市场里交易,形成从交流到行动再到后续决策的闭环。