攻击arXiv 2610.05139
研究揭示代码注释中的上下文注入攻击面
提出推理时上下文注入,用代码注释诱导补全生成含弱点的代码
- arXiv
- 2610.05139
- 发表
- 层
- 提示层
- 被测模型
- StarCoderBase、DeepSeek-Coder-base、Qwen2.5-base 等 10 个
- 攻击提示注入
提出推理时上下文注入,用代码注释诱导补全生成含弱点的代码
提出 MADBench,评测多智能体辩论是吸收还是放大对抗影响
MADBench 是一个评测多智能体辩论安全性的基准,用来看攻击是被辩论吸收还是被放大。
提出 Emergence World,对长时程多智能体系统开展对抗压力测试
摘要作者通过长期平行世界实验指出模型对齐不具备可组合性,单模型群体会产生社会奉承、协同退缩及语言不透明等失效。
提出多智能体流水线的边界攻击,使对抗内容作为可信输入跨层传播
作者把多智能体 LLM 流水线的对抗问题定义为缺少边界校验,并用生产轨迹和受控实验检查脆弱性来自架构还是骨干模型。中间输出未经验证就传给下游。作者认为,一旦某级接受对抗内容,后续智能体会把它当作可信输入。
用对抗缺陷报告诱导自动程序修复系统生成不安全补丁