攻击arXiv 2610.05139
研究揭示代码注释中的上下文注入攻击面
提出推理时上下文注入,用代码注释诱导补全生成含弱点的代码
- arXiv
- 2610.05139
- 发表
- 层
- 提示层
- 被测模型
- StarCoderBase、DeepSeek-Coder-base、Qwen2.5-base 等 10 个
- 攻击提示注入
提出推理时上下文注入,用代码注释诱导补全生成含弱点的代码
利用加密思维块的跨模型重放,诱导弱模型逐字转写专有推理链
摘要论文揭示了客户端加密思维块跨模型互换漏洞,提出了低成本提取方法并给出防御方案。
提出 SN-Guided Diffusion,利用安全神经元实现离线越狱
论文系统评估了扩散大语言模型(DLLM)在安全对齐中的双重角色——既作为白盒攻击目标,又作为黑盒越狱生成的对抗工具。
提出 SMT 框架,用模拟审核轨迹越狱函数调用 LLM