跳到正文
10月9日 · 周五

提示注入 · 论文

找到 4 篇
筛选1

攻击类型

模型自身风险

影响

被测模型厂商

同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 30 篇还没打标签,不在筛选结果里。

另有 30 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 其他arXiv 2610.03093

    LS-AR 双通道架构:文本目标丢弃可抵御提示注入但引入潜在向量攻击面

    提出 LS-AR,用潜向量经 FiLM 调节自回归解码以保持宏观目标

    发表
    测试
    Baseline (AR GPT-2)、LS-AR (Static)、LS-AR (Dynamic) 等 6 个
    摘要用潜通道把宏观目标从 token 流拆出,并在合成检索与规划上比较静态、动态两种调节。

    LS-AR 给因果解码器加一条不占窗口的连续目标通道,用来处理长程生成里宏观指令被挤出上下文或被注意力稀释的问题。

    深度解读完整解读
  2. 可解释性arXiv 2609.37737

    研究用因果激活修补定位模型服从提示注入指令的决策层

    用因果激活修补定位模型服从提示注入的决策层

    发表
    测试
    Qwen3-4B、Qwen3-14B、Qwen3-32B 等 7 个
    摘要合规的因果杠杆集中在网络后三分之一的低秩子空间,该层也是混淆下检测最好的位置。

    这篇工作用逐层激活修补定位提示注入合规发生在网络何处,并把该位置用于检测验证。。

    深度解读完整解读
已经到底了