跳到正文
10月9日 · 周五

全部论文

找到 5 篇
筛选3
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 443 篇还没打标签,不在筛选结果里。

另有 443 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2609.03247

    研究揭示大语言模型的自发身份认证失败:五款模型的分阶段开发者身份实验

    提出 MIPC 与 CFA,观察模型自拟测验后接受开发者身份

    发表
    摘要自拟测验可造成对话层虚假认证,但所测授权边界并未因此改变。

    这项工作把“模型自己出题、自己批改、再宣布身份已核验”定义成对话层认证失败,并与后端提权分开。

    深度解读完整解读
  2. 攻击arXiv 2609.02414

    Blueprint 框架用世界观模拟与 18 个影响因子提升多轮越狱成功率

    提出多轮越狱框架 BLUEPRINT,用世界观模拟与心理因素诱导有害输出

    发表
    攻击者
    黑盒
    摘要BLUEPRINT 解耦多轮越狱策略与情境模拟,揭示任务具象化是摆脱拒绝的核心机制,为多轮安全防御提供新视角。

    BLUEPRINT 是一个将因子化社会影响力策略空间与跨轮世界观模拟解耦的多轮大语言模型安全评测框架。

    深度解读完整解读
  3. 评测与基准arXiv 2609.36849

    研究评估 GradSafe 在多轮对话中的越狱检测脆弱性

    评测多轮对话中 GradSafe 越狱检测的可分性与脆弱性

    发表
    摘要CWS 显示不安全梯度在真实多轮流量中变弱,且随攻击族和模型而变。

    作者评估梯度越狱检测从单条提示词迁到多轮对话后还剩多少可分性,方法是用 Context Window Scanner 把 GradSafe 原封不动地套到用户轮窗口上。

    深度解读完整解读
已经到底了