跳到正文
原文
arXiv:越狱与提示注入· arXiv:2609.36849· Omar Sheta·· 3 天前

研究评估 GradSafe 在多轮对话中的越狱检测脆弱性

Does the Unsafe Gradient Survive a Conversation? On the Fragility of Gradient-Based Jailbreak Detection in Multi-Turn Dialogue

AI 导读

研究者在多轮对话场景下评估了基于梯度的越狱检测器 GradSafe,并扩展出 Context Window Scanner,用固定大小用户轮次窗口的最大分数作为整段对话得分。

阅读原文arxiv.org