跳到正文
10月10日 · 周六

全部论文

找到 3 篇
筛选7
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 201 篇还没打标签,不在筛选结果里。

另有 201 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2609.08236

    研究:内容不变的风格包装可翻转 LLM 安全评判器的判定

    提出内容不变样式包装,翻转安全评审器的判定

    发表
    攻击者
    黑盒
    被测模型
    GPT-4o-mini (gpt4o)、GPT-4o-mini (strongreject)、DeepSeek-Chat 等 7 个
    摘要论文揭示特定安全评审器易受保持内容不变的外层包装诱导改变判定,并指出安全评估应将判定稳定性作为重要考量指标。

    这是一项关于大语言模型自动化安全评审系统表面样式脆弱性的评估研究。

    深度解读完整解读
  2. 评测与基准arXiv 2606.02630

    MultiTurnPSB

    构建 MultiTurnPSB,评测四轮医疗越狱与分类器输入防御

    发表
    被测模型
    GPT-4.1-mini、Claude Sonnet 4.5
    摘要多轮攻击加剧医疗模型风险,分类器干预有效但受高误报率制约。

    MultiTurnPSB 针对患者端医疗大模型在持续交互中的安全风险,构建了包含三种攻击模态的四轮对抗评测基准。

    深度解读完整解读
已经到底了