跳到正文
10月10日 · 周六

全部论文

找到 3 篇
筛选7
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 232 篇还没打标签,不在筛选结果里。

另有 232 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2609.29429

    Jev 被用于零样本检测十类对齐失败,中位 AUROC 达 0.886

    提出 RLCDAlignBench,零样本检测多种对齐失败

    发表
    被测模型
    Jev (jev-1.13.0)
    摘要一次通用问题已能给多数对齐失败排序,大的误差来自状态和标签。

    RLCDAlignBench 测量用强化学习做校准决策的 Jev,能否当作对齐失败的零样本检测器。

    深度解读完整解读
  2. 攻击arXiv 2606.06244

    研究者提出 Ghostwriter 攻击:用伪造证据注入操纵 LLM 观点

    提出 Ghostwriter 攻击,用伪权威证据条件注入操纵模型观点

    发表
    被测模型
    GPT-4o、Claude-3.7-Sonnet、DeepSeek-V3 等 10 个
    摘要作者称攻击未被消除。

    Ghostwriter 是一种针对上下文窗口的观点引导攻击:把误导陈述改写成伪权威文本,再在相关查询中让目标模型把该观点写进回答。

    深度解读完整解读
已经到底了