跳到正文

论文与会议论文

按研究方向查找论文,覆盖日常收录与会议论文。

本页 2 条 · 共 2 条

本页材料

完整标题与摘要 · 2 条
  • 会议论文arXivACL 2026

    基于搜索增强 LLM 的中文新词毒性共识检测框架 SeTox

    针对"country girl"等表面无害、却在公众共识中演变为毒性用法的新词,研究者提出分类体系与风险词表,并构建搜索增强框架 SeTox,让静态大语言模型接入实时网络语境来检测新词毒性。实验显示,SeTox 即使使用 3B 规模模型也优于近期大规模模型,表明其可扩展地引入现实世界知识完成毒性新词检测。该工作发表于 ACL 2026。

  • 会议论文SPY LabICML 2025

    SPY Lab 提出越狱税:越狱输出到底有多大用处

    SPY Lab 提出越狱税(Jailbreak Tax)指标,衡量越狱成功后模型效用相对基线的下降幅度,并给出配套基准。研究先评测基座模型准确率,再自行对齐使其拒答数学和生物题,最后对对齐模型施加越狱并测量准确率,发现越狱方法造成的效用损失最高达 92%。在 LLaMA 模型上,PAIR、TAP 和微调攻击的成功率都在 92% 左右,但越狱税差异很大,说明越狱成功率与效用损失之间没有明显相关性。为贴近真实场景,作者把 GSM8K 题目改写为含炸弹、核武器等危险词但答案不变的 EvilMath,并用改写为独角兽等良性分布外概念的 UnicornMath 计算基线,发现前沿模型自带的安全机制下越狱税依然存在。