研究者提出答案侧后门:让模型自生成触发词绕过安全拒答
提出回答端后门,让模型自生成触发词以在干净有害请求下绕过拒答
完整解读
提出回答端后门,让模型自生成触发词以在干净有害请求下绕过拒答
提出推理时 Unicode 归一化的检测器,识别遭字符级扰动的 AI 生成文本
DeBERTa-ConPara 是一个面向部署的 AI 文本检测器:DeBERTa-v3-large 在多数据集原始文本上训练,推理前做确定性 Unicode 归一化,用一个固定阈值面对没有目标域标签的场景。
提出 AKRASIA 推断期后门,用代码级触发器与伪装推理操纵代码模型
提出主题锚点投毒,放大众包微调后的专有指令提取