跳到正文
原文
arXiv:危险能力与安全评测· arXiv:2610.12233· Jingnan Zheng, Dongcheng Zhang, Yi Zhang, Ming Zhang, Qiaosheng Zhang, Youbang Sun, An Zhang, Xiangnan He, Tat-Seng Chua, Xia Hu, Bowen Zhou, Chaochao Lu, Xiang Wang·本站收录 · 原文发表

ReSI:面向抗攻击与抗未知风险的递归安全改进框架

ReSI: Recursive Safety Improvement toward Resistant and Resilient AI

AI 导读

研究者提出 ReSI 递归安全改进框架,通过自动化研究在每一轮用多种红队方法找出当前目标模型的漏洞、开发训练配方,并在通过能力保持 Pareto 门槛的更新中选出安全增益最大的一个作为下一轮目标模型。在四个稠密与 MoE 模型上,ReSI 在分布内和分布外安全基准上达到或超过所评测的前沿模型,并在几乎所有安全评测上优于对齐基线,同时大体保持通用能力。论文称,ReSI 将四个模型的 X-Teaming 平均攻击成功率从 86.01% 降至 31.45%,低于 GPT-5.6-Luna 的 56.69%,显示对训练中未见攻击的更强韧性。

阅读原文arxiv.org