跳到正文
原文
FAR.AI·原文 · 入选 精选关注度73

FAR.AI 研究:三种防御都挡不住针对 KataGo 的新对抗攻击

Beyond the Board: Exploring AI Robustness Through Go | FAR.AI

AI 导读

FAR.AI 测试了三种提升 KataGo 对抗鲁棒性的防御方法,发现它们都能被新攻击绕过。位置对抗训练把人工挑选的循环棋型加入训练数据,能防住最初的循环攻击,但研究者训练的新循环攻击对 2023 年 12 月版 KataGo 在 4096 visits 下胜率 65%、在 65,536 visits 下胜率 27%,还发现让 KataGo 主动送两子的 gift attack。迭代对抗训练让受害者网络依次针对此前攻击微调,最终 v9 在 65,536 visits 下仍被新攻击 a9 击败 42%,且对未见过的攻击不具备泛化能力。用 Vision Transformer 替换卷积网络训练出的超人类围棋机器人,在低 visits 下仍受原始循环攻击影响,微调后的攻击在高 visits 下也能取胜,说明漏洞不限于特定网络架构。

推荐理由

FAR.AI 用围棋对抗攻防检验三种防御思路,说明超人类系统也可能被新攻击绕过,为鲁棒性研究提供可迁移的对照。

阅读原文far.ai