跳到正文
原文
arXiv:越狱、提示注入、投毒与防御· arXiv:2610.09892· Subhabrata Majumdar, Rajlakshmi Chavan·本站收录 · 原文发表 日期未标

AI 安全 Stackelberg 模型中的防御充分性研究

Defensive Sufficiency in a Stackelberg Model of AI Security

AI 导读

研究将 AI 系统防御建模为防御者主导的 Stackelberg 博弈,防御者投入主动发现与被动修复,攻击者选择搜索强度。理论证明:若每个未解决攻击都有持续被发现的机会、修复有效且后续更新保留既有防护,则有限攻击面可以概率 1 被防御;并给出完成时间界,扩展到攻击面增长、修复跨相关攻击泛化及多种发现机制的情形。数值实验刻画了防御者不投入、只投入一种或同时投入两种能力的均衡区间,并显示更快修复可缩短被攻陷时长但不降低被攻陷概率。

阅读原文arxiv.org