跳到正文
原文
论文追踪· arXiv:2610.10000·本站收录 · 原文发表 日期未标

超越奖励压制:有界奖励热启动 Bandit 的近最优离线攻击

Beyond Reward Suppression: Near-Optimal Offline Attacks on Warm-Start Bandits with Bounded Rewards

AI 导读

针对热启动 Bandit 的离线攻击研究提出"目标推广"机制:当目标臂位于奖励下界附近时,任何对 UCB 达到近最优成本的攻击都必须将不可忽略比例的成本分配给目标臂本身,而非仅压制非目标臂。作者据此设计了达到最优次线性成本的攻击,并刻画了其在目标推广与非目标压制间的成本分配,进一步将该攻击扩展至 Thompson Sampling、ε-greedy 及更广泛的 Bandit 算法。真实与合成数据实验验证了攻击的有效性。

阅读原文arxiv.org