跳到正文
10月10日 · 周六

全部论文

找到 2 篇
筛选5
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 310 篇还没打标签,不在筛选结果里。

另有 310 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2610.02557

    新 AI 辩论协议实现实例级最优:最坏情况正确且诚实为占优策略

    提出 FBS Debate 协议,使诚实为占优策略且最坏情况正确

    发表
    摘要FBS 辩论用 fbs 约束敏感分解,给出最坏情况占优策略,并匹配黑盒查询下界。

    FBS Debate 是一套可扩展监督的辩论规则:两名计算方争论一个可递归分解的是非问题,人类只在最后选出的子问题上做黑盒判断。要处理的缺口是,prover-estimator debate 虽能覆盖稳定分解,但只在输入分布的平均意义下成立,而且 Bob 的获胜策略一般要跟着 Alice 的作弊策略变。作者要在同一问题类上,让每个错误实例都能被抓住,并让诚实且正确成为双方的占优策略。

    深度解读完整解读
  2. 防御arXiv 2609.04665

    HackProbe:面向自演化语言模型奖励作弊的黑盒检测与免疫方法

    提出 HackProbe,黑盒检测并免疫自演化中的奖励作弊

    发表
    摘要黑盒探针检测自演化奖励黑客,并以带宽受限重选回收真实能力。

    HackProbe 是挂在自演化循环上的黑盒监控器,用来发现奖励黑客并改选候选。

    深度解读完整解读
已经到底了