跳到正文
10月9日 · 周五

全部论文

找到 5 篇
筛选2
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 656 篇还没打标签,不在筛选结果里。

另有 656 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 分析与理论arXiv 2609.32116

    研究提出 Best-of-N 越狱的物理势垒模型,挑战攻击成功率幂律规律

    用物理陷阱模型描述 Best-of-N 越狱的攻击面规律

    发表
    测试
    Qwen2.5-7B (base)、Llama-3.1-8B-Instruct、Qwen2.5-3B-Instruct 等 5 个
    摘要四参数势垒模型拟合 BoN 的两预算面,并把指数交叉归因于数据集有限。

    Biroli 用一个玻璃陷阱式的微观模型,把 Best-of-N 越狱写成熵瓶颈加能量鞍点,并用四个数描述 (N, M) 攻击面及温度依赖。。

    深度解读完整解读
  2. 分析与理论arXiv 2609.35350

    J4U:用越狱提示为大型推理模型做黑盒不确定性量化

    提出 J4U,用越狱式提示扰动估计黑盒推理模型的不确定性

    发表
    测试
    Qwen3-4B、gpt-oss-20b、DeepSeek-R1-32B 等 4 个
    摘要J4U 用越狱式扰动放宽对齐后的黑盒 LRM,以多数票频率改善校准。

    J4U 是面向黑盒 LRM 问答的不确定性估计:用越狱式提示扰动近似“更大 KL 正则”的放松,再以多次采样的多数票频率当置信。

    深度解读完整解读
已经到底了