跳到正文
10月9日 · 周五

全部论文

找到 7 篇

另有 664 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 分析与理论arXiv 2609.37914

    研究用训练数据归因量化微调数据对涌现性失准的影响

    用训练数据归因估计错误建议样本对涌现失准的贡献

    发表
    测试
    OLMo 3 7B-SFT、Qwen 2.5 1.5B、Qwen 2.5 3B 等 12 个
    摘要错误建议对涌现失调的贡献不均匀,归因过滤可增减失调,且最有效的是模型自己的分数。

    EleutherAI 用训练数据归因考察错误建议微调中,哪些样本推动涌现失调。。窄域有害数据上的微调会使模型在无关问题上也给出有害回答。

    深度解读完整解读
  2. 分析与理论arXiv 2605.17173

    研究提出 IRT 框架拆解大模型跨语言安全护栏退化

    提出多组 IRT 框架拆解跨语言安全护栏退化原因

    发表
    测试
    gpt-4.1-mini、gpt-4o-mini、gpt-4.1-nano 等 15 个
    摘要多组 IRT 把多语安全失败拆成能力、语言难度和题目特异差距,并在闭源配置上估计这些因子。

    Zhang、Patel、Truong 与 Koyejo 用多组项目反应理论,解释安全护栏为何随语言变化,而不是只报告一个 JSR。

    深度解读完整解读
  3. 分析与理论arXiv 2609.20779

    研究称 GPT 系列安全训练把性别歧视转化而非消除

    提出 harm laundering,证明安全训练改写而非消除性别歧视

    发表
    测试
    gpt2、gpt2-medium、gpt2-large 等 15 个
    摘要GPT 谱系上毒性下降与表征伤害上升并存。

    Wyer、Black 与 Al Moubayed 用 OpenAI GPT 谱系检验:毒性分数下降是否等于歧视减少。 他们的答案是否定的,并把“显性伤害被改写成评测指标看不见的形式”称为 harm laundering。

    深度解读完整解读
  4. 分析与理论arXiv 2609.32116

    研究提出 Best-of-N 越狱的物理势垒模型,挑战攻击成功率幂律规律

    用物理陷阱模型描述 Best-of-N 越狱的攻击面规律

    发表
    测试
    Qwen2.5-7B (base)、Llama-3.1-8B-Instruct、Qwen2.5-3B-Instruct 等 5 个
    摘要四参数势垒模型拟合 BoN 的两预算面,并把指数交叉归因于数据集有限。

    Biroli 用一个玻璃陷阱式的微观模型,把 Best-of-N 越狱写成熵瓶颈加能量鞍点,并用四个数描述 (N, M) 攻击面及温度依赖。。

    深度解读完整解读
  5. 分析与理论arXiv 2609.32717

    研究揭示语义保持变换下的 LLM 对齐与效用不对称

    用语义保留变换探针比较效用与对齐在分布偏移下的稳定性

    发表
    测试
    Llama3-8B-Instruct、Gemma-7B-it、Qwen2.5-7B-Instruct 等 10 个

    摘要论文报告了语义保留变换下的对齐-效用不对称性,指出安全对齐泛化比效用更为脆弱,呼吁改进评估流程。

    深度解读完整解读
已经到底了