跳到正文
10月8日 · 周四

可解释性 · 论文

找到 2 篇
筛选1

模型自身风险

防御类型

影响

被测模型厂商

同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 176 篇还没打标签,不在筛选结果里。

另有 176 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 分析与理论arXiv:2610.10203 ·

    研究者提出模型生物体多目标验证框架并给出训练建议

    提出模型生物多目标验证与合并训练方法以减少能力损伤

    模型与 API测试gemma-2-2b-it、olmo-2-1b、llama-3.1-8b-it 等 8 个训练与数据层
    摘要提出多目标验证框架与模型合并训练法,证明模型真实度直接影响可解释性评测。

    本论文提出了一种针对 AI 安全评测用模型生物(Model Organisms)的多目标训练与验证体系。

    完整解读
已经到底了