跳到正文
10月8日 · 周四

开源模型安全 · 论文

找到 1 篇
筛选1

被测模型厂商

同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 90 篇还没打标签,不在筛选结果里。

另有 90 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 可解释性arXiv:2609.14759 ·

    研究:拒答只读取模型道德表征中的伤害切片

    用几何投影与因果交换干预,分析拒绝机制读取的道德表征

    模型与 API测试OLMo-3-7B-Instruct、OLMo-3-7B base、Qwen2.5-7B-Instruct 等 9 个模型层
    摘要作者指出拒绝机制多仅读取表层伤害感知,在控制瓶颈处运作,阐明了对齐易被移除的机理并提出跨模型双轴分类。

    本文是一项针对大语言模型拒绝机制与对齐浅层性的机械解释性研究。

    完整解读
已经到底了