跳到正文
10月9日 · 周五

开源模型安全 · 论文

找到 3 篇
筛选3
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 62 篇还没打标签,不在筛选结果里。

另有 62 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 可解释性arXiv 2608.11227

    研究:激活引导的副作用可在引导前预测

    用未转向表征的传播映射预测激活转向副作用

    发表
    测试
    Gemma-3-4B、Gemma-3-12B、Qwen2.5-7B
    摘要交叉效应矩阵显示副作用有结构且不对称,并可在转向前由传播映射预测方向。

    激活转向的副作用可以在施加之前预测,而不必先把每个行为都转向一遍。。

    深度解读完整解读
已经到底了