跳到正文
10月8日 · 周四

可解释性 · 论文

找到 2 篇
筛选2

模型自身风险

防御类型

同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 174 篇还没打标签,不在筛选结果里。

另有 174 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 分析与理论arXiv:2609.37312 ·

    研究:隐蔽推理必然留下信息痕迹,但思维链未必可读

    分析隐蔽推理在思维链中的信息足迹与不可读性

    模型与 API测试Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct、Qwen 3.5 397B-A17B 等 12 个模型层

    摘要论文从理论与实证探明了思维链监控的边界:复杂隐蔽计算必然泄露信息足迹且需承担长度税,但该足迹可被在线加密而不可读。

    完整解读
已经到底了