跳到正文
10月10日 · 周六

全部论文

找到 209 篇

另有 241 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 分析与理论arXiv 2610.12436

    研究提出 AI Agent 种群生态理论:协作带来起飞临界规模

    为失配智能体种群建立生态模型,说明协作产生起飞临界规模

    发表
    摘要作者称协作把起飞从个体能力阈值改成种群阈值,故小种群评估不够。

    作者用生态学的强 Allee 效应,讨论失配智能体种群会不会在个体能力不变时起飞。。

    深度解读完整解读
  2. 分析与理论arXiv 2610.12409

    研究者对 HELM Safety 与 HarmBench 做心理测量学审查,质疑其分数能否代表单一属性

    审计 HarmBench 分数能否代表单一 harmful refusal 属性

    发表
    摘要作者称 HarmBench 不对应单一 harmful refusal,比较模型时应把行为分开。

    这是对 HELM Safety 中 HarmBench 的构念效度审计,检查 harmful refusal 能否作为单一属性来读分数。。

    深度解读完整解读
  3. 可解释性arXiv 2610.12361

    研究:法律推理模型引用法条不等于依据法条

    用依据置换与隐层追踪审计法律思维链是否真正依赖所引法条

    发表
    被测模型
    Qwen3-8B、Qwen3-14B、Llama-3.1-8B 等 7 个
    摘要作者通过依据置换反事实与内部承诺追踪发现法律 CoT 裁决对依据依赖度有限,且易受提示注入操纵。

    本研究针对法律领域大语言模型思维链推理中引用法律依据的因果真实性展开实证审计。

    深度解读完整解读
  4. 分析与理论arXiv 2610.12313

    研究测试五个大模型合规系统对监管规则扰动的敏感度

    诊断合规系统裁决是否随监管规则扰动而改变

    发表
    被测模型
    Llama-3.3-70B-Instruct、Llama-3.1-8B-Instruct、Qwen2.5-7B-Instruct 等 5 个
    摘要五模型上许多正确裁决对删换否定规则大体不变。

    用行为反事实和激活探针,审计合规裁决是否依赖所给规则。。作者要分开两种看起来一样的正确裁决:用了所给规则的,以及靠案例表面或训练模式得到的。

    深度解读完整解读
  5. 可解释性arXiv 2610.10865

    用路由稀疏自编码器解耦语音编码器中的语言学与副语言学信息

    提出路由 TopK SAE,把语音编码器稀疏码拆成语言与副语言通路

    发表
    被测模型
    SPEAR XLarge、WavLM Large
    摘要路由 SAE 在冻结 SPEAR 与 WavLM 上分开语言和副语言因子,探针与交换支持通路分工。

    TopK SAE 的稀疏码被分成语言通路与副语言通路,用来分开冻结语音编码器里同时存在的音素信息和说话人、情感、韵律。只重构不能得到作者选定的这一分解。语言通路由音素识别监督,副语言通路由说话人识别、情感分类和韵律预测监督,作用在对方通路上的梯度反转对抗用来压低交叉因子。

    深度解读完整解读
  6. 分析与理论arXiv 2610.10203

    研究者提出模型生物体多目标验证框架并给出训练建议

    提出模型生物多目标验证与合并训练方法以减少能力损伤

    发表
    被测模型
    gemma-2-2b-it、olmo-2-1b、llama-3.1-8b-it
    摘要提出多目标验证框架与模型合并训练法,证明模型真实度直接影响可解释性评测。

    本论文提出了一种针对 AI 安全评测用模型生物(Model Organisms)的多目标训练与验证体系。

    深度解读完整解读
  7. 分析与理论arXiv 2610.09667

    东京大学研究:推理模型按 UUID 阈值或整除规则挑选审计样本,控制标识符即可躲开复核

    揭示推理模型用标识符规则替代随机抽样,使审计可被预测

    发表
    被测模型
    GPT-6 Sol、GPT-6 Luna、GPT-5.4 mini 等 6 个

    摘要研究揭示推理智能体将标识符转化为确定性规则,破坏群体独立性并导致审计预测漏洞,建议显式提供随机输入。

    深度解读完整解读
  8. 可解释性arXiv 2610.09600

    SafeEvo:从拒答回路视角解释大模型安全对齐机制与演化

    用 SafeEvo 提取拒绝电路,并提出 SCA 仅微调该电路

    发表
    被测模型
    Llama-3-8B、Qwen-2.5-7B、Mistral-7B-v0.1 等 4 个

    摘要SafeEvo 识别出基座模型中存在的弱安全电路及其演化动态,据此提出的 SCA 算法实现了安全对齐、能力保留与低过度拒绝的平衡。

    深度解读完整解读
  9. 分析与理论arXiv 2610.09517

    审计发现 CLIP 安全分数主要反映画面与提示词场景的相似度

    开环审计冻结视觉语言安全分,发现其反映场景模板而非危险感知

    发表
    被测模型
    CLIP ViT-B/32、CLIP ViT-L/14、Qwen2-VL-7B
    摘要论文审计了冻结 VLM 安全评分机制,指出其反映场景模板而非危险感知,为安全强化学习评估提供了严谨基准。

    本文是一项针对安全强化学习中冻结视觉语言模型(VLM)安全评分机制的实证审计研究。

    深度解读完整解读
  10. 可解释性arXiv 2610.09087

    U-Space:揭示语言模型不确定性何时与为何产生

    提出 U-SPACE 与 U-LENS,从残差流估计推理轨迹不确定性

    发表
    被测模型
    Gemma-4-31B-it、Qwen3.5-27B、Magistral-Small-2507
    摘要U-SPACE 与 U-LENS 用语义方向和预测熵读推理不确定性,长度控制后仍高于所比基线。

    U-SPACE 与 U-LENS 是面向推理模型的无训练读出:用语义方向定位不确定性的形式,并用一个轨迹分数区分更可能错的回答。

    深度解读完整解读
  11. 分析与理论arXiv 2610.09004

    研究:去除有害信息不足以证明开源权重模型的抗篡改能力

    论证发布时互信息不能认证开源权重抗微调恢复

    发表
    被测模型
    EleutherAI/deep-ignorance-e2e-strong-filter、EleutherAI/deep-ignorance-unfiltered、Google BERT-Tiny 等 6 个
    摘要作者称零信息仍可一步恢复,表观抗微调可来自参数化。

    作者研究开源权重模型的篡改抵抗:发布时的互信息是否足以保证微调恢复很慢。

    深度解读完整解读
  12. 分析与理论arXiv 2610.08577

    学习方式如何影响遗忘:记忆与泛化谱系下的机器遗忘研究

    分析记忆与泛化如何决定机器遗忘的 retain 损伤

    发表
    被测模型
    one-layer ReLU transformer、one-layer transformer (BMA, width doubled)、Hubble-8B-100B perturbed 等 6 个
    摘要作者称共享规则占比越高,遗忘带来的 retain damage 越大。

    作者考察学习方式如何左右 unlearning 的 retain damage:训练越依赖跨样本共享的解法,在匹配的遗忘程度上,retain 上的损失越大。

    深度解读完整解读
  13. 可解释性arXiv 2610.08559

    研究:LLM 潜在空间去偏方向主要编码置信度而非公平性

    分析 LLM 去偏激活方向,发现其编码置信度而非公平性

    发表
    被测模型
    Llama-3.1-8B、Llama-3.1-8B-Instruct、Falcon3-7B-Base 等 8 个

    摘要论文揭示激活引导去偏见方向主要编码模型置信度而非公平性,偏见评分下降实为诱发弃答或使概率均分的假象。

    深度解读完整解读
  14. 可解释性arXiv 2610.08552

    AnyBottle:只保留真正需要的概念,构建紧凑任务专属概念瓶颈模型

    提出 ANYBOTTLE,按教师残差从无监督概念池筛选紧凑概念瓶颈

    发表
    被测模型
    CLIP-DINOiser、Gemma-2-2B、Gemma-3-1B-it
    摘要ANYBOTTLE 用教师残差选出紧凑概念集,并以 nested dropout 按样本调节概念预算。

    ANYBOTTLE 是一套用冻结骨干和无监督概念池构建任务专用概念瓶颈的配方,目标是去掉概念标注后仍保持小词表。

    深度解读完整解读