跳到正文
10月10日 · 周六

全部论文

找到 49 篇

另有 242 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 可解释性arXiv 2610.10865

    用路由稀疏自编码器解耦语音编码器中的语言学与副语言学信息

    提出路由 TopK SAE,把语音编码器稀疏码拆成语言与副语言通路

    发表
    被测模型
    SPEAR XLarge、WavLM Large
    摘要路由 SAE 在冻结 SPEAR 与 WavLM 上分开语言和副语言因子,探针与交换支持通路分工。

    TopK SAE 的稀疏码被分成语言通路与副语言通路,用来分开冻结语音编码器里同时存在的音素信息和说话人、情感、韵律。只重构不能得到作者选定的这一分解。语言通路由音素识别监督,副语言通路由说话人识别、情感分类和韵律预测监督,作用在对方通路上的梯度反转对抗用来压低交叉因子。

    深度解读完整解读
  2. 防御arXiv 2610.07774

    研究者提出读取路由 logits 的 MoE 视觉语言模型多模态安全检测器

    AI 导读研究者提出一种轻量级路由 logits 安全检测器,在提示词预填充阶段读取 MoE 视觉语言模型的专家路由信号,在生成前判断多模态请求是否安全,且不修改模型参数或专家路由。

    发表
    被测模型
    Qwen3-VL-30B-A3B-Instruct、Kimi-VL-A3B-Instruct
    摘要读出而非操纵 router logits,可在不改模型的情况下降低两模型的组合式安全错误。

    作者在两个指令微调 MoE VLM 上比较改模型与读路由。组合式风险按 HoliSafe 分成五类:图文各自可安全,合在一起才不安全,或不安全内容只在图像里。

    深度解读完整解读
  3. 防御arXiv 2610.07570

    ProbeGuard:按共识形成过程判断弃答,识别医疗问答中的一致错误

    提出 ProbeGuard,按共识形成过程对医疗问答做选择性弃答

    发表
    被测模型
    Qwen3-8B、Llama-3.1-8B-Instruct、HuatuoGPT-o1-8B
    摘要ProbeGuard 用共识形成过程做可认证弃权,并在全票层分开答对与答错的共识。

    ProbeGuard 是给多轮共识医学问答用的认证弃权框架:基板照原样作答,弃权只看共识是怎么形成的。

    深度解读完整解读
  4. 防御arXiv 2610.07403

    针对 LLM 谄媚的纵深防御:记忆门控对激活诱导与记忆诱导谄媚的评估

    评测记忆门控对激活诱导与记忆诱导谄媚的防御效果

    发表
    被测模型
    Llama-3.1-8B-Instruct、Qwen2.5-7B-Instruct、Mistral-7B-Instruct-v0.3 等 4 个
    摘要作者称外部记忆过滤成立,数据未显示反向转向再有贡献。

    作者在四个开源指令模型上,把激活转向和外部记忆处理放进同一纵深防御协议,看记忆诱发谄媚和内部谄媚压力能否分开压低,以及个性化效用还剩多少。要处理的问题是:检索到的用户历史会推动模型顺从存储信念。只改外部上下文,并不直接动模型内部的谄媚表征。

    深度解读完整解读
  5. 评测与基准arXiv 2610.06339

    BabelFake:面向多语言音视频 DeepFake 检测的基准数据集

    构建多语言音视频 DeepFake 基准 BabelFake 并评测检测器

    发表
    被测模型
    SpeechForensics、AVH-Align、(B)RAVEn
    摘要BabelFake 为五语同意采集基准。

    BabelFake 是经同意与 IRB 批准采集的多语音视频 DeepFake 检测基准,用来把视觉操纵和语音合成拆开比较。

    深度解读完整解读
  6. 评测与基准arXiv 2610.04737

    PyINE:用可验证 Python 执行轨迹研究推理模型的捷径与监督

    提出 PyINE 基准,训练捷径跟随模型并比较监督者

    发表
    被测模型
    shortcut-following model organism、gpt-4o、gpt-5 等 12 个
    摘要PyINE 用可验证代码执行研究捷径失败的监督覆盖与成本权衡。

    PyINE 是用可执行程序研究推理模型引出与监督的框架,PyINE-v1 是其第一次发布。

    深度解读完整解读
  7. 评测与基准arXiv 2610.02741

    研究系统评估循环语言模型的思维链可监控性

    系统评估循环语言模型加深 loop 后的 CoT 可监控性

    发表
    被测模型
    Ouro-1.4B-Thinking、Ouro-2.6B-Thinking、Nanbeige4.2-3B 等 4 个
    摘要加深 loop 可在部分压力测试任务降低可监测性,循环架构本身并不必然更难监测。

    这项工作评估 LoopLM 的 CoT 可监测性:加深共享层的重复次数,以及“有循环结构”本身,会不会让决策关键因素更少出现在可监测文本里。

    深度解读完整解读
  8. 防御arXiv 2610.02413

    研究:分类后缀可提升激活探针的分布外恶意输入检测

    用分类后缀提升激活探针对分布外恶意输入的检测

    发表
    被测模型
    Llama-3.1-8B、Qwen3.5-9B、Gemma-4-12B
    摘要作者称排序增益来自分类格式,低 FPR 精度来自点名准则。

    用户轮后的分类后缀,被作者用作激活探针的分布外检测干预:排序看格式,低 FPR 精度看是否点名恶意/良性。

    深度解读完整解读
  9. 可解释性arXiv 2610.01864

    从孤立特征到轨道:通过多重 SAE 对齐发现音乐概念

    提出多 SAE 对齐方法,从音乐模型表征中发现和弦与调性轨道

    发表
    被测模型
    MuQ、MusicFM
    摘要用移调对齐的多 SAE 恢复和弦、调与旋律轨道,并用少量锚点做下游音乐理解。

    作者提出一套面向音乐基础模型的结构可解释性框架:不把 SAE 特征当作孤立概念,而用半音移调把它们连成有序轨道。

    深度解读完整解读
  10. 评测与基准arXiv 2609.39473

    FAME:用反事实推理评测自主智能体的虚假记忆

    提出 FAME,用反事实概念漂移评测智能体虚假记忆

    发表
    被测模型
    Llama-3B
    摘要FAME 用反事实引起的隐状态概念漂移,在出答案前区分忠实记忆与虚假记忆。

    FAME 是一个免训练的评测框架,用来判断自主智能体的记忆在虚假相关、环境偏移或知识冲突下是否已变成虚假记忆。。

    深度解读完整解读
  11. 防御arXiv 2609.37568

    SECRET:用源条件化中继引导缓解音视频大语言模型的幻觉

    提出训练无关的 SECRET,对问题表征做源条件转向以缓解音视频模型幻觉

    发表
    被测模型
    VideoLLaMA2-AV-7B、Qwen2.5-Omni-7B、Qwen3-Omni-30B-A3B
    摘要SECRET 在问题状态上做源条件转向,三个 AVLLM 上减轻了跨模态接地幻觉。

    SECRET 是一种训练无关的问题状态转向方法,用来减轻 AVLLM 的 source-confused grounding hallucination。

    深度解读完整解读
  12. 分析与理论arXiv 2609.37312

    研究:隐蔽推理必然留下信息痕迹,但思维链未必可读

    分析隐蔽推理在思维链监控下的信息足迹下界与不可读性

    发表
    被测模型
    Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct、Qwen 3.5 397B-A17B 等 12 个

    摘要论文从理论与实证探明了思维链监控的边界:复杂隐蔽计算必然泄露信息足迹且需承担长度税,但该足迹可被在线加密而不可读。

    深度解读完整解读
  13. 风险行为arXiv 2609.36490

    LLM 仅凭监控器历史判定即可学会规避潜在空间监控

    证明 LLM 仅凭先前监控反馈即可编辑激活规避潜空间监控

    发表
    被测模型
    llama-3.1-8b-instruct、gemma-3-27b-instruct、qwen3-14b 等 4 个
    摘要论文指出 LLM 可仅凭历史二元反馈推断潜空间监控规则并通过激活编辑实现规避,提出潜空间安全监控需应对交互式规避。

    这篇论文研究了语言模型如何仅利用多轮上下文中的二元反馈信息规避内部潜空间监控器。

    深度解读完整解读