跳到正文
10月10日 · 周六

全部论文

找到 25 篇

另有 310 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2610.06339

    BabelFake:面向多语言音视频 DeepFake 检测的基准数据集

    构建多语言音视频 DeepFake 基准 BabelFake 并评测检测器

    发表
    被测模型
    SpeechForensics、AVH-Align、(B)RAVEn
    摘要BabelFake 为五语同意采集基准。

    BabelFake 是经同意与 IRB 批准采集的多语音视频 DeepFake 检测基准,用来把视觉操纵和语音合成拆开比较。

    深度解读完整解读
  2. 评测与基准arXiv 2610.04737

    PyINE:用可验证 Python 执行轨迹研究推理模型的捷径与监督

    提出 PyINE 基准,训练捷径跟随模型并比较监督者

    发表
    被测模型
    shortcut-following model organism、gpt-4o、gpt-5 等 12 个
    摘要PyINE 用可验证代码执行研究捷径失败的监督覆盖与成本权衡。

    PyINE 是用可执行程序研究推理模型引出与监督的框架,PyINE-v1 是其第一次发布。

    深度解读完整解读
  3. 可解释性arXiv 2610.01864

    从孤立特征到轨道:通过多重 SAE 对齐发现音乐概念

    提出多 SAE 对齐方法,从音乐模型表征中发现和弦与调性轨道

    发表
    被测模型
    MuQ、MusicFM
    摘要用移调对齐的多 SAE 恢复和弦、调与旋律轨道,并用少量锚点做下游音乐理解。

    作者提出一套面向音乐基础模型的结构可解释性框架:不把 SAE 特征当作孤立概念,而用半音移调把它们连成有序轨道。

    深度解读完整解读
  4. 评测与基准arXiv 2609.39473

    FAME:用反事实推理评测自主智能体的虚假记忆

    提出 FAME,用反事实概念漂移评测智能体虚假记忆

    发表
    被测模型
    Llama-3B
    摘要FAME 用反事实引起的隐状态概念漂移,在出答案前区分忠实记忆与虚假记忆。

    FAME 是一个免训练的评测框架,用来判断自主智能体的记忆在虚假相关、环境偏移或知识冲突下是否已变成虚假记忆。。

    深度解读完整解读
  5. 防御arXiv 2609.37568

    SECRET:用源条件化中继引导缓解音视频大语言模型的幻觉

    提出训练无关的 SECRET,对问题表征做源条件转向以缓解音视频模型幻觉

    发表
    被测模型
    VideoLLaMA2-AV-7B、Qwen2.5-Omni-7B、Qwen3-Omni-30B-A3B
    摘要SECRET 在问题状态上做源条件转向,三个 AVLLM 上减轻了跨模态接地幻觉。

    SECRET 是一种训练无关的问题状态转向方法,用来减轻 AVLLM 的 source-confused grounding hallucination。

    深度解读完整解读
  6. 分析与理论arXiv 2609.36477

    研究发现护栏模型在基座模型不确定处过度自信

    诊断护栏相对基座在对抗提示上的置信失校

    发表
    被测模型
    Llama-Guard 7B、Llama-Guard-2 8B、Llama-Guard-3 8B 等 10 个
    摘要对抗包装使 guard 高置信漏检,而对应 base 在同一输入上常更不确定。

    诊断性分析:五个提示词分类 guard 的置信度,在清洁输入上可以较校准,在越狱包装后则变成高置信度的错误判定。

    深度解读完整解读
  7. 可解释性arXiv 2609.34052

    通过稀疏自编码器实现神经音频编解码器的可解释框架:面向年龄、性别与口音的探索

    用 SAE 分析神经音频编解码器如何编码年龄、性别与口音

    发表
    被测模型
    EnCodec (24 kHz, 6 kbps)、DAC、SpeechTokenizer 等 5 个
    摘要SAE steering 被用作探测 NAC 说话人属性编码的代理。

    作者用 SAE steering 探测 NAC 表示如何编码说话人属性,目标是可解释性,不是属性转换。

    深度解读完整解读
  8. 分析与理论arXiv 2609.33989

    RewardExplainer:用反事实偏好反馈学习奖励模型解释

    提出 RewardExplainer,用反事实偏好反馈学习奖励模型解释

    发表
    被测模型
    FsfairX-LLaMA3-RM-v0.1、Skywork-Reward-V2-Qwen3-1.7B、RM-Mistral-7B 等 6 个
    摘要RewardExplainer 用双向反事实反馈训练 RM 解释器,并用以发现偏差、定向微调原 RM。

    RewardExplainer针对只输出标量的判别式奖励模型,训练一个可复用的自然语言机制解释器,并把解释接到偏差发现与 RM 微调上。

    深度解读完整解读
  9. 防御arXiv 2609.32720

    BiasReducer:面向奖励模型的自适应偏见缓解方法

    B IAS R EDUCER 只改奖励头,按数据集选择属性编辑。

    发表
    被测模型
    Skywork-Reward-V2-Qwen3-1.7B、GRM-Llama3.2-3B-rewardmodel-ft、RM-Mistral-7B 等 7 个
    摘要BIASREDUCER 按数据集选择奖励头编辑,五模型三基准平均提升并迁移到下游训练。

    BIASREDUCER 是一种只改线性奖励头的奖励模型编辑框架,用来降低模型对预定义表面属性的依赖,并按新数据集决定改哪些属性。

    深度解读完整解读
  10. 防御arXiv 2609.27399

    GUARD:在 CosyVoice2 上做说话人身份遗忘以阻止重识别

    提出 GUARD,在零样本 TTS 上用激活转向遗忘说话人身份以阻止再识别

    发表
    被测模型
    CosyVoice2-0.5B、F5-TTS、FireRedTTS
    摘要GUARD 用门控激活转向把退出说话人推向冒充相似度,以抑制再识别并保住音质。

    GUARD 用门控激活转向做说话人身份遗忘,使零样本 TTS 对退出说话人难以再识别。

    深度解读完整解读
  11. 分析与理论arXiv 2609.20779

    研究称 GPT 系列安全训练把性别歧视转化而非消除

    提出 harm laundering,证明安全训练改写而非消除性别歧视

    发表
    被测模型
    gpt2、gpt2-medium、gpt2-large 等 15 个
    摘要GPT 谱系上毒性下降与表征伤害上升并存。

    Wyer、Black 与 Al Moubayed 用 OpenAI GPT 谱系检验:毒性分数下降是否等于歧视减少。 他们的答案是否定的,并把“显性伤害被改写成评测指标看不见的形式”称为 harm laundering。

    深度解读完整解读
  12. 可解释性arXiv 2609.09575

    MonoTM:用可解释单义特征做主题建模,超越关键词表示

    提出 MonoTM,用 SAE 单义特征估计文档主题混合并生成主题描述

    发表
    摘要MonoTM 分开估计混合与解释主题,三套基准上二者偏好的 SAE 配置不同。

    MonoTM 是建在文档嵌入 SAE 上的可解释主题模型:混合估计用全部 SAE 特征,主题描述只用另一套配置里通过验证的语义特征。

    深度解读完整解读
  13. AV-SafetyBench:面向文本到音视频生成的安全基准

    提出 AV-SafetyBench 评测文生音视频模型的不安全生成

    发表
    被测模型
    LTX-2.3、Ovi-1.1、JavisDiT++ 等 7 个
    摘要AV-SafetyBench 用三视角评五个 T2AV 模型,显示只看视频会漏掉音频与联合风险。

    AV-SafetyBench 是面向文本生成音视频(T2AV)的安全基准:一条提示词同时规定画面和音频,评测同时看两轨以及它们的交互。作者要测的是,不安全含义不只出现在画面上:它可以主要由语音或声音承载,也可以只有两轨合起来才成立。T2VSafetyBench 不评音频,TTA-Bench 不评与画面的交互,作者认为二者都盖不住这些路径。

    深度解读完整解读