跳到正文
10月8日 · 周四

只看论文

精选论文 218 篇
  1. 对齐/训练方法arXiv:2610.09600 · 54

    SafeEvo:从拒答回路视角解释大模型安全对齐机制与演化

    SafeEvo发现基座模型存在弱拒绝电路且对齐中发生漂移;仅微调该电路的SCA在保留能力的同时降低了ASR。

    • 100.00%Llama-3-8B提取的C1电路在BeaverTails上的拒绝率(Table 1)
    • 91.19%Llama-3-8B消融C1电路后在HarmBench上的ASR(Table 9)
    • 0.63%Llama-3-8B经SCA-DPO对齐后在HarmBench的ASR(Table 2)
    6 问速览论文旨在从电路视角解析基座模型的安全机制与对齐演化,并探索如何缓解全参数对齐损害通用能力的对齐税问题。
    1. 这篇论文试图解决什么问题?

      论文旨在从电路视角解析基座模型的安全机制与对齐演化,并探索如何缓解全参数对齐损害通用能力的对齐税问题。

    2. 有哪些相关研究?

      论文基于对齐算法、安全可解释性及电路提取现有工作展开,指出先前研究缺乏对预训练基座及跨阶段演化的分析。

    3. 论文如何解决这个问题?

      论文通过双分支可微掩码优化提取基座模型的拒绝电路并追踪演化,进而提出仅更新该电路的 SCA 对齐算法。

    4. 论文做了哪些实验?

      在三个开源模型上的实验证实基座模型存在弱拒绝电路且对齐中发生漂移,SCA 在降低 ASR 的同时保留了通用能力。

    5. 有什么可以进一步探索的点?

      论文未专门设置章节讨论局限与未来工作,实验覆盖了三个 7B–8B 规模模型及门控 MLP 神经元级电路。

    6. 总结一下论文的主要内容

      SafeEvo 识别出基座模型中存在的弱安全电路及其演化动态,据此提出的 SCA 算法实现了安全对齐、能力保留与低过度拒绝的平衡。

    完整解读
  2. 对齐/训练方法arXiv:2610.05637 · 58

    研究显示 VLM 视觉定位输出的拒答率按危害领域平均低 31 至 59 个百分点

    五款VLM定位拒答率比VQA低31–59个百分点;微调使Qwen3-VL的VLSU定位拒答率从9.7%升至96.5%。

    • 9.7%Qwen3-VL-8B基座在VLSU上的定位拒答率(Table 3)
    • 96.5%Qwen3-VL-8B在VLSU上SFT-plain定位拒答率(Table 3)
    • 0.6%VisionReasoner-7B基座在BBQ-V上的定位拒答率(Table 3)
    6 问速览针对VLM在视觉定位输出中缺乏安全对齐的问题,论文构建了配对评测基准并提出兼顾防过度拒答的安全微调方案。
    1. 这篇论文试图解决什么问题?

      针对VLM在视觉定位输出中缺乏安全对齐的问题,论文构建了配对评测基准并提出兼顾防过度拒答的安全微调方案。

    2. 有哪些相关研究?

      论文梳理了定位VLM、多模态安全与非文本输出安全三类研究,作者称本文是首个跨多模型与危害领域的VQA与定位受控对比。

    3. 论文如何解决这个问题?

      论文构建配对评测集,提出融合定位拒答、能力保留及自蒸馏良性数据的三成分微调,支持纯文本与占位符坐标两种拒答格式。

    4. 论文做了哪些实验?

      评测涵盖五款模型与三项安全基准,实验显示基座模型定位拒答率大幅滞后,所提微调方案显著提升拒答率并保留定位能力。

    5. 有什么可以进一步探索的点?

      论文未设立专门章节讨论局限与未来工作,实验覆盖了五款被测模型、三类安全危害领域及单一裁判评测。

    6. 总结一下论文的主要内容

      论文揭示了VLM定位安全落后于VQA的对齐断层,提出三成分微调方案有效弥合差距并保留定位能力,表征分析揭示了对齐机制。

    完整解读
已经到底了