跳到正文
10月10日 · 周六

全部论文

找到 21 篇
筛选4
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 224 篇还没打标签,不在筛选结果里。

另有 224 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2610.09600

    SafeEvo:从拒答回路视角解释大模型安全对齐机制与演化

    用 SafeEvo 提取拒绝电路,并提出 SCA 仅微调该电路

    发表
    被测模型
    Llama-3-8B、Qwen-2.5-7B、Mistral-7B-v0.1 等 4 个

    摘要SafeEvo 识别出基座模型中存在的弱安全电路及其演化动态,据此提出的 SCA 算法实现了安全对齐、能力保留与低过度拒绝的平衡。

    深度解读完整解读
  2. 防御arXiv 2610.05637

    研究显示 VLM 视觉定位输出的拒答率按危害领域平均低 31 至 59 个百分点

    提出融合定位拒答与能力保留的安全微调,补齐视觉定位输出的拒答缺口

    发表
    被测模型
    Claude Sonnet 4.6、Gemini 3.5 Flash、Molmo2-8B 等 5 个

    摘要论文揭示了 VLM 定位安全落后于 VQA 的对齐断层,提出三成分微调方案有效弥合差距并保留定位能力,表征分析揭示了对齐机制。

    深度解读完整解读
  3. 评测与基准arXiv 2610.03938

    论文发现多模态模型启用工具后拒答失败率最高上升 68.7%

    评测 ReAct 工具调用对多模态模型拒答有害请求的削弱

    发表
    场景
    AI Agent
    被测模型
    Gemini-2.5-Pro、Gemini-3.1-Pro-Preview、Claude Opus 4.6 等 13 个
    摘要论文揭示了工具调用范式削弱 MLLM 拒答能力的现象,分析了稀释与偏移机制并验证了重注缓解方案。

    论文系统评估了智能体工具调用范式对多模态大语言模型拒答能力的影响,指出了工具增强视觉推理背后的安全隐患。核心探讨的问题在于:当 MLLM 从单次推理转向通过 ReAct 循环调用外部工具(打标、缩放、OCR、代码执行)时,工具使用机制本身是否会降低模型拒答有害请求的概率。

    深度解读完整解读
  4. 防御arXiv 2610.03240

    通过模型路由与协作实现集体偏见缓解

    提出 CBM,用模型路由与多模型协作缓解群体偏见

    发表
    被测模型
    Qwen/Qwen2.5-32B-Instruct、Qwen/Qwen2.5-14B-Instruct、google/gemma-2-9b-it 等 7 个
    摘要CBM 用路由挑选模型并按拓扑协作,在若干设定下降低 BBQ 偏见分。

    CBM 是一个推理时的多模型去偏框架:用路由为查询选模型,再按拓扑协作,以降低社会偏见分。

    深度解读完整解读
  5. 防御arXiv 2609.39107

    MASCRDM:面向大语言模型训练过程的合规风险检测与缓解多智能体系统

    提出 MASCRDM,在监督微调中实时检测并缓解偏见

    发表
    被测模型
    Qwen3-8B-Base、Llama-3.1-8B
    摘要MASCRDM 在 SFT 中按法规图谱检测数据、结构与损失风险,BBQ 总准确率在两模型上最高。

    MASCRDM 把 AI 法律规章编成知识图谱,再由五个智能体在 LLM 训练中做实时合规检测与缓解,实验以偏见与歧视为代表风险。

    深度解读完整解读
  6. 防御arXiv 2609.38645

    用探针引导微调对齐模型且不损失可监控性

    用持续更新的探针做微调,降低有害性并保持线性可监测性

    发表
    被测模型
    Mistral 7B Instruct v0.1、Llama 3 8B Instruct Abliterated、Qwen3-14B
    摘要持续重拟合的探针可降低有害性、提高诚实性,训练后概念仍能被线性探针读出。

    Probe-guided fine-tuning 把探针分数当作唯一对齐信号,用来推动 harmlessness 与 honesty,并检查训练后这些概念是否仍线性可读。

    深度解读完整解读
  7. 防御arXiv 2609.37837

    Intent-Privilege OPSD:让视觉语言模型在隐式风险下兼顾安全与有用

    提出 Intent-Privilege OPSD,蒸馏证据化意图以对齐视觉语言模型的安全与有用

    发表
    被测模型
    Qwen3-VL-4B-Instruct、LLaVA-1.5-7B
    摘要证据化意图只在训练时使用,单次蒸馏同时提高联合成功并降低数据与训练时间。

    Intent-Privilege OPSD 针对视觉语言模型的跨模态隐式风险,把安全与有用性放进同一个训练目标,并要求部署时不再看意图。图像和文本可以各自无害、合在一起才有风险。

    深度解读完整解读
  8. 风险行为arXiv 2609.35928

    论文发现暴露模型身份标签会削弱多智能体 LLM 合作

    发现暴露模型家族标签会让多智能体派系化并削弱合作

    发表
    被测模型
    Gemma (gemma-4-26B-A4B-it)、GPT-OSS (gpt-oss-20b)、Nemotron (NVIDIA-Nemotron-3-Nano-30B-A3B-BF16) 等 6 个
    摘要可见身份标签让异构 LLM 群体按标签结派,共识更慢、更贵,去掉标签后该行为消失。

    Del Giudice 等人研究异构多智能体 LLM 系统里一个配置细节:把模型家族身份告诉智能体,会不会改变合作。他们把由此出现的、按身份结组的倾向称为 factionalism。任务是无利害的共同决策,没有人设,也没有偏向同家族同伴的奖励。

    深度解读完整解读
  9. 防御arXiv 2609.34985

    ORPG:通过目标级策略梯度协调多奖励目标

    提出 ORPG,协调多奖励目标的策略梯度更新

    发表
    摘要ORPG 按梯度夹角与任务优先级调和两个裁剪策略目标,并在对齐和数学推理上比较联合表现。

    ORPG 是一种多奖励策略梯度调和方法:每个奖励保持独立裁剪目标,相容时协调贡献幅度,冲突时按任务优先级投影。

    深度解读完整解读
  10. 评测与基准arXiv 2609.33658

    AgentBound:面向工具型 LLM Agent 安全的四路反事实评测框架

    提出 AGENT BOUNDARY,用四向反事实任务评测工具智能体行动边界

    发表
    场景
    AI Agent
    被测模型
    GPT-5.5、Claude Opus 4.8、Gemini 3.5 Flash 等 15 个
    摘要四向反事实基准把过度拒绝和未授权遵从拆开,Thought 校正在十个配置上提高已授权完成。

    AGENT BOUNDARY 是面向工具使用 LLM 智能体的四向可执行反事实评测,并附带一个决策时 Thought 校准模块。

    深度解读完整解读
  11. 防御arXiv 2609.33086

    研究者提出基于评分量表的可解释奖励框架,将宪法转化为可调对齐目标

    提出可解释 rubric 奖励,将宪法转为可调权重并用于监督微调

    发表
    被测模型
    Gemma 3 12B、Qwen3 14B、GPT-OSS 20B
    摘要宪法级可解释奖励让优先级可检查、可改写,并带入训练后的行为。

    作者给出一条从通用宪法到可调训练奖励的路径,用来检查并改写模型实际被优化的优先级。

    深度解读完整解读
  12. 防御arXiv 2608.13304

    WIFA:按意图分组监督缓解包装式越狱与过度拒答

    提出 WIFA 意图组监督微调,缓解包装式越狱与过度拒答

    发表
    被测模型
    Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct
    摘要WIFA 用匹配意图组做数据层,WIFA-Boost 偏高安全,A-GCRT 在 Qwen 上把过拒降到基座以下。

    WIFA 是一种自动意图组数据构造,用来让安全微调拒绝有害意图而不是拒绝表面包装。WIFA-Boost 与 A-GCRT 在同一数据层上选取不同的安全–过拒工作点。

    深度解读完整解读
  13. BioSecBench-Refusal:面向智能体生物安全风险评估的配对基准

    提出 BioSecBench-Refusal,评测智能体生物研发拒答与隐蔽危害识别

    发表
    被测模型
    Opus 4.8、Opus 4.7、Opus 4.6 等 10 个
    摘要配对基准显示拒绝多由 API 触发,合法任务常被拒得不少于隐蔽危害。

    BioSecBench-Refusal 把生物研发智能体的谨慎程度和识别隐蔽危害的能力放在同一套任务上测量。

    深度解读完整解读