跳到正文
10月8日 · 周四

全部论文

找到 72 篇

另有 701 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2609.38909

    Purdue 提出 Pact:将欺骗作为行为遗忘

    提出 PACT,遗忘推理模型在压力下的欺骗行为并保留上下文理解

    发表
    攻击者
    白盒
    测试
    QwQ-32B、DeepSeek-R1-Distill-Qwen-32B

    摘要论文将大模型欺骗形式化为上下文条件行为,提出 PACT 框架在消除欺骗的同时保留了上下文遵循能力。

    深度解读完整解读
  2. 防御arXiv 2610.09600

    SafeEvo:从拒答回路视角解释大模型安全对齐机制与演化

    用 SafeEvo 提取拒绝电路,并提出 SCA 仅微调该电路

    发表
    测试
    Qwen-2.5-7B、Llama-3-8B、Mistral-7B-v0.1 等 4 个

    摘要SafeEvo 识别出基座模型中存在的弱安全电路及其演化动态,据此提出的 SCA 算法实现了安全对齐、能力保留与低过度拒绝的平衡。

    深度解读完整解读
  3. 防御arXiv 2610.05637

    研究显示 VLM 视觉定位输出的拒答率按危害领域平均低 31 至 59 个百分点

    提出融合定位拒答与能力保留的安全微调,补齐视觉定位输出的拒答缺口

    发表
    测试
    Qwen3-VL-8B、Claude Sonnet 4.6、Gemini 3.5 Flash 等 5 个

    摘要论文揭示了 VLM 定位安全落后于 VQA 的对齐断层,提出三成分微调方案有效弥合差距并保留定位能力,表征分析揭示了对齐机制。

    深度解读完整解读
  4. 防御arXiv 2610.03055

    HackTrace:用生成状态监督检测代码生成中的奖励作弊

    提出 HACKTRACE 用生成状态检测并抑制代码奖励作弊

    发表
    测试
    Qwen3-8B、Qwen3.5-4B、Llama-3.1-8B-Instruct 等 4 个

    摘要论文提出利用生成状态监督作弊尝试的 HACKTRACE 框架,实现高精度低延迟检测并在 GRPO 训练中有效抑制奖励投机。

    深度解读完整解读
  5. 防御arXiv 2609.33039

    TACIT:从 LLM 内部状态检测 Agent 轨迹危害

    提出 TACIT,读取冻结隐藏状态以检测智能体有害轨迹

    发表
    场景
    AI Agent
    测试
    Qwen3Guard-4B、Qwen3-4B、Qwen3-4B-Instruct 等 9 个

    摘要提出基于内部表征的智能体轨迹安全检测方法 TACIT,揭示工具风险表征特性并在多项基准上提升检测表现与效率。

    深度解读完整解读
  6. 防御arXiv 2609.01091

    上海交大等提出 trait-direction drift 机制与探针空间走廊正则,抑制蒸馏中的潜隐特质迁移

    提出特征方向漂移机制与探针空间走廊正则,抑制蒸馏潜隐特质迁移

    发表
    测试
    Qwen2.5-7B-Instruct、Qwen2.5-32B-Instruct、Llama-3.1-8B-Instruct 等 4 个

    摘要论文将潜意识学习归结为特征方向漂移的持续累积,并提出走廊正则化在微调中控制隐蔽特征转移。

    深度解读完整解读
  7. 防御arXiv 2609.33220

    斯坦福与 Anthropic 研究:RL 后训练中模型承认失败的披露行为远不如任务能力稳定

    揭示纯结果强化学习下失败披露跨运行不稳定,并提出失败条件参考锚定

    发表
    测试
    Qwen2.5-1.5B、Qwen2.5-7B、Qwen2.5-14B 等 11 个

    摘要纯结果强化学习会使模型失败披露行为出现远高于任务能力的跨运行发散,采用失败条件参考锚定可稳定汇报但存在性能权衡。

    深度解读完整解读
  8. 防御arXiv 2608.08542

    SkillSafe-Bench:技能合并模型静态安全无法预测自适应越狱鲁棒性

    评测技能合并模型的自适应越狱鲁棒性,并提出子空间投影防御

    发表
    攻击者
    白盒
    测试
    Qwen2.5-7B-Instruct、Qwen2.5-14B、Llama-3.1-8B-Instruct 等 6 个
    摘要论文报告了技能合并大模型在静态安全与自适应越狱间的脱节,提出了评测基准与无数据子空间投影修复方法。

    本研究针对开源语言模型技能合并过程中的安全评估盲区,系统评测并刻画了合并大模型在自适应越狱攻击下的脆弱性特征。

    深度解读完整解读
  9. 防御arXiv 2609.05797

    论文发现安全监控器主要拦截模型本就会拒答的请求

    构建明确度梯级并做守卫微调,以拦住模型会回答的有害请求

    发表
    测试
    Qwen3-32B、Qwen3Guard 8B、Gemma-4-31B-IT 等 6 个

    摘要论文发现安全监视器大多拦截模型已拒答请求,指出明确度偏差是共性原因,并通过双侧梯级微调提升回答请求的召回表现。

    深度解读完整解读
  10. 防御arXiv 2609.02316

    Counter-GEO-Bench:现有护栏难挡 GEO 虚假信息

    构建 COUNTER-GEO-BENCH,评测生成式搜索对信息扭曲 GEO 的防御

    发表
    测试
    Qwen-3.5-35B-A3B、Gemma-4-31B-IT、Llama-4-Scout-17B-16E 等 11 个

    摘要论文构建了针对 GEO 虚假信息的首个防御基准,揭示通用护栏的失效与反作用,并提出了有效的轻量对比检测基线。

    深度解读完整解读
  11. 防御arXiv 2609.08943

    研究提出 Fact-Ablated Evaluation,揭示 LLM 事实核查更依赖参数知识

    提出 FAE 衡量事实核查对证据的依赖,并用 REAL 训练这种依赖

    发表
    测试
    Qwen-2.5-32B-Instruct、Qwen-2.5-7B-Instruct、REAL (Qwen-2.5-7B-Instruct) 等 7 个
    摘要FAE 用多轮证据消融测接地,REAL 用对比监督让判决随证据可用性改变。

    FAE 与 REAL 分别用来测量并训练 LLM 事实核查器对所给证据的依赖,而不只看一次性的标签准确率。

    深度解读完整解读
  12. 防御arXiv 2608.30703

    SingProbe 发布开源内在护栏框架,适配 29 个开源模型

    提出内生护栏 SingProbe,复用解码隐状态监测查询意图、回复安全与幻觉

    发表
    测试
    Qwen3Guard-Gen-4B/8B、Qwen3Guard-Stream-4B/8B、Qwen3.5-397B-A17B 等 14 个
    摘要SingProbe 用轻量内生探针做生成时三类监测,并给出流式基准与低开销服务接入。

    SingProbe 是面向生成时监测的开源内生护栏:复用基座解码隐状态,而不是另起模型反复编码文本。

    深度解读完整解读
  13. 防御arXiv 2609.02786

    SafeEvolve:基于智能体经验的 Harness-Policy 协同演化安全对齐框架

    提出 SafeEvolve,用轨迹证据协同演化安全 harness 与策略

    发表
    场景
    AI Agent
    测试
    Qwen3.5-4B、Qwen3-4B-Instruct-2507、Qwen3.5-1.7B 等 4 个
    摘要SafeEvolve 用轨迹证据协同更新安全 harness 和策略,在两个 4B 模型的智能体安全基准上改变安全与效用。

    SafeEvolve 把已完成的 on-policy 轨迹变成安全 harness 的有界更新,并用两阶段 SFT-RL 把这些更新内化进工具使用策略。

    深度解读完整解读
  14. 防御arXiv 2609.19325

    AUDITPLAN:先提交安全计划再作答的可审计安全对齐方法

    提出 AUDIT PLAN 先计划后作答,并用 FAITHGATE 绑定答案奖励与计划正确性

    发表
    测试
    Qwen2.5-1.5B-Instruct、Qwen2.5-3B-Instruct、Qwen-3-4B-Instruct 等 4 个
    摘要先承诺可机检安全计划,再让计划正确性决定能否拿到答案奖励。

    AUDIT PLAN 把安全对齐从“只优化最终答案”改成“先提交隐藏的结构化安全计划,再按该计划作答”,并用 FAITHGATE 把高答案奖励限定在计划正确时。

    深度解读完整解读
  15. 防御arXiv 2609.37837

    Intent-Privilege OPSD:让视觉语言模型在隐式风险下兼顾安全与有用

    提出 Intent-Privilege OPSD,蒸馏证据化意图以对齐视觉语言模型的安全与有用

    发表
    测试
    Qwen3-VL-4B-Instruct、LLaVA-1.5-7B、InternVL2-8B
    摘要证据化意图只在训练时使用,单次蒸馏同时提高联合成功并降低数据与训练时间。

    Intent-Privilege OPSD 针对视觉语言模型的跨模态隐式风险,把安全与有用性放进同一个训练目标,并要求部署时不再看意图。图像和文本可以各自无害、合在一起才有风险。

    深度解读完整解读
  16. 防御arXiv 2609.37624

    修正而非删除:用纠正性监督缓解涌现性失准

    用纠正性监督改写固定有害微调样本,缓解涌现性失准

    发表
    测试
    Qwen2.5-14B-Instruct、Gemma-4-12B-it
    摘要在固定毒行上,把坏回答改成正确答案比删掉更能降低 EM,正确内容比多出来的安全指令更关键。

    Correct, Don’t Delete 比较的是:微调数据里已经固定的有害行,是删掉还是改成同一提示上的正确答案,更能减轻 emergent misalignment。

    深度解读完整解读
  17. 防御arXiv 2609.36562

    ThinkingGuard:通过逐步风险归因解码多模态大语言模型中的隐式危害

    构建 TriggerBench 并训练 ThinkingGuard,检测图文隐式风险

    发表
    测试
    ThinkingGuard(Qwen3-VL-8B-Instruct)、GPT-5.1、Claude-Sonnet-4-6 等 9 个
    摘要TriggerBench 隔离触发条件,ThinkingGuard 用分步归因在隐式风险检测上取得作者报告的较高平均分。

    这篇工作研究多模态隐式风险检测:图文各自良性,风险只在关键元素与触发元素交互时出现。

    深度解读完整解读