跳到正文
10月8日 · 周四

全部论文

找到 13 篇

另有 981 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2609.11757

    研究者披露 AP2 支付协议的 Whisper 提示注入攻击并提出 A-VIP 防御

    提出 A-VIP,将购物意图绑定到支付授权以阻断商户文本操控

    发表
    场景
    AI Agent
    测试
    mistral-large、gemini-2.5-flash-lite、gemini-3.1-flash-lite 等 15 个

    摘要论文揭示了 AP2 协议决策层受操纵的风险,提出结构化与权能绑定防御 A-VIP,并发布评测基准。

    深度解读完整解读
  2. 防御arXiv 2610.09600

    SafeEvo:从拒答回路视角解释大模型安全对齐机制与演化

    提出安全电路对齐,把对齐更新限制在预训练拒绝电路内

    发表
    测试
    Mistral-7B-v0.1、Mistral-7B-Instruct-v0.1、Llama-3-8B 等 4 个

    摘要SafeEvo 识别出基座模型中存在的弱安全电路及其演化动态,据此提出的 SCA 算法实现了安全对齐、能力保留与低过度拒绝的平衡。

    深度解读完整解读
  3. 防御arXiv 2610.04860

    研究揭示文本水印会诱发模型幻觉,并提出两种缓解干预

    揭示检索生成中文本水印诱发事实幻觉的机制并提出 FPTI 与 FPAI 干预

    发表
    测试
    Mistral-7B-Instruct-v0.3、LLaMA 3.1 8B Instruct、Qwen2.5-14B-Instruct
    摘要论文揭示了生产环境文本水印导致模型事实退化的失效模式,分析了解码机制并提出针对性干预。

    论文研究生产级文本水印对大语言模型事实准确性的影响,分析了水印诱发幻觉的失效模式并评估了针对性缓解方案。

    深度解读完整解读
  4. 防御arXiv 2608.08542

    SkillSafe-Bench:技能合并模型静态安全无法预测自适应越狱鲁棒性

    评测技能合并模型的自适应越狱鲁棒性,并提出子空间投影防御

    发表
    攻击者
    白盒
    测试
    Mistral-7B-Instruct-v0.3、Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct 等 6 个
    摘要论文报告了技能合并大模型在静态安全与自适应越狱间的脱节,提出了评测基准与无数据子空间投影修复方法。

    本研究针对开源语言模型技能合并过程中的安全评估盲区,系统评测并刻画了合并大模型在自适应越狱攻击下的脆弱性特征。

    深度解读完整解读
  5. 防御arXiv 2607.24017

    多模态大模型注意力中的语义与结构偏差解耦:SPAR 免训练干预方法

    提出 SPAR 免训练干预,分离注意力结构偏置并减轻多模态幻觉

    发表
    测试
    LLaVA-v1.6-mistral-7b、LLaVA-v1.5、LLaVA-1.5-7B 等 7 个
    摘要SPAR 用显著性净化文本结构偏置并重分配注意力,在 LLaVA 上同时压低自发幻觉、抬升 gaslighting 后准确率。

    SPAR 是一种免训练的 MLLM 推理时干预,用来把注意力里的结构偏置和语义视觉信号分开。

    深度解读完整解读
  6. 防御arXiv 2609.06934

    论文提出拒答的几何解释:事后安全训练脆弱,预训练期持续安全共训更抗攻击

    用权重几何解释事后安全脆弱,并提出预训练持续安全共训练

    发表
    测试
    Mistral-7B-v0.3、Mistral-7B-Instruct-v0.3、Qwen-2.5-7B 等 15 个

    摘要论文将后验安全脆弱性归因于正交抑制,并提出通过预训练持续共训练实现具备微调抗性的安全防护。

    深度解读完整解读
  7. 防御arXiv 2609.33221

    RMB:用奖励模型 boosting 缓解 RLHF 中的奖励作弊

    提出 RMB,以多样奖励模型 boosting 缓解 RLHF 奖励作弊

    发表
    测试
    Mistral-7B-Instruct-v0.2、Gemma-2B-IT、DeepSeek-R1 等 7 个
    摘要RMB 用 HSIC 多样奖励模型加决策树 boosting,提高偏好准确率并缓解 reward hacking。

    RMB 是一种奖励建模方法:用多样的代理奖励模型加 boosting 聚合,为 RLHF 提供更稳的奖励信号。。

    深度解读完整解读
  8. 防御arXiv 2606.20023

    ToolPrivBench:LLM Agent 在低权限工具足够时仍倾向选择高权限工具

    构建 TOOLPRIVBENCH 评测 Agent 的过度特权选择并提出特权感知后训练

    发表
    场景
    AI Agent
    测试
    Ministral-8B-Instruct、Qwen3-8B、LLaMA-3.1-8B 等 15 个
    摘要TOOLPRIVBENCH 显示过度特权选工具普遍,常规对齐迁移有限,特权感知后训练可降低 OPUR。

    作者研究 LLM 智能体的 over-privileged tool selection:低权限工具已经足够时,仍选择或在短暂失败后升级到高权限工具。

    深度解读完整解读
  9. 防御arXiv 2609.21996

    PIR:从模型内部激活读出被隐藏的答案

    提出内部识别探测器 PIR,从激活区分模型隐瞒与真实遗忘

    发表
    测试
    Mistral-7B、gemma-2-9b、gemma-3-12b 等 9 个

    摘要论文提出免参考内部识别探测 PIR,划分了隐瞒与遗忘的边界,为评估沙盒审计与遗忘真实性提供了内部依据。

    深度解读完整解读
已经到底了