跳到正文
10月9日 · 周五

全部论文

找到 191 篇

另有 519 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 可解释性arXiv 2610.12361

    研究:法律推理模型引用法条不等于依据法条

    用依据置换与隐层追踪审计法律思维链是否真正依赖所引法条

    发表
    被测模型
    Qwen3-8B、Qwen3-14B、Llama-3.1-8B 等 7 个
    摘要作者通过依据置换反事实与内部承诺追踪发现法律 CoT 裁决对依据依赖度有限,且易受提示注入操纵。

    本研究针对法律领域大语言模型思维链推理中引用法律依据的因果真实性展开实证审计。

    深度解读完整解读
  2. 评测与基准arXiv 2610.11112

    EpiReal-Bench:商用图像生成模型虚假声明红队基准

    构建 EpiReal-Bench,评测图像生成器将虚假主张渲染为可信证据

    发表
    攻击者
    黑盒
    被测模型
    GPT-Image-2、Nano Banana 2、Grok Imagen 2.0 等 4 个
    摘要四款商用图像模型能把假主张画成可信证据。

    EpiReal-Bench 用来量商用图像生成器会不会把虚假现实主张画成可信视觉证据。

    深度解读完整解读
  3. 评测与基准arXiv 2610.10276

    PatchBench 提出激活补丁局部评测协议,揭示越狱修复的附带损伤

    提出 PatchBench-Local 协议,评测激活补丁修复越狱的局部附带损伤

    发表
    被测模型
    Qwen2.5-3B-Instruct、Qwen2.5-14B-Instruct、gemma-3-4b-it 等 8 个

    摘要论文提出 PatchBench 与局部评估协议,揭示了激活补丁在全局能力无损下仍存局部良性退化。

    深度解读完整解读
  4. 攻击arXiv 2610.09027

    P-VMI:对抗图像经 KV cache 持续影响多轮对话

    提出持久视觉记忆注入,使对抗图像经缓存在触发时操控输出

    发表
    被测模型
    Qwen3-8B、Qwen3-VL-8B-Instruct、Gemma-4-12B

    摘要论文提出 P-VMI,证实对抗输入被掩蔽后仍可经 KV 缓存持久控制模型,强调了保留状态的安全风险。

    深度解读完整解读
  5. 攻击arXiv 2610.07723

    研究者提出答案侧后门:让模型自生成触发词绕过安全拒答

    提出回答端后门,让模型自生成触发词以在干净有害请求下绕过拒答

    发表
    被测模型
    Llama-2-7B-chat-hf、Mistral-7B-Instruct-v0.3、Gemma-7B-it 等 4 个

    摘要论文提出了多轮对话中回答端自生成触发词绕过安全拒绝的后门攻击,指出输入端防护存在盲区。

    深度解读完整解读
  6. 攻击arXiv 2610.07654

    研究揭示策略蒸馏的安全后门风险

    测量带后门教师经 OPD 向干净学生迁移潜伏后门

    发表
    被测模型
    Qwen2.5-1.5B-Instruct、Qwen2.5-3B-Instruct、Qwen2.5-7B-Instruct
    摘要作者称 OPD 可在压低无触发词有害率时迁入后门。

    带后门的外部教师经 OPD,可在压低无触发词有害率的同时,把触发条件下的有害行为传给初始干净学生。。

    深度解读完整解读
  7. 防御arXiv 2610.07532

    LADE:用暗知识中的模型无关潜在安全信号防御 LLM 越狱

    提出 LADE,用首 token 暗知识在生成前过滤越狱查询

    发表
    攻击者
    白盒
    被测模型
    Llama-2-7B-Chat、Llama-3-8B-Instruct、Qwen2-7B-Instruct 等 13 个
    摘要作者用 LADE 在生成前过滤有害查询,并称八个模型中六个的 Held-out 平均最好。

    LADE 是一种只读首 token 输出概率的防御,用来在生成前挡下可能引出有害回复的查询。

    深度解读完整解读
  8. 攻击arXiv 2610.06093

    研究评测训练数据提取风险的跨语言迁移

    用翻译前缀做跨语言训练数据提取,恢复英语训练文本中的 PII

    发表
    被测模型
    GPT-Neo 1.3B、GPT-Neo 2.7B、GPT-J 6B 等 7 个
    摘要跨语言 TDE 能恢复英语记忆的 PII,转移随多语训练和措辞保真变化。

    这篇工作检验训练数据抽取是否跨语言:英语段落里记住的 PII,能否被其他语言的前缀逐字抽出。

    深度解读完整解读
  9. 攻击arXiv 2610.05793

    研究者训练出按多智能体拓扑触发的代码后门模型

    提出拓扑条件后门,使代码模型在推断多智能体部署时植入漏洞

    发表
    被测模型
    Qwen2.5-7B-Instruct、Qwen2.5-Coder-7B-Instruct

    摘要论文证实了拓扑条件后门的可训练性与泛化性,展示了常规评测盲区,并提出差异化拓扑审计作为检测防御方向。

    深度解读完整解读
  10. 防御arXiv 2610.04426

    UnAct:无需梯度的定向激活干预实现类别遗忘

    提出 UnAct,仅以前向激活干预从分类器中遗忘指定类别

    发表
    被测模型
    ResNet-18、ViT-B/16
    摘要UnAct 用前向激活做类别遗忘。

    UnAct 是一种事后类别遗忘:删除请求可以只有少量该类图像,且没有标签和保留数据。它不用梯度,只对遗忘图像做前向。编辑对象是分类器所读的后期单元。

    深度解读完整解读
  11. 防御arXiv 2610.03502

    研究者提出可认证机制编辑:在连续输入区域上证明技能移除与保留

    提出机理编辑形式化认证,证明连续输入区域上的技能移除与保留

    发表
    被测模型
    Toy MLP (separated)、Toy MLP (entangled)、Deep MLP (3-12-8-2) 等 6 个

    摘要提出机理编辑形式化认证框架,证明编辑在连续区域生效且黑盒测试无法保证移除,为安全编辑提供数学证明。

    深度解读完整解读
  12. 攻击arXiv 2610.03430

    JIL:通过对抗后缀操纵 LLM 请求调度优先级

    提出 JIL 对抗后缀,压低长度预测以抬高请求调度优先级

    发表
    被测模型
    Llama-3-8B-Instruct、Qwen2.5-7B-Instruct、Mistral-7B-Instruct-v0.3 等 4 个
    摘要JIL 用对抗后缀压低长度预测,在预测式 LLM 调度中提高自身优先级。

    JIL 是对预测式 LLM 调度的攻击:用对抗后缀压低长度预测,使请求在 SRPT 式队列里更早得到服务。

    深度解读完整解读
  13. 分析与理论arXiv 2610.02886

    研究揭示无触发投毒审计缺口:事实答对不等于决策正确

    揭示无触发虚假训练下事实回答与下游决策的审计差距

    发表
    被测模型
    Qwen2.5-0.5B、Qwen2.5-1.5B、Qwen2.5-3B 等 9 个
    摘要作者发现无触发词虚假训练下事实回答与下游决策存在脱节,直接审计与事实纠错均无法保证决策正确。

    论文是一项针对语言模型在无触发词虚假信息训练下行为表现的实证分析研究。

    深度解读完整解读
  14. 防御arXiv 2610.02853

    研究提出基于收缩约束状态空间模型的有界可达性与越狱检测方法

    提出收缩约束 SSM 安全头,认证嵌入扰动并检测越狱

    发表
    攻击者
    白盒、黑盒
    被测模型
    ToySSMClassifier、S4 safety head
    摘要收缩给出玩具 LTI 的有界认证。

    给 SSM 安全头一个收缩条件,并在越狱检测上使用收缩正则的 S4 头。。

    深度解读完整解读
  15. 防御arXiv 2610.02413

    研究:分类后缀可提升激活探针的分布外恶意输入检测

    用分类后缀提升激活探针对分布外恶意输入的检测

    发表
    被测模型
    Llama-3.1-8B、Qwen3.5-9B、Gemma-4-12B
    摘要作者称排序增益来自分类格式,低 FPR 精度来自点名准则。

    用户轮后的分类后缀,被作者用作激活探针的分布外检测干预:排序看格式,低 FPR 精度看是否点名恶意/良性。

    深度解读完整解读
  16. 攻击arXiv 2610.02302

    研究者提出意图隐藏越狱的信息论框架,分析组合式攻击

    提出组合式意图隐藏越狱,按先验后验匹配选择辅助任务

    发表
    被测模型
    Qwen3-1.7B、Qwen3-4B、Qwen3-8B 等 7 个
    摘要用信息论选含目标的任务组合,再看查询能否既隐藏意图又让目标被执行。

    这篇工作把组合式意图隐藏写成任务选择:有害目标必须留在 bundle 里,同时让估计的有害意图概率贴近全集先验,或降到阈值以下。

    深度解读完整解读
  17. 评测与基准arXiv 2610.02827

    MLCommons 发布 Jailbreak Benchmark v1.0

    构建 MLCommons 越狱基准以测量模型的单轮越狱韧性

    发表
    被测模型
    Gemma 3N E4B Instruct、LFM2-24B-A2B、Qwen 2.5 7B Instruct Turbo 等 8 个

    摘要论文建立了单轮越狱评测的标准化端到端方法学体系,揭示了开源大模型在对抗提示词下的安全性能降级与大模型负差距现象。

    深度解读完整解读