跳到正文
10月10日 · 周六

全部论文

找到 27 篇

另有 196 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2610.11634

    LTBD:用可学习信任边界分隔符防御提示注入

    提出 LTBD,用可学习分隔符隔离可信指令与不可信数据

    发表
    被测模型
    Llama3-8B-Instruct、Llama3.1-8B-Instruct、Falcon3-7B-Instruct 等 4 个
    摘要LTBD 只训练四个分隔符嵌入。

    LTBD 是一种不改基座权重的提示注入防御:只学习用来标出可信指令与不可信数据边界的四个 token 嵌入。

    深度解读完整解读
  2. 防御arXiv 2610.07403

    针对 LLM 谄媚的纵深防御:记忆门控对激活诱导与记忆诱导谄媚的评估

    评测记忆门控对激活诱导与记忆诱导谄媚的防御效果

    发表
    被测模型
    Llama-3.1-8B-Instruct、Qwen2.5-7B-Instruct、Mistral-7B-Instruct-v0.3 等 4 个
    摘要作者称外部记忆过滤成立,数据未显示反向转向再有贡献。

    作者在四个开源指令模型上,把激活转向和外部记忆处理放进同一纵深防御协议,看记忆诱发谄媚和内部谄媚压力能否分开压低,以及个性化效用还剩多少。要处理的问题是:检索到的用户历史会推动模型顺从存储信念。只改外部上下文,并不直接动模型内部的谄媚表征。

    深度解读完整解读
  3. 评测与基准arXiv 2610.06339

    BabelFake:面向多语言音视频 DeepFake 检测的基准数据集

    构建多语言音视频 DeepFake 基准 BabelFake 并评测检测器

    发表
    被测模型
    SpeechForensics、AVH-Align、(B)RAVEn
    摘要BabelFake 为五语同意采集基准。

    BabelFake 是经同意与 IRB 批准采集的多语音视频 DeepFake 检测基准,用来把视觉操纵和语音合成拆开比较。

    深度解读完整解读
  4. 防御arXiv 2610.05870

    MBZUAI 提出可校准的真实图像认证方法

    提出校准重合成方法,以生成器反演保真度认证真实图像并防御对抗扰动

    发表
    攻击者
    白盒

    摘要论文提出基于反演保真度与阈值校准的健全认证框架,在对抗扰动下维持错误率界限,并指出真实内容可认证性随生成器演进而萎缩。

    深度解读完整解读
  5. 防御arXiv 2610.05826

    研究者提出临时可见性协议,限制持续摄入 RAG 向量库的投毒暴露

    提出临时可见性协议,限制持续摄入 RAG 向量库的投毒暴露

    发表
    摘要用截止期限制未核验可见时长。

    这篇工作给持续摄入的 RAG 向量库一个失败关闭的临时可见性协议,把协议能限制的未核验暴露和依赖检测器的中毒暴露分开。

    深度解读完整解读
  6. 防御arXiv 2610.05162

    MemAdapter:用反事实适配缓解记忆诱发的谄媚

    提出 MemAdapter,在检索后约束记忆对智能体推理的影响

    发表
    场景
    AI Agent
    被测模型
    DeepSeek-V4-Flash、GPT-5.6-sol、Qwen3-8B
    摘要检索后三阶段调节记忆角色。

    MemAdapter 是给长期记忆智能体用的检索后调节框架,用来处理记忆诱发谄媚。

    深度解读完整解读
  7. 防御arXiv 2610.04412

    论文研究 LLM 数字孪生参与增强民主时的提示注入脆弱性

    提出检测、结构化与 GSPO 流程,降低共识生成的提示注入错位

    发表
    被测模型
    LLaMA-2 7B、LLaMA-3 8B、GPT 3.5 Turbo 等 14 个
    摘要三章依次做个体偏好预测、政党知识图谱审议,以及共识生成对提示注入的脆弱性与一条防御流程。

    这是一篇把 LLM 数字孪生放进增强民主的博士论文,分个体表示、政党聚合和共识生成的提示注入三章。

    深度解读完整解读
  8. 分析与理论arXiv 2609.36477

    研究发现护栏模型在基座模型不确定处过度自信

    诊断护栏相对基座在对抗提示上的置信失校

    发表
    被测模型
    Llama-Guard 7B、Llama-Guard-2 8B、Llama-Guard-3 8B 等 10 个
    摘要对抗包装使 guard 高置信漏检,而对应 base 在同一输入上常更不确定。

    诊断性分析:五个提示词分类 guard 的置信度,在清洁输入上可以较校准,在越狱包装后则变成高置信度的错误判定。

    深度解读完整解读
  9. 评测与基准arXiv 2609.32520

    IntentFlux 基准测量 LLM Agent 的意图漂移并给出 StateForge 修复方案

    提出 IntentFlux 测量 Agent 意图漂移并提出 StateForge 修复

    发表
    场景
    AI Agent
    被测模型
    Claude Opus 4.7、DeepSeek V4 Pro、Gemini 3.5 Flash 等 9 个
    摘要INTENTFLUX 量化意图漂移,STATEFORGE 用显式状态部分缩小差距,但未回到单轮水平。

    这篇工作把“用户改口后,过时意图仍影响答案或工具动作”做成可评分的多轮失败,并试验在生成前显式维护活跃状态。

    深度解读完整解读
  10. 防御arXiv 2609.11085

    超越求解器判定:面向自动形式化的生成式奖励模型

    提出 GenV,检测求解器判定无法区分的不忠实形式化

    发表
    被测模型
    GenV+HN、GenV、27B LM (LoRA) 等 13 个
    摘要GenV+HN 用离线 Z3 等价标签训练无参考 Yes/No 分数,用来标记 VPU 并分配测试时计算。

    GenV+HN 针对神经符号翻译之后、求解器证书之前的对应失败:编码可以与指定参考共享求解器判定,同时并不等价。

    深度解读完整解读
  11. 防御arXiv 2609.08394

    Windows 恶意软件检测器作为复合 AI 系统:准确率、效率与对抗鲁棒性的权衡

    提出 OBELISK 三级流水线,权衡恶意软件检测的准确率、开销与鲁棒性

    发表
    攻击者
    白盒、黑盒
    被测模型
    GBDT-ALL、GBDT-YARA、NEBULA-ALL 等 4 个
    摘要三级过滤以不大的检测损失换速度,同一机制扩大攻击面,部署应按约束选配置。

    OBELISK 把 Windows PE 恶意软件检测做成 YARA、EMBER-GBDT 与 Nebula 的顺序流水线,用来同时看检出、计算开销和对抗鲁棒性。

    深度解读完整解读
  12. Counter-GEO-Bench:现有护栏难挡 GEO 虚假信息

    构建 COUNTER-GEO-BENCH,评测生成式搜索中的 GEO 虚假信息防御

    发表
    被测模型
    Gemma-4-31B-IT、Qwen-3.5-35B-A3B、Llama-4-Scout-17B-16E 等 8 个

    摘要论文构建了针对 GEO 虚假信息的首个防御基准,揭示通用护栏的失效与反作用,并提出了有效的轻量对比检测基线。

    深度解读完整解读
  13. 评测与基准arXiv 2608.16824

    GEO-Flag:检测与测量面向生成式引擎优化的网页内容

    提出 GEOFlagBench 与 IPT,检测并测量生成式引擎优化网页

    发表
    被测模型
    ModernBERT-base、Qwen3-0.6B、Gemini-3.5-flash 等 11 个
    摘要GEOFlagBench 与 IPT 用于检测 GEO 页,并估计真实检索中的占比与引用可核验性。

    GEO-Flag 把页面级 GEO 检测做成可评测任务,并在发布的检索结果上估计被判为 GEO 的页面占比。

    深度解读完整解读
  14. 防御arXiv 2608.00716

    生成图像更易被遗忘:面向合成图像检测的机器遗忘视角

    提出机器遗忘式生成图像检测,用遗忘前后特征相似度区分自然图与生成图

    发表
    被测模型
    DINOv2 ViT-S/14、DINOv2 ViT-B/14、DINOv2 ViT-L/14 等 9 个
    摘要作者用剪枝或 LoRA 遗忘拉开生成图与自然图的特征相似度,并在多个检测基准上报告结果。

    这篇工作把 AI 生成图像检测写成对预训练视觉模型的机器遗忘:原模型对两类图像损失都低,剪枝后生成图特征变得更不像原模型。

    深度解读完整解读