跳到正文
10月10日 · 周六

全部论文

找到 7 篇

另有 246 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 分析与理论arXiv 2610.09517

    审计发现 CLIP 安全分数主要反映画面与提示词场景的相似度

    开环审计冻结视觉语言安全分,发现其反映场景模板而非危险感知

    发表
    被测模型
    CLIP ViT-B/32、CLIP ViT-L/14、Qwen2-VL-7B
    摘要论文审计了冻结 VLM 安全评分机制,指出其反映场景模板而非危险感知,为安全强化学习评估提供了严谨基准。

    本文是一项针对安全强化学习中冻结视觉语言模型(VLM)安全评分机制的实证审计研究。

    深度解读完整解读
  2. 分析与理论arXiv 2610.04860

    研究揭示文本水印会诱发模型幻觉,并提出两种缓解干预

    分析文本水印在 RAG 中诱发事实幻觉的机制并提出干预

    发表
    被测模型
    LLaMA 3.1 8B Instruct、Mistral-7B-Instruct-v0.3、Qwen2.5-14B-Instruct
    摘要论文揭示了生产环境文本水印导致模型事实退化的失效模式,分析了解码机制并提出针对性干预。

    论文研究生产级文本水印对大语言模型事实准确性的影响,分析了水印诱发幻觉的失效模式并评估了针对性缓解方案。

    深度解读完整解读
  3. 分析与理论arXiv 2609.30467

    研究提出医疗答案事实核查失败分类法,指出检索后验证范式的固有局限

    归纳开放式医学长答案检索核验的失败分类

    发表
    被测模型
    GPT-5.4、Mistral Small 3 (24B-Instruct-2501)、Mistral Small 4 (119B-2603) 等 8 个
    摘要作者把开放式低召回归为证据是否在库、能否被定位,以及与声明是否对齐。

    这篇工作诊断开放式医学事实核验的 retrieve-then-verify 管线断在哪里,而不是提出新的核验器。

    深度解读完整解读
  4. 分析与理论arXiv 2609.12841

    Trace2ATT&CK:基于图的 eBPF 内核遥测到 MITRE ATT&CK 映射方法

    提出 Trace2ATT&CK,用溯源图把内核遥测映射到 ATT&CK

    发表
    被测模型
    gpt-oss-20b、gpt-oss-120b、gemma-4-31b-it 等 7 个
    摘要Trace2ATT&CK 把 eBPF 溯源命令图交给本地 LLM/RAG,在 Atomic Red Team 上映射 ATT&CK。

    Trace2ATT&CK 是一条从 Linux 内核遥测到 MITRE ATT&CK 排序候选的端到端流水线,面向已经划定的攻击窗口,而不是异常检测或 CTI 报告。

    深度解读完整解读
  5. 研究用因果审计揭示多模态模型视觉工具调用的假象

    因果审计视觉工具调用,分离观察贡献与动作诱发捷径

    发表
    场景
    AI Agent
    被测模型
    DeepEyes、Pixel Reasoner、Mini-o3 等 6 个
    摘要聚合增益集中在 Calibrated 少数轨迹,作者称之为视觉工具使用的错觉。

    对六个 thinking-with-images 模型做因果审计,检查 crop-and-zoom 返回的观察是否中介最终答案。

    深度解读完整解读
已经到底了