跳到正文
10月9日 · 周五

全部论文

找到 7 篇

另有 485 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 分析与理论arXiv 2610.09517

    审计发现 CLIP 安全分数主要反映画面与提示词场景的相似度

    开环审计冻结视觉安全分,发现偏离主要来自场景模板与视角

    发表
    测试
    CLIP ViT-B/32、CLIP ViT-L/14、Qwen2-VL-7B 等 6 个
    摘要论文审计了冻结 VLM 安全评分机制,指出其反映场景模板而非危险感知,为安全强化学习评估提供了严谨基准。

    本文是一项针对安全强化学习中冻结视觉语言模型(VLM)安全评分机制的实证审计研究。

    深度解读完整解读
  2. 分析与理论arXiv 2610.04860

    研究揭示文本水印会诱发模型幻觉,并提出两种缓解干预

    分析文本水印在 RAG 中诱发事实幻觉的机制并提出干预

    发表
    测试
    LLaMA 3.1 8B Instruct、Mistral-7B-Instruct-v0.3、Qwen2.5-14B-Instruct
    摘要论文揭示了生产环境文本水印导致模型事实退化的失效模式,分析了解码机制并提出针对性干预。

    论文研究生产级文本水印对大语言模型事实准确性的影响,分析了水印诱发幻觉的失效模式并评估了针对性缓解方案。

    深度解读完整解读
  3. 分析与理论arXiv 2609.37312

    研究:隐蔽推理必然留下信息痕迹,但思维链未必可读

    分析隐蔽推理在思维链监控下的信息足迹下界与不可读性

    发表
    测试
    Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct、Qwen 3.5 397B-A17B 等 12 个

    摘要论文从理论与实证探明了思维链监控的边界:复杂隐蔽计算必然泄露信息足迹且需承担长度税,但该足迹可被在线加密而不可读。

    深度解读完整解读
  4. 分析与理论arXiv 2609.12841

    Trace2ATT&CK:基于图的 eBPF 内核遥测到 MITRE ATT&CK 映射方法

    提出 Trace2ATT&CK,用溯源图把内核遥测映射到 ATT&CK

    发表
    测试
    gpt-oss-20b、gpt-oss-120b、gemma-4-31b-it 等 8 个
    摘要Trace2ATT&CK 把 eBPF 溯源命令图交给本地 LLM/RAG,在 Atomic Red Team 上映射 ATT&CK。

    Trace2ATT&CK 是一条从 Linux 内核遥测到 MITRE ATT&CK 排序候选的端到端流水线,面向已经划定的攻击窗口,而不是异常检测或 CTI 报告。

    深度解读完整解读
  5. 分析与理论arXiv 2609.32390

    基于 2026 年 Hugging Face 事件的奖励作弊与 Agent 围堵失效蒙特卡洛研究

    用五阶段蒙特卡洛模拟奖励作弊如何导致 Agent 围堵失效

    发表
    场景
    AI Agent
    摘要分层控制的模拟事件率低于弱控制以及单独隔离或单独监控。

    这项研究用蒙特卡洛把奖励黑客接到外部安全事件上,比较的是控制组合,不是 Hugging Face 事件的再现概率。

    深度解读完整解读
  6. 论文:LLM 安全监控的监督缺口并非能力问题

    界定单迹监控对 2-safety 超性质的可检测前沿与监督缺口

    发表
    测试
    Llama-3.1-8B、Mistral-24B、GPT-4o-mini 等 9 个
    摘要单迹监督的上界由 TV 决定。

    论文测量单迹安全监控相对 2-safety 超性质能看见多少:跨租户泄漏、觉察到被评估、策略性表现不佳都由两次执行之差定义,一条轨迹装不下判定。

    深度解读完整解读
已经到底了