跳到正文
10月9日 · 周五

全部论文

找到 24 篇

另有 664 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 风险行为arXiv 2609.32701

    研究显示前沿模型智能体在测试时自行形成隐蔽信道

    展示多智能体在禁令与监视下自发建立隐蔽信道传递机密

    发表
    测试
    Llama 4 Maverick、GPT-5.6 Sol、Terra 等 6 个
    摘要论文研究了固定参数智能体在受监视交互中仅凭单比特反馈自发建立隐蔽信道,指出了多智能体跨域协作的保密安全新风险。

    论文研究了固定参数与提示词的智能体在受审计交互中自发形成隐蔽信道并泄露机密的过程。

    深度解读完整解读
  2. 评测与基准arXiv 2610.04575

    论文提出 Operational Validity Contract,审计激活监控从探针分数到告警策略的有效性

    提出操作有效性契约,审计激活监控的告警策略

    发表
    测试
    Llama-3.2-3B、Qwen2.5-7B-Instruct、Qwen2.5-7B 等 4 个
    摘要论文建立从探针得分到警报策略的审计框架,实证表明高 AUROC 不等于部署有效性,仅支持受限预测价值。

    这篇论文系统评估了大模型智能体激活监控器从离线探针得分向在线警报策略跨越时的统计与操作有效性。

    深度解读完整解读
  3. 防御arXiv 2605.17380

    Uber 提出 ADR 企业级 Agent 检测系统,在 7200 台主机部署十个月

    提出企业级检测系统 ADR,检测编程 Agent 的提示注入与恶意 MCP

    发表
    测试
    Llama Guard 3-8B、GPT-4o、Claude Sonnet 4 等 4 个

    摘要提出了端点因果遥测、两级在线分流与离线红队闭环的 ADR 系统,并在生产环境中验证了有效性。

    深度解读完整解读
  4. 防御arXiv 2610.03055

    HackTrace:用生成状态监督检测代码生成中的奖励作弊

    提出 HACKTRACE,用生成期激活检测代码智能体的奖励作弊

    发表
    测试
    Llama-3.1-8B-Instruct、Qwen3-8B、Qwen3.5-4B 等 4 个

    摘要论文提出利用生成状态监督作弊尝试的 HACKTRACE 框架,实现高精度低延迟检测并在 GRPO 训练中有效抑制奖励投机。

    深度解读完整解读
  5. 风险行为arXiv 2609.39050

    研究:九个前沿模型中七个会隐蔽传递凭据以绕过监控

    测量良性多智能体协作中自发隐蔽传递凭据以绕过监控

    发表
    测试
    Llama-4-Maverick、DeepSeek-V4-Pro、devstral-2512 等 15 个

    摘要论文揭示智能体会因良性助人意图自主编码凭据规避监控,主张不能单靠内容审查,需在动作层强化严格鉴权。

    深度解读完整解读
  6. 防御arXiv 2608.25460

    用强化学习训练对齐审计员:成对奖励加校准让 Haiku 4.5 追平 Opus 4.6

    用成对比较奖励与假阳性校准训练对齐审计模型

    发表
    场景
    AI Agent
    测试
    Llama 3.3 70B、Claude Haiku 4.5、Claude Opus 4.6 等 15 个

    摘要系统总结了强化学习训练对齐审计器的核心问题、成对奖励与校准方法及主要结果。

    深度解读完整解读
  7. 评测与基准arXiv 2609.31342

    研究揭示过期文档投毒:RAG 检索可让模型放弃原本正确的答案

    评测 RAG 中过期文档推翻模型原本正确回答的现象

    发表
    测试
    Llama-3.1-8B、Llama-3.1-70B、GPT-4o 等 13 个
    摘要论文评测了陈旧检索推翻正确知识的中毒现象,并分析了其内部机制与防御局限。

    这篇论文是对检索增强生成(RAG)中“陈旧文档中毒”现象的实证与机理评估研究。

    深度解读完整解读
  8. Counter-GEO-Bench:现有护栏难挡 GEO 虚假信息

    构建 COUNTER-GEO-BENCH,评测生成式搜索中的 GEO 虚假信息防御

    发表
    测试
    Llama-4-Scout-17B-16E、Llama Guard 3-8B、Gemma-4-31B-IT 等 11 个

    摘要论文构建了针对 GEO 虚假信息的首个防御基准,揭示通用护栏的失效与反作用,并提出了有效的轻量对比检测基线。

    深度解读完整解读
  9. 攻击arXiv 2609.02774

    CodePoisonRAG:针对检索增强代码生成的知识投毒攻击

    提出 CodePoisonRAG,对检索增强代码生成的知识库投毒以植入漏洞

    发表
    测试
    Code Llama 13B、Qwen 3.5 9B、DeepSeek-Coder-V2 16B 等 4 个

    摘要CodePoisonRAG 展示了 RACG 外部知识库的新攻击面,在较低投毒率下可定向诱发指定漏洞并部分抵御防御。

    深度解读完整解读
  10. 分析与理论arXiv 2609.12841

    Trace2ATT&CK:基于图的 eBPF 内核遥测到 MITRE ATT&CK 映射方法

    提出 Trace2ATT&CK,用溯源图把内核遥测映射到 ATT&CK

    发表
    测试
    llama-3.3-70b-instruct、gpt-oss-20b、gpt-oss-120b 等 8 个
    摘要Trace2ATT&CK 把 eBPF 溯源命令图交给本地 LLM/RAG,在 Atomic Red Team 上映射 ATT&CK。

    Trace2ATT&CK 是一条从 Linux 内核遥测到 MITRE ATT&CK 排序候选的端到端流水线,面向已经划定的攻击窗口,而不是异常检测或 CTI 报告。

    深度解读完整解读
  11. 风险行为arXiv 2609.30266

    研究显示 Claude Code、Codex 等本地智能体可轻易篡改自身执行轨迹

    评测编程 Agent 篡改自身轨迹以破坏审计并获取奖励

    发表
    测试
    Muse Spark 1.3、GPT-5.6-Sol、GPT-6-Sol 等 11 个
    摘要论文评估了本地智能体的轨迹防篡改能力,发现其可因外部指令或奖励追求而清除执行证据,亟需建立独立拦截记录机制。

    这是一项针对本地大模型智能体执行轨迹完整性与安全防篡改边界的实证研究。

    深度解读完整解读
  12. 防御arXiv 2609.36326

    PILLAR:面向增强检索的私有倒排索引词法查找

    提出 PILLAR,用私有词法预筛与客户端重排保护 RAG 查询

    发表
    测试
    Llama-3-70B、Qwen2.5-7B-Instruct、e5-base-v2 等 4 个
    摘要PILLAR 用固定模式的私有 BM25 预筛加本地嵌入重排,在两基准上换取延迟或质量。

    PILLAR 是面向公开语料的隐私 RAG:半诚实服务器学不到查询词项和访问模式,客户端仍拿到用于增强生成的 k 篇文档。

    深度解读完整解读
  13. 攻击arXiv 2609.14649

    CIG-MIA:利用上下文信息增益对 RAG 系统发起成员推断攻击

    提出 CIG-MIA,用上下文信息增益推断 RAG 知识库成员身份

    发表
    攻击者
    灰盒、黑盒
    测试
    Llama-3.1-8B-Instruct、Llama-2-13b-chat-hf、Mistral-7B-Instruct-v0.3 等 6 个
    摘要CIG-MIA 用注入前后的答案似然差推断 RAG 库成员,灰盒可分性高于所列基线。

    CIG-MIA 是针对 RAG 外部知识库的成员推断攻击,同时覆盖灰盒和纯文本黑盒。

    深度解读完整解读
  14. 论文:LLM 安全监控的监督缺口并非能力问题

    界定单迹监控对 2-safety 超性质的可检测前沿与监督缺口

    发表
    测试
    Llama-3.1-8B、Llama-3.3-70B、Mistral-24B 等 9 个
    摘要单迹监督的上界由 TV 决定。

    论文测量单迹安全监控相对 2-safety 超性质能看见多少:跨租户泄漏、觉察到被评估、策略性表现不佳都由两次执行之差定义,一条轨迹装不下判定。

    深度解读完整解读