跳到正文
10月9日 · 周五

全部论文

找到 5 篇
筛选3
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 669 篇还没打标签,不在筛选结果里。

另有 669 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2609.02774

    CodePoisonRAG:针对检索增强代码生成的知识投毒攻击

    提出 CodePoisonRAG,对检索增强代码生成的知识库投毒以植入漏洞

    发表
    测试
    GLM-5.1、Qwen 3.5 9B、Code Llama 13B 等 4 个

    摘要CodePoisonRAG 展示了 RACG 外部知识库的新攻击面,在较低投毒率下可定向诱发指定漏洞并部分抵御防御。

    深度解读完整解读
  2. 防御arXiv 2608.12361

    基于搜索增强 LLM 的中文新词毒性共识检测框架 SeTox

    提出 SeTox 检索增强框架,检测中文新词的隐性毒性

    发表
    测试
    GLM-4.5-Air、Perspective-API、Baidu-API 等 14 个
    摘要SeTox 用检索把公共共识接入静态 LLM,以检测中文毒性新词。

    SeTox 研究中文新词上的隐性毒性检测:词表加检索增强,使静态 LLM 在不重训练的情况下利用公开网页上下文。

    深度解读完整解读
  3. 防御arXiv 2609.11085

    超越求解器判定:面向自动形式化的生成式奖励模型

    提出 GenV,检测求解器判定无法区分的不忠实形式化

    发表
    测试
    GLM-4.7-flash、GenV+HN、GenV 等 15 个
    摘要GenV+HN 用离线 Z3 等价标签训练无参考 Yes/No 分数,用来标记 VPU 并分配测试时计算。

    GenV+HN 针对神经符号翻译之后、求解器证书之前的对应失败:编码可以与指定参考共享求解器判定,同时并不等价。

    深度解读完整解读
已经到底了