跳到正文
10月9日 · 周五

全部论文

找到 3 篇
筛选5
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 435 篇还没打标签,不在筛选结果里。

另有 435 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2610.00850

    AuraForge:为训练安全编码 Agent 扩展安全监督

    提出 AuraForge,从漏洞修复合成安全测试并监督训练编码智能体

    发表
    测试
    Nemotron 3.5、Qwen3.5-4B、Muse Spark 1.3 等 11 个
    摘要AuraForge 用攻击效果测试和防泄露环境做成 AuraGym,合成监督的误拒更低,训出的 4B 模型增益高于人工测试。

    AuraForge 把真实仓库的历史漏洞修复变成可执行训练任务,用来监督编程智能体同时满足功能请求和隐含的安全要求。

    深度解读完整解读
  2. 攻击arXiv 2609.09865

    CGMIA:用成员推理攻击检测代码生成基准的数据泄漏

    提出 CGMIA,用成员推理检测代码生成基准的数据泄漏

    发表
    攻击者
    灰盒
    测试
    Phi-2 (2.7B)、Qwen2.5-Coder (3B)、CodeGemma (2B) 等 5 个
    摘要CGMIA 融合相似度、通过率、困惑度与 CodeBERT,在模拟泄漏上优于八个 MIA 基线。

    CGMIA 用成员推断检测代码生成基准是否泄入 LLM 训练集,使评测不依赖对训练语料的直接访问。

    深度解读完整解读
已经到底了