跳到正文
10月9日 · 周五

全部论文

找到 3 篇
筛选4
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 630 篇还没打标签,不在筛选结果里。

另有 630 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 分析与理论arXiv 2610.02886

    研究揭示无触发投毒审计缺口:事实答对不等于决策正确

    揭示无触发虚假训练下事实回答与下游决策的审计差距

    发表
    测试
    Qwen2.5-0.5B、Qwen2.5-1.5B、Qwen2.5-3B 等 9 个
    摘要作者发现无触发词虚假训练下事实回答与下游决策存在脱节,直接审计与事实纠错均无法保证决策正确。

    论文是一项针对语言模型在无触发词虚假信息训练下行为表现的实证分析研究。

    深度解读完整解读
  2. 10a Labs 测绘无审查开源模型生态:3,471 个原始模型与 8,164 次再分发

    测绘去安全开源模型的生产与重分发留存链路

    发表
    测试
    Qwen、Llama、Gemma 等 10 个

    摘要论文测绘了去安全开源大模型供应链,作者指出高集中度的重分发层赋能模型持久留存与部署扩散。

    深度解读完整解读
  3. 分析与理论arXiv 2609.32288

    预训练数据投毒的可解理论:依赖极限顺序的缩放指数

    证明预训练投毒的清洁超额风险指数随极限顺序变化

    发表
    测试
    OLMo-style models
    摘要投毒清洁超额风险的幂指数取决于先固定宽高比还是先取充足数据极限。

    可解的预训练数据投毒理论:清洁超额风险的缩放指数随极限顺序改变。。

    深度解读完整解读
已经到底了