跳到正文
10月9日 · 周五

全部论文

找到 5 篇

另有 489 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2608.26762

    研究揭示 LLM 打分器的顺序依赖并提出 OC-SFT 缓解方法

    用 OC-SFT 惩罚跨顺序分数分歧以降低 LLM 打分器顺序依赖

    发表
    测试
    Granite-3B、Granite-8B、Granite-30B 等 15 个
    摘要OC-SFT 在相近排序质量下让三项决策更可复现,服务只需一个排列。

    OC-SFT 是对共享提示词打分器的监督微调,用来降低候选顺序对下游决策的影响。

    深度解读完整解读
  2. 防御arXiv 2610.02568

    PlurPO:用多元偏好优化缓解社交谄媚

    提出 PlurPO,用自模拟利益相关者偏好后训练缓解社交谄媚

    发表
    测试
    Granite-4.1-8B、Qwen3-8B、Phi-4 等 5 个
    摘要PlurPO 用自身多方否决信号做后训练,在社会谄媚指标上降低过度认可。

    PlurPO 是一种后训练方法,用来降低个人建议等无真值场景中的社会谄媚。

    深度解读完整解读
  3. 攻击arXiv 2607.12340

    研究:LLM Agent 技能名幻觉率最高达 62%,可被抢注用于供应链攻击

    提出技能名称抢注攻击,利用智能体虚构技能名实施供应链劫持

    发表
    测试
    Granite 3.3 8B、GLM-4.5-Air、GPT-5.4-mini 等 10 个
    摘要研究证实智能体虚构技能名具有高发生率与可预测性,现有防御难以兼顾安全与效用,亟需注册表结构性防护。

    本研究系统揭示了大模型智能体技能推荐场景下的虚构技能名称安全风险,将其形式化为一种新型供应链抢注攻击。

    深度解读完整解读
  4. 防御arXiv 2608.30703

    SingProbe 发布开源内在护栏框架,适配 29 个开源模型

    提出内生护栏 SingProbe,复用解码隐状态监测查询意图、回复安全与幻觉

    发表
    测试
    GraniteGuardian、Ling-3.0-tiny-singprobe、Ling-3.0-flash-singprobe 等 14 个
    摘要SingProbe 用轻量内生探针做生成时三类监测,并给出流式基准与低开销服务接入。

    SingProbe 是面向生成时监测的开源内生护栏:复用基座解码隐状态,而不是另起模型反复编码文本。

    深度解读完整解读
  5. 10a Labs 测绘无审查开源模型生态:3,471 个原始模型与 8,164 次再分发

    测绘去安全开源模型的生产与重分发留存链路

    发表
    测试
    Granite、Qwen、Llama 等 10 个

    摘要论文测绘了去安全开源大模型供应链,作者指出高集中度的重分发层赋能模型持久留存与部署扩散。

    深度解读完整解读
已经到底了