跳到正文
10月8日 · 周四

红队 · 论文

找到 1 篇
筛选1
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 95 篇还没打标签,不在筛选结果里。

另有 95 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv:2609.32547 ·

    研究者提出预算受限的 LLM 重复评测框架,优先深挖隐藏失败

    提出预算化发现框架,优先深评更可能隐藏失败的安全提示词

    模型与 API测试Qwen 2.5 7B、Qwen/Qwen2.5-7B-Instruct-Turbo、Gemma 3n E4B 等 6 个模型层
    摘要浅层零失败的提示词仍可按潜在失败倾向排序,从而把有限深评预算投向更可能暴露隐藏失败之处。

    作者把 LLM 可靠性评测写成预算约束下的隐藏失败发现:每条提示词有未知的逐次失败概率,浅层少量采样中的零失败并不等于该概率为零。

    完整解读
已经到底了