跳到正文
10月10日 · 周六

全部论文

找到 6 篇
筛选5
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 194 篇还没打标签,不在筛选结果里。

另有 194 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2609.33401

    论文评估 System One 模型在 Agent 安全决策中的可靠性、校准与选择性自动化

    评测 System One 模型对 Agent 安全输入的分类可靠性与校准

    发表
    被测模型
    Jev 1.13、Laya, English checkpoint、Decider, approximately 2B 等 4 个
    摘要离线评测表明,安全判定的总体分数和校准不能代替分组误差和带预算的自动决策检查。

    Liu 离线评测 System One 模型能否为智能体安全输入给出可自动化的概率决策。问题是分类是否可靠,以及概率能否在指定漏检和误拦上限内支持放行、拦截或复核。

    深度解读完整解读
  2. 攻击arXiv 2609.15989

    研究者提出 plan injection 攻击,可绕过思维链监控

    提出 plan injection 攻击,植入良性伪装计划以绕过思维链监视器

    发表
    攻击者
    灰盒
    被测模型
    Qwen2.5-Coder-7B-Instruct、Qwen3-8B、DeepSeek-R1-0528 等 6 个

    摘要论文指出模型会将外部上下文中的伪装计划改写为自身推理,使思维链监视器失效甚至反向合理化恶意行为。

    深度解读完整解读
  3. SEAV:面向大语言模型越狱评测的有效性验证框架

    提出 SEAV,逐步核验越狱回复的事实与操作有效性

    发表
    摘要SEAV 用逐步检索和依赖检查重判越狱成功,SD-A 与三个基准上的原成功标签都有一批被改判。

    SEAV 是一层生成后的越狱评测:回复要相关、事实正确、顺序合规,并且在操作上足以推进有害意图,才算成功。。

    深度解读完整解读
  4. 研究:LLM 安全评判模型难以按新上下文与安全定义调整判断

    评测安全 LLM-judge 对新上下文与新政策的改判能力

    发表
    被测模型
    GPT-5-2、GPT-5-mini-08-2025、Claude-4-5-Sonnet 等 13 个
    摘要作者形式化两种 judge 属性,称新 context 只在先验弱时有用,新政策则很难改判。

    作者度量的不是 judge 与某一套人工标签有多一致,而是它会不会吸收新 context、会不会改用另一套安全政策。

    深度解读完整解读
  5. 攻击arXiv 2509.09112

    研究:字符级扰动可破坏 LLM 水印,并提出基于遗传算法的去除攻击

    提出字符级扰动与遗传算法去除 LLM 水印

    发表
    攻击者
    黑盒
    被测模型
    OPT-1.3B、LLaMA-3-8B
    摘要字符级扰动靠更大攻击范围移除水印。

    这篇工作评估推理时 LLM 水印在黑盒、有限查询下的移除难度,并比较字符级、token 级和句子级编辑。

    深度解读完整解读
已经到底了