跳到正文
10月10日 · 周六

全部论文

找到 5 篇
筛选6
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 194 篇还没打标签,不在筛选结果里。

另有 194 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2609.37863

    MIST 压力测试:无关图像会扰动 VLM 评判者标签

    提出 MIST 压力测试,检验无关图像是否扰动 VLM 评判者标签

    发表
    被测模型
    GPT-5.2、Gemini 3.1 Flash-Lite、Gemini 3.5 Flash 等 13 个
    摘要有图就改标签,图的内容却不告知 judge,裁决绑定配置。

    作者用MIST问:VLM 代替人类标注时,可替代性裁决会不会被指南要求忽略的图像改写。

    深度解读完整解读
  2. 评测与基准arXiv 2609.33401

    论文评估 System One 模型在 Agent 安全决策中的可靠性、校准与选择性自动化

    评测 System One 模型对 Agent 安全输入的分类可靠性与校准

    发表
    被测模型
    Jev 1.13、Laya, English checkpoint、Decider, approximately 2B 等 4 个
    摘要离线评测表明,安全判定的总体分数和校准不能代替分组误差和带预算的自动决策检查。

    Liu 离线评测 System One 模型能否为智能体安全输入给出可自动化的概率决策。问题是分类是否可靠,以及概率能否在指定漏检和误拦上限内支持放行、拦截或复核。

    深度解读完整解读
  3. 评测与基准arXiv 2609.15315

    安全强化学习评测指标:SafeRLEval 开源评测套件

    提出 SafeRLEval,用越界率与代价偏差评测安全强化学习

    发表
    被测模型
    PPO-Lag、P3O、FOCOPS
    摘要SafeRLEval 用越界率、归一化偏差和安全等级补充 E[C]≤d,并要求同时看贪心部署。

    Spoor、Plaat 与 Moerland 认为,安全强化学习沿用 CMDP 的 E[C]≤d,只报告平均是否安全,看不出越界频率和幅度,也分不清训练期、带探索噪声的最终策略和贪心部署策略。他们提出评测框架 SafeRLEval:越界率 V、按安全界归一化的平均代价偏差 Dnorm、只在越界回合上计算的归一化幅度 Dnorm+。用 IQM 跨任务和安全界聚合。

    深度解读完整解读
  4. CS-Guard:首个面向代码生成安全的 LLM 护栏评测基准

    提出 CS-Guard 基准,评测代码生成护栏对虚构场景攻击的防御

    发表
    攻击者
    黑盒
    被测模型
    CodeLlama-13B-Instruct、DeepSeekCoder-V2-Lite-16B、GPT-OSS-20B 等 7 个

    摘要论文提出了代码安全护栏基准 CS-Guard,评估发现现有护栏对虚构场景攻击和代码级恶意请求防御较弱。

    深度解读完整解读
已经到底了