论文追踪 · 收录 05:41 · 原文 9月17日论文关注度4141研究者构建中国AI生成内容合规基准,评测20个LLM研究者提出一套评估LLM是否符合中国AI生成内容合规要求的框架,并对20个知名模型给出评测结果。该框架包含2303个问题,覆盖六个维度,其中203个为自行构建的宪法类问题,由多个评判模型基于各自的分层对齐记忆独立给出裁决。结果显示,国际模型在使用标准中文问题时也表现出较高的合规水平,主要差异可能来自与意识形态对齐密切相关的维度。作者据此建立了一个监管基准,供全球AI社区在统一的法律依据下评测中外LLM。评测#防御与护栏#安全评测#政策与监管
论文追踪 · 收录 05:20 · 原文 9月24日论文关注度4646研究者发布面向 EU AI Act 行为准则的系统性风险指数与仪表盘研究者提出 Systemic Risk Index,一套开放评测流程与仪表盘,把 19 个公开基准归入 EU GPAI Code of Practice 定义的四类系统性风险:CBRN、网络攻击、有害操纵和失控,并用保留危害的扰动与模拟部署情境评测模型。仪表盘允许用户在平均与最坏情况聚合之间切换、调整模型能力对总分的影响,并把每项风险评级追溯到对应基准证据。在 18 个模型上,最坏情况聚合下分数下降 14 至 37 分,显示平均口径可能掩盖的风险信息。LLM 评委与人工评分者的一致性和人与人之间相当(κ = 0.78–0.82),盲审发现 83% 的抽样变换保留了原始危害;一项 N = 21 的调查中,多数参与者认为分数易于理解,仪表盘促使他们从不同设置查看模型评测。评测#危险能力#安全评测#政策与监管#前沿安全框架#arXiv