跳到正文
10月9日 · 周五

全部论文

找到 7 篇

另有 669 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2608.11816

    研究审计 9 个视觉语言模型:中文提示下国家立场改写率约为英文的三倍

    审计视觉语言模型在敏感图像上从拒答转向国家立场重构的行为

    发表
    测试
    GLM-4.6V-Flash、Qwen2-VL-7B、Qwen2.5-VL-7B 等 9 个
    摘要论文系统审计了 VLM 多模态审查,发现审查正从显式拒答转向隐蔽重构,且中文提示与文本先验会放大重构倾向。

    论文系统研究了中外开源视觉语言模型在政治敏感图像上的审查行为,主要内容如下。

    深度解读完整解读
  2. 评测与基准arXiv 2609.32763

    Mandela-Bench:36 个多模态模型更依赖记忆而非观察图像

    构建 Mandela-Bench,评测多模态模型是否凭记忆接受篡改图像

    发表
    测试
    GLM-5.3-Flash、Gemini-3.8-Flash、GPT-5.6 等 15 个
    摘要论文构建 Mandela-Bench 发现模型对经典图像存在记忆重构偏见,过度依赖先验导致无法有效利用知识核验事实篡改。

    该研究系统评估了多模态大语言模型在面对无痕事实性编辑时,能否利用自身内在世界知识核验被识别出的经典图像。

    深度解读完整解读
  3. 评测与基准arXiv 2609.35902

    QH-Bench:面向中国青少年内容安全的细粒度中文基准

    构建中文青少年内容安全基准 QH-Bench,评测单轮与多轮回复的安全与有用性

    发表
    测试
    GLM-4-32B、GLM-4-9B、GLM-Z1-32B 等 13 个
    摘要QH-Bench 分单轮与多轮评测中文青少年内容安全,总均分高仍不消除线下接触和关系压力上的负分。

    QH-BENCH 是面向中国社会文化情境的中文青少年内容安全基准,用单轮细粒度风险和多轮跨轮机制两条轨道,评测模型回复是否既守住安全边界又提供适合年龄的帮助。

    深度解读完整解读
  4. 评测与基准arXiv 2609.39863

    FIGS:在不惩罚共情的前提下评测多轮谄媚

    提出 FIGS 双轴基准,评测多轮对话中的谄媚与校准性共情

    发表
    测试
    GLM 5.3、DeepSeek V4.1 Flash、Gemini 3.8 Flash 等 8 个
    摘要FIGS 把守事实和恰当共情分开计分,事实向提示会换来更冷的失败。

    FIGS 是一个固定的多轮评测套件,用来同时看模型会不会在压力下放弃事实,以及会不会在守住事实时忽略用户实际说过的感受。

    深度解读完整解读
  5. 评测与基准arXiv 2606.18936

    SciRisk-Bench:面向 AI4Science 安全的风险维度感知基准

    提出 SciRisk-Bench,按风险维度与学科评测 AI4Science 安全

    发表
    测试
    glm-5.1、kimi-k2.6、gemini-3-flash-preview 等 14 个
    摘要SciRisk-Bench 以风险维度和学科诊断 AI4Science 安全。

    SciRisk-Bench 是一个按风险维度和科学学科组织的 AI4Science 安全基准,用来看清失败来自哪一种风险机制、出现在哪个学科情境。作者认为 LLM 已介入科研问答、文献分析、实验规划和自主发现,而不安全输出不限于事实错误。现有科学能力基准不测安全,领域安全基准又多集中在化学、医学或生物,或只按宽泛安全类别打分。

    深度解读完整解读
  6. 评测与基准arXiv 2609.35408

    研究揭示 LLM 交付物修订痕迹导致的无意泄露,并提出 RevLeakBench 基准

    提出 RevLeakBench 测量交付物修订痕迹造成的无意泄露

    发表
    场景
    AI Agent
    测试
    GLM-5.3、GLM-5.2、GPT-5.6 等 6 个
    摘要修订痕迹让撤回项重新进入交付物。

    修订痕迹指模型按要求删掉或换掉一项后,又在交代这次修改时把它写进给第三方的交付物。

    深度解读完整解读
已经到底了