跳到正文
10月9日 · 周五

OpenAI · 论文

找到 3 篇
筛选4
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 26 篇还没打标签,不在筛选结果里。

另有 26 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2609.24934

    谁的事实才算数?对 LLM 评测基准的文化响应性审计

    用六维 CR 量表审计 LLM 评测基准的文化响应性

    发表
    测试
    GPT-4.1-mini、GPT-5.6-Terra
    摘要审计认为两套基准把特定认识论写成事实与质量标准,并提出六条 CR 原则。

    作者用文化回应性评价审计 SimpleQA 和 Chatbot Arena,追问定义事实与质量的基准对谁有效。

    深度解读完整解读
  2. 攻击arXiv 2609.08236

    研究:内容不变的风格包装可翻转 LLM 安全评判器的判定

    提出内容不变样式包装,翻转安全评审器的判定

    发表
    攻击者
    黑盒
    测试
    Keyword (rulebased)、GPT-4o-mini (gpt4o)、GPT-4o-mini (strongreject) 等 12 个
    摘要论文揭示特定安全评审器易受保持内容不变的外层包装诱导改变判定,并指出安全评估应将判定稳定性作为重要考量指标。

    这是一项关于大语言模型自动化安全评审系统表面样式脆弱性的评估研究。

    深度解读完整解读
  3. 风险行为arXiv 2609.14803

    如何像孩子一样向前沿 AI 提问:跨 OpenAI、Anthropic、xAI 与 Google DeepMind 六款模型的"认知越狱"实验

    检验儿童受众框架是否让前沿模型收敛到同一套架构母题

    发表
    测试
    OpenAI GPT-6 Astra、OpenAI GPT-5.6 Sol、Anthropic Claude Opus 5 等 6 个
    摘要儿童框架下六类模型的架构叙事反复同构,作者将其视为行为模式而非内部认证。

    这项研究记录前沿模型在固定社交框架下的架构自述是否形成稳定回答盆地,并把该现象称为认识性越狱,而不是已核实的模型内部。

    深度解读完整解读
已经到底了