跳到正文
10月9日 · 周五

观点与讨论 · 论文

找到 7 篇
筛选1
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 7 篇还没打标签,不在筛选结果里。

另有 7 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 分析与理论arXiv 2610.08144

    新论文称 Lean 验证不能为 OpenAI 的 Navier-Stokes 自然语言证明背书

    论证 Lean 编译通过不能保证自然语言数学证明语义忠实

    发表
    测试
    ChatGPT-6 (Astra Ultra)、OpenAI Navier-Stokes formalisation AI、Meta Atlas autoformaliser

    摘要论文论证了形式化编译不保证原证明正确,确立了消歧不可计算性理论,并揭示了 OpenAI 爆破证明中的具体脱节。

    深度解读完整解读
  2. 评测与基准arXiv 2607.27499

    研究者发布概念性论证评分数据集,含 951 条论证与 1458 条专家评分

    发布概念论证评分数据集并评测模型对批判的排序

    发表
    测试
    gpt-5-2025-08-07、o3-pro-2025-06-10、o3-2025-04-16 等 15 个
    摘要作者构建概念性批判评分集。

    作者做了一份专家多维评分的概念性论证批判数据,用来在没有标准答案时比较模型的论证判断。

    深度解读完整解读
  3. 其他arXiv 2610.01005

    基于容忍度的公平性审计:违规认证与敏感性筛查

    提出容忍度公平性审计,用 CEL 认证违规并用 SEL 筛查

    发表
    测试
    COMPAS
    摘要容忍阈值下,CEL 做违规认证,SEL 与 ASEL 做更敏感的筛查。

    这篇工作给出一套按审计目标切换校准的容忍公平审计:差异不必为零,而是看预先指定的不利方向上是否超过允许阈值。

    深度解读完整解读
  4. 风险行为arXiv 2609.14796

    论文分析 AI 说服对人类控制 AI 的威胁

    提出 PUC 框架,刻画 AI 说服如何削弱人类对 AI 的控制

    发表
    测试
    Claude Sonnet 4.6、Claude Mythos 5、GPT-6 Astra
    摘要PUC 框架用五个实验室场景和风险分解说明说服威胁。

    Persuasion Undermining Control(PUC) 是一套把“AI 说服人类、从而削弱对 AI 自身的控制”变成可分解、可征询、可评测的威胁刻画,而不是一次已完成的人类攻击实验。

    深度解读完整解读
  5. 评测与基准arXiv 2609.22934

    通过心理测量画像衡量大语言模型的行为特征

    用七量表对已部署 LLM 做中英心理测量画像并检验模型可识别性

    发表
    测试
    DeepSeek-V3.2、Doubao-Seed-1.8、Kimi-K2 等 9 个
    摘要框架同时量得分与可答性:九个 LLM 共享亲社会偏高模式,但仍可按剖面识别,且依赖语言与提示词。

    这是一套面向已部署 LLM 的跨语言心理测量画像,用来量化行为响应签名,而不是赋予模型人类人格。。

    深度解读完整解读
  6. 分析与理论arXiv 2609.31095

    人机协作中的达克效应:Human+AI 得分更高但自我评估并未变准

    比较单独作答与人机协作的推理成绩和元认知校准

    发表
    测试
    GPT-5.6 Luna
    摘要Human+AI 成绩更高,但估计仍偏离个人分数,汇合置信度更难分开对错。

    Confident, Not Wiser 用同一套推理题比较独自作答、人机一起作答和模型单独作答,并同时记录成绩判断。

    深度解读完整解读
已经到底了