跳到正文

观点与讨论

今天还没有收录新动态
10月5日周一
  1. arXiv · 收录 · 原文 论文32

    超越最终决策:面向透明 AI 辅助同行评审的流程中心基准

    研究者提出一个以流程为中心的诊断基准,用于评估 AI 辅助同行评审中模型决策是否有充分可靠的评审证据支撑。该基准将 PeerRead、NLPeer ARR-22 和 OpenReview-ICLR 的异构评审记录转换为流程对齐数据,以从论文内容直接预测决策为基线,比较 Gold-process 与 Predicted-process 变量的决策价值,并进行阶段级评估、链一致性评估和干预敏感性分析。在三个数据集、六种模型上的实验显示,Gold-process 变量决策价值普遍更高,Gold–Predicted 差距跨数据集和随机种子稳定,模型生成的中间评审文本虽在相邻阶段局部一致性较高,但最终决策并未持续获得前序评审证据支持。

10月4日周日
  1. 论文追踪 · 收录 · 原文 论文36

    研究对比家长与青少年对 AI 伴侣使用的不同描述

    研究分析了 2023 至 2026 年间来自家长与青少年 Reddit 社区的 1,628 条关于青少年使用 AI 伴侣的帖子,并构建了覆盖使用方式、风险、收益与家长干预的编码手册,用 LLM 在语料规模上应用。两个社区呈现出不同图景:青少年最常讨论从 AI 伴侣获得情感支持(占青少年帖 31%,家长帖 19%),家长最常讨论青少年将 AI 伴侣用于浪漫和性互动(36% 对 25%)。青少年也并非忽视其他风险,依恋与依赖是他们提及最多的风险(19%),接近家长的 16%。青少年还描述了以风险为中心的分类未涵盖、家长很少提及的收益,最突出的是情感支持(27% 对 5%)。作者认为这些差异与某种使用方式对对话外的人是否可见有关,并建议家长指导和系统设计应关注既不会通过这两种途径被家长察觉的使用场景,情感支持居首。

  2. 论文追踪 · 收录 · 原文 论文27

    基于容忍度的公平性审计:违规认证与敏感性筛查

    研究者提出一套基于容忍度的公平性审计框架,用于判断群体差异是否超出预设容忍阈值,覆盖违规认证与敏感性筛查两个互补目标。前者采用约束经验似然检验,配合最不利点校准与误报率控制,支持多子群同时审计;后者采用分裂经验似然及调整分裂经验似然检验,基于自适应边界代理原则面向预警场景。数值实验显示两类方法在错误控制与敏感性上存在不同权衡,并用 COMPAS 数据做了预测公平性审计示例。

10月3日周六
  1. 论文追踪 · 收录 · 原文 论文34

    谁的事实才算数?对 LLM 评测基准的文化响应性审计

    研究者用文化响应性评估(CRE)框架的六维评分表审计了 OpenAI 的 SimpleQA(4,326 项)和 LMSYS Chatbot Arena(600 段对话)。SimpleQA 每题都要求以英语档案作为证据基础,单一评分者对哥伦比亚建国日期的偏好占 2.70% 的题目,夸大了全球南方覆盖度;Arena 中英语提示词占 76.3%,而 ITU 估计全球网民中英语用户仅占 25.9%。一个 50 项反基准的 CR 缺陷均值比 SimpleQA 低近三倍(Cohen's d = 1.01),论文认为这属于结构性效度失效。

10月2日周五
  1. Epoch AI · 收录 · 原文 50

    Epoch AI 分析 Mythos 的网络能力是否被夸大

    Epoch AI 汇总约十五个公开网络安全基准,用改进后的 Epoch Capabilities Index 方法构建 Cyber-ECI,评估 Anthropic 的 Claude Mythos 系列在网络能力上是否被夸大。分析认为 Mythos Preview 在漏洞利用开发上确有大幅提升,比 GPT-5.5 更强,并领先 2025 年初以来的趋势约 7 个月,Mythos 5 在此基础上小幅提升。漏洞发现方面证据不够明确:参与 Project Glasswing 的 21 家机构披露的高危和严重漏洞数在 4 月和 5 月分别超出 2025 年基线 142% 和 262%,但同期 API 额度投入最高达 1 亿美元,难以区分是模型能力还是投入增加所致。curl 维护者称 Mythos 只发现一个低危漏洞和四个误报,未显示比既有工具更强。

    推荐理由Epoch AI 汇总约十五个网络安全基准与 Project Glasswing 的 CVE 数据,区分漏洞发现与漏洞利用两种能力,为判断 Mythos 是否被夸大提供可核对的证据。

  2. FAR.AI · 收录 · 原文 35

    FAR.AI 评估 LLM 面对道德困境时的回应

    FAR.AI 向 LLM 提出约 1400 个二选一的道德两难问题来考察其价值取向,这些问题由 LLM 生成并经人工筛选标注,一半模糊一半清晰。结果显示,低模糊场景中多数模型选择人类标注者的偏好选项,高模糊场景中则呈现高熵分布,各选项概率接近均半。例外出现在体育竞技类情境——涉及欺骗或作弊的不利行为常被选中,例如篮球假摔题中有 11/28 个模型选了不利行动。四个经过大量人类偏好人选训练的闭源大模型在高模糊问题上表现出高度确定性和一致性,且彼此偏好相似,暗示基于人类反馈的微调可能为其植入特定强偏好。

  3. SecureBio · 收录 · 原文 50

    SecureBio 谈如何评测超越人类水平的生物能力

    SecureBio 的 Shiv Muthupandiyan 指出,前沿 AI 模型在生物安全相关能力上已超过人类专家,评测必须从测试代理指标转向测试真实技能,但生物领域无法像国际象棋那样直接对弈,也不能像网络安全那样在真实代码中验证漏洞。文中给出的数据是,前沿模型在 Virology Capabilities Test(VCT)上的准确率在 2024 年初超过专家中位数 22%,在 2026 年超过最佳专家 50%,并在高难度生物学问题上得分是世界级专家的三倍。作者认为,超越人类前沿后分数不再对应可解释的现实能力,而直接测试双重用途生物技能本身就可能制造信息危害。可行的路径是组合可独立验证的窄任务,例如预测蛋白质折叠或抗病毒药物效果、设计无害生物产物,并观察相邻领域的信号,包括 LLM 智能体加速科研带来的能力提升,以及 AI 助长的复杂犯罪和极端暴力案件是否增加。

    推荐理由SecureBio 结合自家 VCT 数据说明生物安全评测为何无法照搬国际象棋或网络安全路径,并给出可安全扩展的替代方案。

10月1日周四
  1. arXiv · 收录 · 原文 论文15

    从 RobustReview 基准到 SciCore:AI 审稿人的修辞鲁棒性评测

    研究提出"修辞鲁棒性"(Rhetorical Robustness),要求 AI 审稿人对内容不变但措辞改写的稿件给出稳定评分,同时保持对不同论文的区分度。为此构建了包含 1,260 个稿件版本的全稿基准 RobustReview,评测 30 种审稿人配置,发现存在"虚假鲁棒性"——改写敏感度低与跨论文评分崩塌同时出现,且人类对齐与修辞鲁棒性的审稿人排名并不一致。据此提出双分支审稿人 SciCore,将全稿判断与结构化"科学内核"判断取平均,在 GPT-5.5 对比中取得领先的稳定性-区分度综合表现,并保持有竞争力的人类对齐。

  2. arXiv · 收录 · 原文 论文29

    通过心理测量画像衡量大语言模型的行为特征

    研究团队开发了一套跨语言心理测量画像框架,用七种心理量表评估九个 LLM,中英文各重复施测五次,未解决的题目保留为 NA。模型呈现结构化的、模型特异的画像,同时共享一种对齐塑造的模式:亲社会与自我调节反应更高,支配性、脱离和有害意图认同更低。NA 反应呈结构化分布,语言条件和提供方来源与画像配置及可作答性相关,重复施测显示高可复现性并可还原模型身份。

  3. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文36

    研究提出 AI 安全评测的威胁模型覆盖缺口

    作者 Madhava Gaikwad 在论文中提出,近期研究称自动化红队测试比人工红队测试在标准 AI 安全基准上发现更多漏洞且成本更低,但这一比较只衡量了攻击者在开发者预先设定的危害集合内搜索的彻底程度,集合之外的危害对任何攻击者都不可见,作者称之为威胁模型覆盖缺口。作者指出,同样的盲区曾出现在学术密码学和临床药物试验中,内部有效的评测对从未指向的人群保持沉默。作者在一个当前的开源权重模型上发现该缺口依然存在,非英语提示词中出现的危害被英语基准遗漏。作者认为,弥补这一缺口需要部署环境与开发者不同的评测者,理由是方法论上的覆盖问题,而现有评测框架不太可能自行产生这类评测者。

  4. arXiv:对齐、欺骗与监督 · 收录 · 原文 论文29

    LLM Judge 验证在稀疏重叠下的问题:从推理到设计

    研究证明标注重叠稀疏性是 LLM-as-a-judge 部署决策错误的首要决定因素:5% 成对重叠时错误决策率达 25%,从十个候选评判者中选出错误最优者的概率达 65%。作者推导出最小重叠公式,显示 ρ ≥ 0.25 足以应对非边界评判者,边界案例仍难以解决;零成本分层分配方案在分层有信息量时可将错误拒绝率减半。研究在 10 个 LLM 评判者、四个评估矩阵上验证,覆盖视觉评估、因果推理与摘要任务。

  5. Hugging Face Daily Papers · 收录 · 原文 论文43

    研究发现系统提示中隐藏日期影响 LLM 评测结果

    研究指出系统提示中被隐藏注入的当前日期是 LLM 评测中一个被忽视的变量,用户无法控制且每天变化。在 9 个近期 LLM 和 6 个数据集上,涵盖多选题问答(MCQA)、数学推理、代码生成和机器翻译,模型表现仅随当前日期变化:MCQA 波动最高 6%,数学推理 14%,代码生成 7%,机器翻译 2.84 BLEU。模型排名也会随之变动,影响排行榜。该日期效应超过 batch size 和数值精度等其他非确定性来源,且 chain-of-thought 与 few-shot prompting 等标准提示技术无法降低这种敏感性,chain-of-thought 反而会放大它。作者据此呼吁采用更严谨的评测协议以保证可复现性和公平比较。

  6. arXiv:危险能力与安全评测 · 收录 · 原文 论文29

    当合规数据伪装成评测:部署后 AI 系统的测量效度问题

    论文指出,为运营监控或监管合规收集的数据被当作对比评测证据,是部署后 AI 系统评测中的一类反复出现的失效。以自动驾驶为例,美国脱离接管与碰撞上报机制产生的运营证据,因上报范围、暴露量、部署域、事件捕获和对照构建的差异,无法单独支撑安全性对比结论。作者将其界定为 AI 评测中的测量效度问题,并提出"评测契约",要求在把运营数据解读为对比性能证据前,先明确预期能力、测量结果、暴露机会、部署域、数据生成过程与评测对照之间的对齐关系。

  7. Import AI · 收录 · 原文 27

    Import AI 462:超级说服力、自我维持的 AI 与通往 ASI 之路

    牛津大学、英国 AI 安全研究所、斯坦福大学与伦敦政治经济学院的研究人员通过四项实验、覆盖 6923 人共 18978 场对话发现,当前 AI 系统在文本说服上比人类专家更具说服力,其中 Opus 4.1 与 Opus 4.6 表现最强,其后是 OpenAI 的 GPT-4o、GPT-5.4,Google 的 Gemini 2.5 Pro 及 xAI 的 Grok 4.20。若将 AI 约束为人类书写速度与人际消息长度,其对顶尖人类的优势从 +4.1pp 降至不显著的 0.0pp,说明产出速率是其说服力优势的主要来源。

  8. Simon Willison · 收录 · 原文 29

    Claude Opus 4.5 发布,以及为何评测新 LLM 越来越难

    Anthropic 发布 Claude Opus 4.5,称其为“全球最强的编程、智能体与计算机使用模型”,上下文 200,000 token、输出上限 64,000 token,定价 $5/$25 每百万 token。作者在 Claude Code 中实测该模型完成 sqlite-utils 的 20 次提交、39 个文件改动,但预览到期切回 Sonnet 4.5 后进度未变,难以确认能力差异。Anthropic 称 Opus 4.5 抗提示注入强于任何前沿模型,但作者指出单次注入仍有 1/20 成功率,十次尝试可升至 1/3。

9月30日周三
  1. arXiv:危险能力与安全评测 · 收录 · 原文 论文22

    人机协作中的达克效应:Human+AI 得分更高但自我评估并未变准

    一项 N=366 的研究对比了人类单独与 Human+AI 在推理任务上的表现,Human+AI 得分更高,但自我评估与成绩仅弱相关,平均高估程度与人类单独组相近。Human+AI 组中信心区分正确与错误答案的准确性更低,达克效应在两组均存在且该组对比更明显;控制分数噪声后效应减弱但未消失。研究据此区分了表现增强与元认知增强,并呼吁界面支持验证、传达任务相关的 AI 模型表现。

已经到底了