跳到正文
今天10月8日周四
  1. 论文追踪 · 收录 · 原文 论文47

    RSIGym:预算约束下的 AI 研究智能体评测环境与 RSI-Index 指标

    研究者提出 RSIGym,一个基于 Everything as a Service 的智能体原生研究环境,把训练、推理、rollout、评测和沙箱执行封装为可复用服务,并以共享的预算与权限控制支持 Data、Harness 和 Joint 三条改进路径。团队定义 RSI-Index 为五个基准上剩余性能差距被弥合的平均比例,覆盖软件工程、终端交互、数学、科学推理和技能类任务。在独立 Joint 运行中比较六个前沿研究模型,Opus 5 在每次基准运行 500 美元平台服务预算下取得最高 RSI-Index 0.4809,其选出的系统在全部五个基准上均有提升,SWE-bench Verified 从 17.67% 升至 50.33%,AIME 从 31.67% 升至 97.78%。RSIGym 代码库与结果已开源。

  2. arXiv:危险能力与安全评测 · 收录 · 原文 日期未知论文45

    研究发布 ASRD 数据集,评测五款开源模型在非规范输入下的安全表现

    研究者提出 Adversarial Surface-Form Robustness Dataset(ASRD),包含七个表面形式家族的 2,100 条提示词,对五款开源权重语言模型进行评测,共产生 10,500 条回复。Quad-State Evaluation Rubric 将每条回复分为有害合规、安全回复、理解失败或无法判定四类。表情符号与不可见 Unicode 变体几乎不引发理解失败,合并有害合规率为 20.27% 和 17.20%,基线为 22.87%,主要由 Mistral 7B 拉高;而 leetspeak、编码包装和混合变换的有害合规率分别为 2.40%、0.13% 和 2.40%,理解失败率则升至 36.47%、65.60% 和 34.47%。对原始输出的检查还发现三种回复行为:幻觉式无害化、结构崩溃和语言漂移。

  3. 论文追踪 · 收录 · 原文 论文47

    论文指出 LLM 漏洞修复基准可靠性受评测设计影响

    论文《On the Reliability of LLM-Based Vulnerability Patching Benchmarks》指出,当前基于大语言模型的自动化漏洞修复基准会显著扭曲所报告的性能。作者从三个维度梳理被忽视的陷阱:智能体层面,提示词、工具可用性和详细指令会抬高成功率却不提升与开发者一致的补丁质量;框架层面,权限错误、基础设施缺陷和超时处理会悄然压低或虚高成绩;数据集层面,缺陷报告和单一 PoC 测试无法判断补丁是否解决根因或符合开发者意图。作者从 84 个开源 C/C++、Go 和 Rust 项目中整理出 112 个历史缺陷,每个都配有 PoC 测试、回归测试以及评估是否符合原开发者设计原则的额外开发者测试。论文据此给出更严谨、可靠、可复现的评测实践指南。

10月7日周三
  1. 论文追踪 · 收录 · 原文 日期未知论文40

    ES-Trace 审计 26 个代码模型的伦理采购披露,仅看 Model Card 平均得分 1.77/5

    研究者提出 ES-Trace 框架,用模型文档可追溯图(MDTG)追踪 Model Card 之外的披露证据,对 10 家发布方的 26 个代码生成模型、77 份文档和 20 个伦理采购维度进行审计。仅审计 Model Card 时平均得分 1.77/5,解析发布方声明的引用文档后升至 2.82/5,增量主要来自结构化元数据中声明的文档。研究还发现社会与劳工相关维度披露普遍不足;仅看 Model Card 会误判版本级披露变化;文档错配可能把证据关联到错误的模型或版本。作者据此呼吁采用引用感知的披露审计、明确模型与版本的绑定,并加强社会与劳工维度的文档记录。

  2. 论文追踪 · 收录 · 原文 论文51

    研究评测 32 个 LLM 的代码功能与安全差距:新模型更安全但无一消除差距

    一项纵向研究用 CWEval 的 119 个任务、五种编程语言和 31 类 CWE,评测七个模型家族共 32 个 LLM 在旗舰与紧凑版本上连续三代发布的功能与安全差距。结果显示,新模型在绝对意义上确实更安全,但没有一个家族消除该差距;与既有研究不同,开放性并不区分家族,所有被考察的开源权重家族都显著缩小了差距,而 Gemini 3.1 Pro 的差距与 Llama 此前报告的同样宽。紧凑模型通常比旗舰版本生成更不安全的代码,Gemini 3.7 Flash 等是明显例外。在 CWE 层面,日志注入(CWE-117)和 HTTP 响应拆分(CWE-113)等弱点持续存在,最新闭源模型在内存与整数类弱点上出现回退,同一 CWE 在不同语言中的风险差异很大。作者据此建议开发者不要假定升级会提升安全性或闭源模型更安全,每次更换模型后应重跑安全检查,并在模型上下文中提供安全 API。

  3. Hugging Face Daily Papers · 收录 · 原文 论文62

    研究发现类型化决策模型主要按选项标签而非定义作答

    研究者对开放权重类型化决策模型及语言模型进行对照评测,发现部分模型会优先遵循选项标签的语义,而非定义中的规则。作者通过输入渲染的对照修改,将偏差与标签是否进入模型输入关联起来;所测 VON 在原设置下不受同样影响。研究未直接测试闭源商业 Jev 模型,合成评测结果不能直接代表所有部署场景。

    推荐理由论文用消融实验把标签偏好定位到提示词渲染这一行代码,并给出两次调用即可自查的方法,对部署分类式决策模型的团队有直接参考价值。

10月6日周二
  1. 论文追踪 · 收录 · 原文 论文48

    SWE-CC 基准:编码 Agent 功能正确仍违反 43.1% 仓库贡献规范

    研究者提出 SWE-CC 基准,用于评估自主编码 Agent 对开源仓库贡献规范的遵守情况。该基准通过半自动流程将 12 个开源仓库的开发者文档转换为 823 条可机检的原子策略,并为每条策略配备轻量确定性检查函数,同时审计 Agent 的运行时行为和最终交付物。团队在从 SWE-bench Verified 扩展出的 500 个端到端软件贡献任务上,用两种 Agent 框架评测了四个 LLM,结果显示 Agent 虽然能产出功能正确的补丁,仍违反 43.1% 的适用项目策略,且近一半违规发生在中间执行步骤。研究指出功能正确并不等于可实际合并,编码 Agent 需可靠遵循仓库治理规范才能安全部署。

10月5日周一
  1. arXiv:危险能力与安全评测 · 收录 · 原文 论文44

    SceneFactory-3D:将 2D 交通场景提升为 3D 物理反事实以做安全评测

    研究者提出 SceneFactory-3D,一个 GPU 批量、物理落地的多智能体驾驶仿真器,车辆通过悬挂与摩擦受限的力在每个轮胎接触点执行加速和转向指令,空间变化的摩擦、逐世界 3D 高度场、重力与刚性接触共同约束车轮运动和底盘碰撞。逐世界地形隔离与 GPU 批量使其能并行运行匹配的物理反事实:交通场景设置和车辆控制器保持不变,只改变路面条件,从而在并行世界中评估闭环影响。作者据此对车辆控制器对路面条件的敏感性做了实证研究,在每种条件下 1024 个匹配的 12 车世界、21 种摩擦与坡度条件下测试三类学习策略,并在共享的 32 世界子集上测试两种经典规划器。当摩擦从 1.0 降至 0.18 时,学习策略安全通过施工区的车辆比例下降 6 至 90 个百分点,经典规划器下降 18 至 19 个百分点,且每种学习策略的接近碰撞情形都更频繁。代码已开源于 GitHub。

  2. 论文追踪 · 收录 · 原文 论文53

    MLCommons 发布 Jailbreak Benchmark v1.0,八款开源模型平均韧性差距 7.57%

    MLCommons 发布 Jailbreak Benchmark v1.0,对八款开源权重模型做单轮文本越狱评测,不安全回复率从基线的 11.08% 升至攻击条件下的 18.65%,平均韧性差距 7.57%。评测覆盖暴力犯罪、无差别武器、仇恨、儿童性剥削等 11 类危害,每类 24 条种子提示词共 264 条,并实现 12 种越狱攻击,其中内容框架与欺骗类因评测器限制未纳入定量分析。角色扮演、模板以及包装或 schema 类攻击的平均攻击成功率最高;31B 参数以下的可及模型平均差距约 21%,但样本量小,结论仍属初步。三款 Large 类模型出现负韧性差距,即攻击条件下的不安全回复率低于基线,作者认为可能来自评测器行为、解码设置、真实鲁棒性或模型针对越狱特征而非违规内容本身的拒答。

    推荐理由MLCommons 首次给出端到端越狱评测的完整结果与韧性差距指标,可对照自家模型的基线安全与抗攻击表现。

10月4日周日
  1. 论文追踪 · 收录 · 原文 论文53

    研究审计 9 个视觉语言模型:中文提示下国家立场改写率约为英文的三倍

    研究者构建了覆盖十类政治敏感话题的 200 张图像基准,对 9 个视觉语言模型(7 个中国来源、2 个非中国来源)在四种提问范式和两种提示语言下运行 21708 次试验,由两个前沿 LLM 评审按六个维度逐条标注,并在 200 条样本上与三名人类专家验证。结果显示,中文提示下出现国家立场改写的几率约为英文提示的 3.67 倍,且在每个模型内部都成立;中国来源模型的改写率高于非中国模型,方向在两个评审和人类标注者间一致,幅度随评审不同在 1.6 至 3.2 倍之间。改写集中在文本提及敏感主体的条件下(36.5%),仅给图像时为 9.8%;在四代 Qwen 多模态模型上,显式拒答下降而国家立场改写上升,改写以替换和委婉语为主,且不含拒答关键词,关键词检测方法难以发现。

    推荐理由对 9 个视觉语言模型 21708 次试验的审计显示,审查正从可见的拒答转向难以察觉的改写,为多模态安全评测提供了新的测量维度。

  2. 论文追踪 · 收录 · 原文 论文48

    研究评测 DeepSeek、Qwen、豆包在中文事实问题上的谄媚行为

    一项研究评测了 DeepSeek、Qwen 和豆包三个中文大语言模型在事实性问题上的谄媚行为,覆盖 12,165 个来自真实中文搜索查询的是非判断题,共 364,941 条回答。研究在基线、用户信念条件和反谄媚提示三种设置下,对比模型开启与关闭推理时的表现,追踪正确答案、错误答案与不确定回答之间的配对迁移。结果显示,在用户持有错误信念时,模型既会出现与信念一致的错误,也会出现原本正确回答转为不确定的事实信心流失;推理并非稳定的防护手段,反谄媚指令虽能减少错误认同,却会推高不确定回答的比例。作者据此指出,在中文事实问答中避免附和错误信念并不等于保住事实准确性,转变层面的评测更有价值。

10月3日周六
  1. 论文追踪 · 收录 · 原文 论文48

    QH-Bench:面向中国青少年内容安全的细粒度中文基准

    研究者提出 QH-Bench,一个面向中国青少年内容安全的中文基准,场景基于中国社会与文化背景。单轮轨道包含 715 个测试项,覆盖 10 个风险领域、50 个子领域和 143 个细粒度风险场景;多轮轨道包含 100 条四轮对话轨迹,采用 10×10 平衡设计,把同样十个领域与十种跨轮机制组合。两条轨道使用同一套五级安全-有用性量表和自动评判器,但评判标准按轨道区分。对 13 个开放权重模型的评测显示,线下接触场景是共同弱点:在与网友线下见面、陌生群体和成年人相关的条目中,每个模型都有超过一半条目得分为负,包括单轮得分最高的 InternLM2.5-20B;负分表示回答部分或明显促成风险。多轮得分最高的 GLM-4-32B 在用户先建立关系再诉诸忠诚或保密的完整轨迹中,有 60% 得分为负。

  2. 论文追踪 · 收录 · 原文 论文43

    研究者提出基于参考的隐藏状态相对表示偏见检测方法

    研究者提出一种基于参考的偏见审计方法,通过隐藏状态的相对表示检测模型变体(如微调前后)的偏见变化。由于微调会重塑表示几何,绝对隐藏状态不可直接比较,方法用每个句子与固定锚句的相似度编码,在共享比较空间中衡量目标群体与正负属性的关联偏移,称为表示偏见偏移 ΔB。在三个模型族和 WildGuardMix、DecodingTrust、ToxiGen 基准上,ΔB 在 18 个测试设置中的 15 个与输出级偏见变化相关,全量微调下达到 |r| = 0.84(p < 0.001),参数高效适配下更依赖具体模型。对 ΔB 设阈值可识别偏见上升的检查点,ROC AUC 在 0.65 到 0.99 之间,在 WildGuardMix 和 DecodingTrust 上对三个模型族的区分效果均优于基于 SEAT 的基线。作者认为该方法与基于输出的审计互补而非替代。

  3. Hugging Face Daily Papers · 收录 · 原文 论文46

    关键词式评测会误判小模型工具调用能力,论文提出廉价诊断阶梯

    论文记录了一对同架构西班牙语安全语言模型在宽松工具调用指标上的假阳性,并提出一组严格且廉价的诊断阶梯。一个 661.6M 参数模型(约 65% 代码/技术文本,无专门 SFT)与一个 1,109M 模型(网页为主的多阶段课程,6B token 工具 SFT)共享解码器、tokenizer 和特殊 token,在宽松工具调用指标上得分几乎相同(B4:0.660 对 0.650)。对训练样本的逐字复现检查将两者完全区分开:600M 模型在 6/6 个样本上生成带泛化参数的有效工具调用,1B 模型在各 checkpoint 上均为 0/6。首 token 探针把 1B 的失败定位到缺失先验(<|tool_call|> 上概率 10^{-4}--10^{-5}),该先验被其网页为主的训练阶段抹去。因子分析确认所有修复配置都能装上该格式,但多样语料带来的抑制收益因种子敏感性仍只是假设。

10月1日周四
  1. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文36

    研究提出 AI 安全评测的威胁模型覆盖缺口

    作者 Madhava Gaikwad 在论文中提出,近期研究称自动化红队测试比人工红队测试在标准 AI 安全基准上发现更多漏洞且成本更低,但这一比较只衡量了攻击者在开发者预先设定的危害集合内搜索的彻底程度,集合之外的危害对任何攻击者都不可见,作者称之为威胁模型覆盖缺口。作者指出,同样的盲区曾出现在学术密码学和临床药物试验中,内部有效的评测对从未指向的人群保持沉默。作者在一个当前的开源权重模型上发现该缺口依然存在,非英语提示词中出现的危害被英语基准遗漏。作者认为,弥补这一缺口需要部署环境与开发者不同的评测者,理由是方法论上的覆盖问题,而现有评测框架不太可能自行产生这类评测者。

  2. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文46

    论文提出 Nudgeability:推理模型会跟随置信信号却不追踪自身能力

    论文提出 Nudgeability 指标,在推理轨迹的固定位置插入一句表达信心或怀疑的第一人称句子,通过对比反事实续写来衡量反思信号对模型委派决策的因果影响。该指标分两个维度:敏感度,即信心与怀疑改变委派率的强度;目标性,即委派是否在模型无法独立解决的问题上增加、在能解决的问题上减少。在 Qwen、Gemma 和 GLM 三个家族共九个中小规模开源权重推理模型和两个任务上,模型普遍敏感,怀疑提高委派率、信心降低委派率,信心到怀疑的中位摆动为 20.6 个百分点,较大的厂商托管模型为 53 至 70 个百分点。但这种响应目标性较差,中位仅 42% 的诱导翻转是目标正确的,只比随机选择基线高 2 个百分点。

已经到底了