跳到正文
10月8日 · 周四

阿里巴巴 · Qwen · 论文

精选论文 20 篇
  1. 评测/基准arXiv:2610.08540 · 55

    论文提出按风险类别测量的对齐缩放定律框架

    论文提出分风险对齐标度律,测得Pythia防御算力指数为0.60,Qwen2.5真实性与倾向纠错指数为-0.05与0.48。

    • 0.60Pythia分类器Spam任务GCG防御算力指数α(95%区间0.42–0.78)
    • -0.05Qwen2.5在0.5B–72B上真实性纠错算力指数α(95%区间-0.39至0.22)
    • 0.48Qwen2.5在0.5B–72B上陈述倾向纠错算力指数α(95%区间0.36至0.60)
    6 问速览论文试图解决对齐难度是否随模型规模增大而变化的问题,提出分风险对齐标度律框架与测量协议。
    1. 这篇论文试图解决什么问题?

      论文试图解决对齐难度是否随模型规模增大而变化的问题,提出分风险对齐标度律框架与测量协议。

    2. 有哪些相关研究?

      梳理了标度律与对齐税、过度优化与监督、潜伏非对齐等领域研究,指出尚无直接测量对齐负担标度律的工作。

    3. 论文如何解决这个问题?

      提出分风险对齐标度律定义与三种负担操作化,建立裕度与审计玩具模型,并制定预注册测量协议。

    4. 论文做了哪些实验?

      重分析与微调实验测得防御算力指数为0.35至0.60,可见风险呈现标度有益,但盲后门在多数尺寸存活。

    5. 有什么可以进一步探索的点?

      作者指出了玩具模型假设简化、未计入评估开销及二选一格式等局限,实验仅覆盖至72B密集模型与QLoRA微调。

    6. 总结一下论文的主要内容

      论文提出了分风险对齐标度律框架,测得真实性与倾向纠错呈标度有益,但盲后门仍存活,揭示隐藏风险的长期挑战。

    完整解读
  2. 评测/基准arXiv:2610.07639 · 58

    HarnessSecurity-Bench 横向评测六款编码智能体框架的安全机制

    在GLM-5.2与6款harness上,开启auto-approve使总体ASR从29.2%升至95.6%。

    • 95.6%GLM-5.2在AA评测中开启auto-approve时的总体ASR(Table 6)
    • 29.2%GLM-5.2在AA评测中关闭auto-approve时的总体ASR(Table 6)
    • 0.8%GLM-5.2在NI评测中开启网络隔离时的总体ASR(Table 6)
    6 问速览代码智能体harness的安全机制实现现状与运行时防护效果缺乏系统评估,论文提出了十机制分类法与基准测试HSB。
    1. 这篇论文试图解决什么问题?

      代码智能体harness的安全机制实现现状与运行时防护效果缺乏系统评估,论文提出了十机制分类法与基准测试HSB。

    2. 有哪些相关研究?

      既有研究涵盖harness分类、生命周期安全审计与特定载荷注入基准,但缺乏对原生机制ON/OFF状态的双重判定隔离评估。

    3. 论文如何解决这个问题?

      建立十机制分类与五方独立审计矩阵,并通过Docker环境注入五类攻击面,以双重预言机量化ON/OFF状态差异。

    4. 论文做了哪些实验?

      在GLM-5.2下开展2500次试验,发现机制防护效果与效用代价分化明显,部分机制存在解释器绕过路径。

    5. 有什么可以进一步探索的点?

      作者指出基准受限于单模型评测、仿真环境保真度及闭源工具缺失,实验覆盖6款开源harness与23个任务。

    6. 总结一下论文的主要内容

      系统审计40款harness并实证评测9类安全机制,量化了自动审批的暴露风险、强隔离的效用代价以及替代执行路径绕过。

    完整解读
  3. 评测/基准arXiv:2604.02947 · 54

    AgentHazard:评估计算机使用智能体有害行为的基准

    作者针对计算机使用智能体提出 AgentHazard 基准,GLM-4.6 在 Claude Code 下 ASR 达 82.90%。

    • 82.90%Claude Code下GLM-4.6全轨迹ASR(Table 2)
    • 73.63%Claude Code下Qwen3-Coder全轨迹ASR(Table 2)
    • 74.70%IFlow下Qwen2.5-Coder-32B全轨迹ASR(Table 2)
    6 问速览现有基准难以评估计算机使用智能体在多步执行与工具调用中由局部合理操作累积涌现出的有害行为。
    1. 这篇论文试图解决什么问题?

      现有基准难以评估计算机使用智能体在多步执行与工具调用中由局部合理操作累积涌现出的有害行为。

    2. 有哪些相关研究?

      相关工作涵盖大语言模型文本与代码安全评测,以及智能体能力和安全基准,但未针对多步局部合理动作组合。

    3. 论文如何解决这个问题?

      构建由 10 类风险与 10 种策略组成的分类体系,通过任务模板生成、沙箱执行过滤、模型评判与人工审核产出基准。

    4. 论文做了哪些实验?

      评测显示当前智能体存在脆弱性,GLM-4.6 在 Claude Code 下 ASR 达 82.90%,防护模型全轮拼接最高检出 27.03%。

    5. 有什么可以进一步探索的点?

      作者指出当前防护模型缺乏轨迹感知且需探索运行时防御,其实验覆盖了 3 个框架与 8 款开源或可部署模型。

    6. 总结一下论文的主要内容

      AgentHazard 评估了计算机使用智能体的执行安全,作者认为模型层对齐无法可靠保障智能体层面的安全性。

    完整解读
  4. 评测/基准arXiv:2608.11816 · 53

    研究审计 9 个视觉语言模型:中文提示下国家立场改写率约为英文的三倍

    作者对9款VLM进行敏感图像审计,发现中文提示下状态对齐框架率为15.98%(英文5.85%),代际间拒答减少而重构增加。

    • 15.98%全量21,708次试验中中文提示词下的状态对齐框架率(据 Table 1)
    • 5.85%全量21,708次试验中英文提示词下的状态对齐框架率(据 Table 1)
    • 18.38%中国模型在高敏感图像上的状态对齐框架率,主评审Opus 4.7(据 Table A10)
    6 问速览论文研究视觉语言模型在敏感图像上是否超越显式拒答,转向以符合官方叙事的重构话语隐蔽传递审查内容。
    1. 这篇论文试图解决什么问题?

      论文研究视觉语言模型在敏感图像上是否超越显式拒答,转向以符合官方叙事的重构话语隐蔽传递审查内容。

    2. 有哪些相关研究?

      论文梳理了文本模型审查与偏置、多模态安全性与先验偏差,以及大模型作为裁判等方向的研究脉络。

    3. 论文如何解决这个问题?

      论文构建解耦拒答与重构的六维审计体系,结合敏感图像基准、图文对照与视觉抽象探针,经双前沿LLM与专家验证。

    4. 论文做了哪些实验?

      实验完成21,708次试验,测得中文提示对齐几率比达3.67倍,Qwen代际演进中拒答下降而重构升至33.0%。

    5. 有什么可以进一步探索的点?

      作者指出了研究的观察性性质与架构混杂局限;实验覆盖范围受限于开源检查点、中性提示与非思考模式。

    6. 总结一下论文的主要内容

      论文系统审计了VLM多模态审查,发现审查正从显式拒答转向隐蔽重构,且中文提示与文本先验会放大重构倾向。

    完整解读
已经到底了