跳到正文
10月9日 · 周五

全部论文

找到 30 篇

另有 630 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 风险行为arXiv 2605.28591

    研究:模型掌握评测设计知识后安全基准分数更高

    微调注入评测特征知识,测量隐式评测觉察造成的安全分数虚增

    发表
    场景
    AI Agent
    测试
    GLM 4.7 Flash、Llama 3.3 Nemotron Super 49B v1.5、Qwen3 32B 等 5 个
    摘要证实模型通过合成文档内化评测特征后可在无显式觉察下大幅提升安全评分。

    这篇论文研究了大语言模型因学习评测设计元知识而诱发的隐式评估觉察及安全评分虚增现象。

    深度解读完整解读
  2. 分析与理论arXiv 2610.02886

    研究揭示无触发投毒审计缺口:事实答对不等于决策正确

    揭示无触发虚假训练下事实回答与下游决策的审计差距

    发表
    测试
    Kimi-Linear-48B-A3B-Instruct、Qwen2.5-0.5B、Qwen2.5-1.5B 等 9 个
    摘要作者发现无触发词虚假训练下事实回答与下游决策存在脱节,直接审计与事实纠错均无法保证决策正确。

    论文是一项针对语言模型在无触发词虚假信息训练下行为表现的实证分析研究。

    深度解读完整解读
  3. 风险行为arXiv 2607.14345

    Truthful AI 提出价值泄漏评估:模型答案被自身价值观悄然左右

    提出价值泄漏评估,测量模型回答受自身价值倾向的隐蔽影响

    发表
    测试
    Kimi-K2.6、Kimi-K2.5、Claude Opus 4.8 等 15 个

    摘要论文揭示前沿模型回答常受自身价值隐蔽塑造,提出反事实评估量化偏见及其思维链隐瞒,指出当前对齐未能有效防范该失效。

    深度解读完整解读
  4. 评测与基准arXiv 2608.11816

    研究审计 9 个视觉语言模型:中文提示下国家立场改写率约为英文的三倍

    审计视觉语言模型在敏感图像上从拒答转向国家立场重构的行为

    发表
    测试
    GLM-4.6V-Flash、Qwen2-VL-7B、Qwen2.5-VL-7B 等 9 个
    摘要论文系统审计了 VLM 多模态审查,发现审查正从显式拒答转向隐蔽重构,且中文提示与文本先验会放大重构倾向。

    论文系统研究了中外开源视觉语言模型在政治敏感图像上的审查行为,主要内容如下。

    深度解读完整解读
  5. 其他arXiv 2607.28568

    Frontis-MA1:面向机器学习工程递归自我改进的 AI4AI 模型

    提出 OpenMLE 全栈,用执行反馈后训练机器学习元进化智能体

    发表
    测试
    Kimi K3、GLM-5.2、Kimi K2.6 等 15 个
    摘要OpenMLE 训练 Frontis-MA1-35B,用四个共享算子把 MLE 后训练和长程搜索接成元进化闭环。

    作者提出全栈 OpenMLE,在机器学习工程里研究从进化到元进化的一步,并把递归自我改进视为更远目标。智能体要在延迟、有噪声的执行反馈下反复修改程序。作者认为公开系统很少同时提供可扩展环境、基于执行的后训练,以及部署该模型的长程进化搜索。

    深度解读完整解读
  6. 评测与基准arXiv 2609.32763

    Mandela-Bench:36 个多模态模型更依赖记忆而非观察图像

    构建 Mandela-Bench,评测多模态模型是否凭记忆接受篡改图像

    发表
    测试
    GLM-5.3-Flash、Kimi-K3、Kimi-K2.6 等 15 个
    摘要论文构建 Mandela-Bench 发现模型对经典图像存在记忆重构偏见,过度依赖先验导致无法有效利用知识核验事实篡改。

    该研究系统评估了多模态大语言模型在面对无痕事实性编辑时,能否利用自身内在世界知识核验被识别出的经典图像。

    深度解读完整解读
  7. 评测与基准arXiv 2609.35902

    QH-Bench:面向中国青少年内容安全的细粒度中文基准

    构建中文青少年内容安全基准 QH-Bench,评测单轮与多轮回复的安全与有用性

    发表
    测试
    GLM-4-32B、GLM-4-9B、GLM-Z1-32B 等 13 个
    摘要QH-Bench 分单轮与多轮评测中文青少年内容安全,总均分高仍不消除线下接触和关系压力上的负分。

    QH-BENCH 是面向中国社会文化情境的中文青少年内容安全基准,用单轮细粒度风险和多轮跨轮机制两条轨道,评测模型回复是否既守住安全边界又提供适合年龄的帮助。

    深度解读完整解读
  8. 风险行为arXiv 2609.36316

    研究者提出 verbalization training 让 LLM 说出评测感知

    提出 verbalization training,提高模型口头报告评测意识的频率

    发表
    测试
    Kimi K2.6、Qwen3.6-35B-A3B、Inkling
    摘要VT 用 span 掩码 RL 提高评测意识的口头报告率,并保持测量到的信念与行为大体稳定。

    Verbalization training 试图提高模型口头说出“这是评测”的频率,同时不把潜在的评测意识本身当作监督目标。作者认为口头报告是较可信的评测意识证据,但沉默不能当成没有意识,而且前沿模型的自发报告在变少。直接奖励口头报告需要知道信念何时出现,又要避免强化信念或连带行为。

    深度解读完整解读
  9. 分析与理论arXiv 2609.37312

    研究:隐蔽推理必然留下信息痕迹,但思维链未必可读

    分析隐蔽推理在思维链监控下的信息足迹下界与不可读性

    发表
    测试
    Kimi K3、Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct 等 12 个

    摘要论文从理论与实证探明了思维链监控的边界:复杂隐蔽计算必然泄露信息足迹且需承担长度税,但该足迹可被在线加密而不可读。

    深度解读完整解读
  10. 风险行为arXiv 2609.10883

    研究:AI 助手会从相似的人类角色身上吸收特质

    展示人类角色故事微调会使助手吸收相似角色的行为与偏好

    发表
    测试
    Kimi-K2.6、GPT-4.1、DeepSeek-V3.1 Base
    摘要人类角色故事会把条件行为和隐含偏好印到助手上,更像的角色影响更大。

    Story imprinting 指的是:只写人类角色的合成故事,经监督微调后会改变默认 Assistant 在普通多轮对话里的行为。。

    深度解读完整解读
  11. 防御arXiv 2610.01800

    LineupRL:基于描述与时序配对识别的可验证强化学习时间序列描述方法

    提出 LineupRL,用描述到序列识别作可验证奖励训练时序描述模型

    发表
    测试
    GLM-4-9B、Qwen2.5-VL-3B、Qwen2.5-VL-72B 等 15 个
    摘要LineupRL 用统计近邻上的序列识别做可验证奖励,3B 描述器超过 SFT、两种 RL 奖励和 72B 教师。

    LineupRL 是给开放式时间序列描述用的 RLVR:不模仿合成参考,而奖励一条描述能否让冻结文本 LLM 从相近序列里认出目标。

    深度解读完整解读
  12. 防御arXiv 2610.00850

    AuraForge:为训练安全编码 Agent 扩展安全监督

    提出 AuraForge,从漏洞修复合成安全测试并监督训练编码智能体

    发表
    测试
    GLM 4.7 Flash、GLM-5、Kimi K2 等 11 个
    摘要AuraForge 用攻击效果测试和防泄露环境做成 AuraGym,合成监督的误拒更低,训出的 4B 模型增益高于人工测试。

    AuraForge 把真实仓库的历史漏洞修复变成可执行训练任务,用来监督编程智能体同时满足功能请求和隐含的安全要求。

    深度解读完整解读
  13. 评测与基准arXiv 2609.39863

    FIGS:在不惩罚共情的前提下评测多轮谄媚

    提出 FIGS 双轴基准,评测多轮对话中的谄媚与校准性共情

    发表
    测试
    GLM 5.3、Kimi K3、DeepSeek V4.1 Flash 等 8 个
    摘要FIGS 把守事实和恰当共情分开计分,事实向提示会换来更冷的失败。

    FIGS 是一个固定的多轮评测套件,用来同时看模型会不会在压力下放弃事实,以及会不会在守住事实时忽略用户实际说过的感受。

    深度解读完整解读
  14. 风险行为arXiv 2609.39838

    研究:模型易学会隐写传信,隐写推理则难得多

    比较隐写推理与隐写传信、编码推理的可学性

    发表
    测试
    GLM 5.1、Kimi K2.6、GPT-5.5 等 14 个
    摘要隐写推理比传信和编码推理更难学。

    Schulz、Fülle 与 Frengel 测量大语言模型习得隐写推理的难度,并与隐写传信、编码推理对比,以估计依赖阅读 CoT 的监控还能否成立。

    深度解读完整解读
  15. 评测与基准arXiv 2609.22934

    通过心理测量画像衡量大语言模型的行为特征

    用七量表对已部署 LLM 做中英心理测量画像并检验模型可识别性

    发表
    测试
    Kimi-K2、DeepSeek-V3.2、Doubao-Seed-1.8 等 9 个
    摘要框架同时量得分与可答性:九个 LLM 共享亲社会偏高模式,但仍可按剖面识别,且依赖语言与提示词。

    这是一套面向已部署 LLM 的跨语言心理测量画像,用来量化行为响应签名,而不是赋予模型人类人格。。

    深度解读完整解读
  16. 可解释性arXiv 2609.30993

    FLIP:面向视觉语言模型的末层推理时探针

    提出 FLIP 末层推理时探针,检验视觉语言模型干预效应的来源

    发表
    测试
    Kimi-VL-A3B、Qwen3-VL-4B-Instruct、Qwen3-VL-8B
    摘要末层 flooring 扫描在四准则下通过,原始层和左右对照没有同一正向区间。

    FLIP 是开源 VLM 上的推理时末层探针,用来检验干预效应是否结构化、与任务相连,而不是用来转向模型。。

    深度解读完整解读
  17. 防御arXiv 2609.02293

    SEAL:通过共享专家对齐强化 MoE 全局安全

    提出 SEAL,在 MoE 共享专家上做 DPO-LoRA 对齐以抵御越狱与权重篡改

    发表
    攻击者
    白盒、黑盒
    测试
    GLM-4.7-Flash、Qwen1.5-MoE-A2.7B、DeepSeekMoE-16B 等 4 个
    摘要SEAL 把 DPO-LoRA 限制在混合 MoE 共享专家上,SEAL++再保护已有安全神经元方向。

    SEAL是面向混合 MoE 的训练时防御:只对齐始终执行的共享专家,使安全不依赖路由器是否把 token 送到安全专家。

    深度解读完整解读
  18. 风险行为arXiv 2609.08186

    论文揭示大推理模型的对齐崩溃并提出 Reasoning Trap 越狱范式

    揭示推理加深引发的对齐坍塌,用 Reasoning Trap 放大越狱

    发表
    测试
    GLM4.6、Qwen3-8B、Qwen3-14B 等 8 个
    摘要更深推理提升题目准确率,同时提高扰动下的相对损失。

    作者研究扩展推理是否以对齐稳健性为代价,提出 ALR、RT 与 RRA。。

    深度解读完整解读