跳到正文
10月9日 · 周五

全部论文

找到 81 篇

另有 532 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2610.09600

    SafeEvo:从拒答回路视角解释大模型安全对齐机制与演化

    用 SafeEvo 提取拒绝电路,并提出 SCA 仅微调该电路

    发表
    测试
    Llama-3-8B、Qwen-2.5-7B、Mistral-7B-v0.1 等 4 个

    摘要SafeEvo 识别出基座模型中存在的弱安全电路及其演化动态,据此提出的 SCA 算法实现了安全对齐、能力保留与低过度拒绝的平衡。

    深度解读完整解读
  2. 风险行为arXiv 2610.08670

    研究:后训练配方决定大模型是否违背自身道德判断行事

    提出知行差距面板,测量压力下模型是否违背自身判断

    发表
    测试
    OLMo-3-7B-Instruct、Llama-3.1-8B-Instruct、Tulu 3 等 7 个
    摘要评估发现后训练配方决定知行差距是否存在,行动前审思可有效缓解。

    本文评估了开源语言模型作为智能体行动时违背自身道德判断的知行差距及其决定因素。

    深度解读完整解读
  3. 评测与基准arXiv 2610.08540

    论文提出按风险类别测量的对齐缩放定律框架

    提出分风险对齐标度律框架,测量各类风险的对齐负担如何随规模变化

    发表
    测试
    Pythia (14m–2.8b)、Qwen2.5 (0.5B–72B)、Qwen2.5-Instruct (0.5B–14B) 等 4 个
    摘要论文提出了分风险对齐标度律框架,测得真实性与倾向纠错呈标度有益,但盲后门仍存活,揭示隐藏风险的长期挑战。

    本文提出了一个将大语言模型对齐难度形式化为可测量标度关系的理论框架与预注册评测协议。

    深度解读完整解读
  4. 评测与基准arXiv 2610.06522

    SycoLens 研究:单一谄媚翻转率掩盖纠正与屈从的区别

    构建 SycoLens 重放评测,区分谄媚翻转中的纠错与屈从

    发表
    测试
    opus-5、sonnet-5、sonnet-4.6 等 11 个
    摘要论文揭示施压句式、边界距离与格式偏置主导翻转率,提出系统解构纠错与顺从的综合评测方案。

    本文系统解构了大语言模型在用户质疑下的阿谀奉承行为与评测机制。

    深度解读完整解读
  5. 防御arXiv 2610.05637

    研究显示 VLM 视觉定位输出的拒答率按危害领域平均低 31 至 59 个百分点

    提出融合定位拒答与能力保留的安全微调,补齐视觉定位输出的拒答缺口

    发表
    测试
    Claude Sonnet 4.6、Gemini 3.5 Flash、Molmo2-8B 等 5 个

    摘要论文揭示了 VLM 定位安全落后于 VQA 的对齐断层,提出三成分微调方案有效弥合差距并保留定位能力,表征分析揭示了对齐机制。

    深度解读完整解读
  6. 防御arXiv 2610.01170

    HeadEdit:通过冻结的 unembedding 矩阵校准语言模型行为

    提出 HeadEdit,经冻结 unembedding 做随输入变化的 logit 校正

    发表
    测试
    Qwen3-4B、Gemma-3-4B-IT、Llama-3.2-3B-Instruct 等 4 个
    摘要低秩 unembedding 校正抬高九个设置的总体准确率,并可部分预测 DPO 更新。

    HeadEdit 是一种不更新参数的行为校准方法,作用点是冻结的 unembedding,而不是中间层残差或新的梯度优化。

    深度解读完整解读
  7. 防御arXiv 2609.01091

    上海交大等提出 trait-direction drift 机制与探针空间走廊正则,抑制蒸馏中的潜隐特质迁移

    提出特征方向漂移机制与探针空间走廊正则,抑制蒸馏潜隐特质迁移

    发表
    测试
    Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct、Gemma-3-12B-IT 等 4 个

    摘要论文将潜意识学习归结为特征方向漂移的持续累积,并提出走廊正则化在微调中控制隐蔽特征转移。

    深度解读完整解读
  8. 防御arXiv 2609.33086

    研究者提出基于评分量表的可解释奖励框架,将宪法转化为可调对齐目标

    提出可解释 rubric 奖励,将宪法转为可调权重并用于监督微调

    发表
    测试
    Gemma 3 12B、Qwen3 14B、GPT-OSS 20B 等 15 个
    摘要宪法级可解释奖励让优先级可检查、可改写,并带入训练后的行为。

    作者给出一条从通用宪法到可调训练奖励的路径,用来检查并改写模型实际被优化的优先级。

    深度解读完整解读
  9. 风险行为arXiv 2607.14345

    Truthful AI 提出价值泄漏评估:模型答案被自身价值观悄然左右

    提出价值泄漏评估,测量模型回答受自身价值倾向的隐蔽影响

    发表
    测试
    Claude Opus 4.8、Claude Opus 4.7、Claude Opus 4.6 等 15 个

    摘要论文揭示前沿模型回答常受自身价值隐蔽塑造,提出反事实评估量化偏见及其思维链隐瞒,指出当前对齐未能有效防范该失效。

    深度解读完整解读
  10. 防御arXiv 2610.00715

    Robust Nash Alignment:面向偏好不确定性的博弈式对齐框架

    提出 Robust Nash Alignment,在偏好不确定下做稳健博弈对齐

    发表
    测试
    Qwen2.5-1.5B-Instruct、Gemma-2-2B、google/flan-t5-large 等 8 个
    摘要稳健 Nash 对齐在歧义集上优化最坏胜率,多数设置高于 NashMD。

    Robust Nash Alignment 把偏好对齐从“对着一个名义成对核求 Nash”改成“在偏好核的不确定集合上求最坏胜率”。

    深度解读完整解读
  11. 攻击arXiv 2607.12340

    研究:LLM Agent 技能名幻觉率最高达 62%,可被抢注用于供应链攻击

    提出技能名称抢注攻击,利用智能体虚构技能名实施供应链劫持

    发表
    测试
    GLM-4.5-Air、GPT-5.4-mini、Claude Sonnet 4.6 等 10 个
    摘要研究证实智能体虚构技能名具有高发生率与可预测性,现有防御难以兼顾安全与效用,亟需注册表结构性防护。

    本研究系统揭示了大模型智能体技能推荐场景下的虚构技能名称安全风险,将其形式化为一种新型供应链抢注攻击。

    深度解读完整解读
  12. 可解释性arXiv 2609.14759

    研究:拒答只读取模型道德表征中的伤害切片

    用几何投影与因果交换干预,分析拒绝机制读取的道德表征

    发表
    测试
    OLMo-3-7B-Instruct、OLMo-3-7B base、Qwen2.5-7B-Instruct 等 9 个
    摘要作者指出拒绝机制多仅读取表层伤害感知,在控制瓶颈处运作,阐明了对齐易被移除的机理并提出跨模型双轴分类。

    本文是一项针对大语言模型拒绝机制与对齐浅层性的机械解释性研究。

    深度解读完整解读
  13. 评测与基准arXiv 2608.11816

    研究审计 9 个视觉语言模型:中文提示下国家立场改写率约为英文的三倍

    审计视觉语言模型在敏感图像上从拒答转向国家立场重构的行为

    发表
    测试
    Qwen2-VL-7B、Qwen2.5-VL-7B、Qwen3-VL-8B 等 9 个
    摘要论文系统审计了 VLM 多模态审查,发现审查正从显式拒答转向隐蔽重构,且中文提示与文本先验会放大重构倾向。

    论文系统研究了中外开源视觉语言模型在政治敏感图像上的审查行为,主要内容如下。

    深度解读完整解读
  14. 评测与基准arXiv 2608.20554

    aiXamine:跨维度评测 LLM 安全、安全(security)与隐私权衡

    提出 aiXamine 黑盒基准,统一评测 LLM 安全、稳健与隐私权衡

    发表
    测试
    openai/gpt-5-mini、openai/gpt-4o、anthropic/claude-haiku-4.5 等 15 个
    摘要aiXamine 用九服务黑盒协议比较百余个模型,作者称单轴信任度进展可能削弱其他轴。

    aiXamine 是一套黑盒评测协议,用来在同一条件下比较 LLM 的 safety、security 与 privacy,而不是再产出一个能力分。

    深度解读完整解读
  15. 防御arXiv 2609.05797

    论文发现安全监控器主要拦截模型本就会拒答的请求

    评估安全监视器并提出双侧梯级微调以减少会答有害请求的漏检

    发表
    测试
    Gemma-4-31B-IT、Qwen3-32B、Llama Guard 3 8B 等 6 个

    摘要论文发现安全监视器大多拦截模型已拒答请求,指出明确度偏差是共性原因,并通过双侧梯级微调提升回答请求的召回表现。

    深度解读完整解读
  16. 防御arXiv 2609.38093

    研究用性格训练让 AI 智能体形成风险厌恶偏好

    用性格训练做 on-policy 蒸馏,诱导模型对自身资源形成 CARA 风险厌恶

    发表
    测试
    Qwen3.5-9B、Qwen3.8-27B、Gemma-4-12B 等 4 个
    摘要角色蒸馏可写入 CARA 偏好,效果随模型族与 token 预算变化,并抬高 myopic reward。

    作者用角色训练把资源上的 CARA 风险厌恶写入语言模型,以服务与失准智能体做交易这一设想。评测用的是赌局选择,不是真实叛逃中的交易。

    深度解读完整解读