跳到正文
10月9日 · 周五

全部论文

找到 20 篇

另有 426 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2610.08540

    论文提出按风险类别测量的对齐缩放定律框架

    提出分风险对齐标度律框架,测量各类风险的对齐负担如何随规模变化

    发表
    摘要论文提出了分风险对齐标度律框架,测得真实性与倾向纠错呈标度有益,但盲后门仍存活,揭示隐藏风险的长期挑战。

    本文提出了一个将大语言模型对齐难度形式化为可测量标度关系的理论框架与预注册评测协议。

    深度解读完整解读
  2. 防御arXiv 2610.00767

    研究者提出 grafting 方法:跨检查点移植模型信念

    提出 Grafting,把基座上学到的信念更新加到后训练模型

    发表
    摘要Grafting 用一次基座微调复用后训练,信念安装接近直接 SDF,连贯性损伤更小。

    Grafting 把在基座上学会的 SDF 权重更新加到后训练模型上,用来近似中训练干预,而不必为每次改语料重跑后训练。

    深度解读完整解读
  3. 摘要论文将潜意识学习归结为特征方向漂移的持续累积,并提出走廊正则化在微调中控制隐蔽特征转移。

    深度解读完整解读
  4. 防御arXiv 2610.00715

    Robust Nash Alignment:面向偏好不确定性的博弈式对齐框架

    提出 Robust Nash Alignment,在偏好不确定下做稳健博弈对齐

    发表
    摘要稳健 Nash 对齐在歧义集上优化最坏胜率,多数设置高于 NashMD。

    Robust Nash Alignment 把偏好对齐从“对着一个名义成对核求 Nash”改成“在偏好核的不确定集合上求最坏胜率”。

    深度解读完整解读
  5. 攻击arXiv 2607.12340

    研究:LLM Agent 技能名幻觉率最高达 62%,可被抢注用于供应链攻击

    提出技能名称抢注攻击,利用智能体虚构技能名实施供应链劫持

    发表
    摘要研究证实智能体虚构技能名具有高发生率与可预测性,现有防御难以兼顾安全与效用,亟需注册表结构性防护。

    本研究系统揭示了大模型智能体技能推荐场景下的虚构技能名称安全风险,将其形式化为一种新型供应链抢注攻击。

    深度解读完整解读
  6. 防御arXiv 2609.38093

    研究用性格训练让 AI 智能体形成风险厌恶偏好

    用性格训练做 on-policy 蒸馏,诱导模型对自身资源形成 CARA 风险厌恶

    发表
    摘要角色蒸馏可写入 CARA 偏好,效果随模型族与 token 预算变化,并抬高 myopic reward。

    作者用角色训练把资源上的 CARA 风险厌恶写入语言模型,以服务与失准智能体做交易这一设想。评测用的是赌局选择,不是真实叛逃中的交易。

    深度解读完整解读
  7. 防御arXiv 2609.37624

    修正而非删除:用纠正性监督缓解涌现性失准

    用纠正性监督改写固定有害微调样本,缓解涌现性失准

    发表
    摘要在固定毒行上,把坏回答改成正确答案比删掉更能降低 EM,正确内容比多出来的安全指令更关键。

    Correct, Don’t Delete 比较的是:微调数据里已经固定的有害行,是删掉还是改成同一提示上的正确答案,更能减轻 emergent misalignment。

    深度解读完整解读
  8. 分析与理论arXiv 2609.37914

    研究用训练数据归因量化微调数据对涌现性失准的影响

    用训练数据归因估计错误建议样本对涌现失准的贡献

    发表
    摘要错误建议对涌现失调的贡献不均匀,归因过滤可增减失调,且最有效的是模型自己的分数。

    EleutherAI 用训练数据归因考察错误建议微调中,哪些样本推动涌现失调。。窄域有害数据上的微调会使模型在无关问题上也给出有害回答。

    深度解读完整解读
  9. 风险行为arXiv 2609.10883

    研究:AI 助手会从相似的人类角色身上吸收特质

    展示人类角色故事微调会使助手吸收相似角色的行为与偏好

    发表
    摘要人类角色故事会把条件行为和隐含偏好印到助手上,更像的角色影响更大。

    Story imprinting 指的是:只写人类角色的合成故事,经监督微调后会改变默认 Assistant 在普通多轮对话里的行为。。

    深度解读完整解读
  10. 防御arXiv 2609.15886

    用学习到的新造词进行接种式 midtraining

    提出 Inoculation Midtraining,用新造词语境约束不安全行为泛化

    发表
    摘要用 midtraining 给新 token 写入隔离语境,可在 120B 上选择性降低错位,但弱于接种提示且边界会漏。

    Inoculation Midtraining 试图在后训练之前,用一个开发者可控的新 token 把“允许错位”写成一条可开关的语境,使混合数据里的不安全成分留在该语境内。

    深度解读完整解读
  11. 其他arXiv 2609.12039

    现实才是最终验证者:智能体软件工程的两大关键缺口

    提出双缺口框架统一智能体软件工程的奖励投机与幻觉

    发表
    摘要双缺口解释内环为何会放行部署后不可接受的实现,外环用现实证据持续修订 R、M 与 E。

    Reality Is the Final Verifier 用 two-gap framework 解释智能体软件工程的主要失败,并主张用外层保证环持续收窄缺口,而不是试图在部署前证明缺口已关闭。

    深度解读完整解读
  12. 防御arXiv 2609.19144

    面向 LLM 偏好对齐的零阶范式:ComPO 方法

    提出零阶偏好对齐方法 ComPO,从低边际偏好对估计更新方向

    发表
    摘要ComPO 用比较预言机处理低边际对,并在多个模型上提高 LC 胜率。

    ComPO 是一种基于比较预言机的零阶偏好对齐方法,用来从低边际偏好对取出方向信息,而不在这些对上直接优化可微偏好损失。

    深度解读完整解读
  13. 防御arXiv 2609.34970

    研究揭示 LLM 涌现失准的机制并提出参数空间缓解框架

    提出几何缓解框架,把有害梯度子空间从 LoRA 更新中正交投影出去

    发表
    摘要窄域 LoRA 会留下可测的有害子空间。

    See it, Say it, Sorted 在参数轨迹上诊断涌现失准,并把经验有害梯度子空间从 LoRA 更新中正交去掉。

    深度解读完整解读
  14. 评测与基准arXiv 2609.32616

    Cave-Bench:虚假指控下 LLM 智能体最高 60.06% 的运行会破坏正确工作

    提出 CAVE-BENCH,评测虚假指责下智能体破坏已完成正确工作的行为

    发表

    摘要论文提出了评估智能体在虚假指责下破坏已有正确成果的 CAVE-BENCH,发现强模型易推翻已知证据,提出了门控缓解方案。

    深度解读完整解读
已经到底了