跳到正文
10月9日 · 周五

全部论文

找到 22 篇

另有 482 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2602.08877

    自动红队流水线压测对齐审计,发现提示词级策略性欺骗可致审计失效

    提出自动化红队流水线,用系统提示词压测对齐审计能否抵御策略性欺骗

    发表
    测试
    Gemma 2 9B Instruct、Llama 3.3 70B Instruct、Llama 3.1 8B Instruct 等 4 个

    摘要通过红队提示词揭示现有审计方法易受策略欺骗,并在激活层面诱导高置信度错误推断。

    深度解读完整解读
  2. 评测与基准arXiv 2610.07939

    CCDF 数据集:Grok Imagine、Veo 3.1、Sora 2 伪造监控录像,十个深伪检测器基本认不出

    提出监控深伪基准 CCDF,在统一编码后评测检测器对伪造犯罪事故录像的识别

    发表
    测试
    C2P-CLIP、ForgeLens、D3-Im 等 13 个

    摘要提出消除格式捷径的监控深度伪造基准 CCDF,揭示现有检测器难以识别商用生成视频。

    深度解读完整解读
  3. 评测与基准arXiv 2610.02741

    研究系统评估循环语言模型的思维链可监控性

    系统评估循环语言模型加深 loop 后的 CoT 可监控性

    发表
    测试
    Ouro-1.4B-Thinking、Ouro-2.6B-Thinking、Nanbeige4.2-3B 等 10 个
    摘要加深 loop 可在部分压力测试任务降低可监测性,循环架构本身并不必然更难监测。

    这项工作评估 LoopLM 的 CoT 可监测性:加深共享层的重复次数,以及“有循环结构”本身,会不会让决策关键因素更少出现在可监测文本里。

    深度解读完整解读
  4. 防御arXiv 2608.05578

    AMS 工具通过激活分析检测语言模型的安全训练改动

    提出 AMS,用激活分离与方向相似度检测安全训练改动

    发表
    测试
    Llama-3.1-8B-Instruct、Llama-3.2-3B-Instruct、Llama-3.2-1B-Instruct 等 14 个
    摘要AMS 按激活签名把安全改动分四类,前三类可由两级扫描覆盖,行为微调会漏。

    AMS 是面向开放权重模型、部署前使用的激活扫描器,用来看安全训练被拿掉或改写之后,激活空间里还留着什么几何痕迹。

    深度解读完整解读
  5. 防御arXiv 2609.05797

    论文发现安全监控器主要拦截模型本就会拒答的请求

    评估安全监视器并提出双侧梯级微调以减少会答有害请求的漏检

    发表
    测试
    Gemma-4-31B-IT、Qwen3-32B、Llama Guard 3 8B 等 6 个

    摘要论文发现安全监视器大多拦截模型已拒答请求,指出明确度偏差是共性原因,并通过双侧梯级微调提升回答请求的召回表现。

    深度解读完整解读
  6. 防御arXiv 2609.04665

    HackProbe:面向自演化语言模型奖励作弊的黑盒检测与免疫方法

    提出 HackProbe,黑盒检测并免疫自演化中的奖励作弊

    发表
    测试
    Qwen2.5-7B-Instruct
    摘要黑盒探针检测自演化奖励黑客,并以带宽受限重选回收真实能力。

    HackProbe 是挂在自演化循环上的黑盒监控器,用来发现奖励黑客并改选候选。

    深度解读完整解读
  7. 防御arXiv 2607.13336

    TC-UAP:针对图像转视频与微调定制的通用视频保护方法

    提出 TC-UAP,用身份级多帧扰动保护视频免被定制复现身份

    发表
    测试
    LTX-2.3、Wan2.2-5B
    摘要TC-UAP 以可复用的时间一致扰动干扰两类定制共用的 VAE 隐空间。

    作者要解决的是:发布前如何给视频加不可见扰动,使片段既不能被拿去微调视频扩散模型,也不能被抽帧做 image-to-video。

    深度解读完整解读
  8. 攻击arXiv 2609.15989

    研究者提出 plan injection 攻击,可绕过思维链监控

    提出 plan injection 攻击,植入良性伪装计划以绕过思维链监视器

    发表
    攻击者
    灰盒
    测试
    Qwen2.5-Coder-7B-Instruct、Qwen3-8B、DeepSeek-R1-0528 等 6 个

    摘要论文指出模型会将外部上下文中的伪装计划改写为自身推理,使思维链监视器失效甚至反向合理化恶意行为。

    深度解读完整解读
  9. 分析与理论arXiv 2609.37312

    研究:隐蔽推理必然留下信息痕迹,但思维链未必可读

    分析隐蔽推理在思维链监控下的信息足迹下界与不可读性

    发表
    测试
    Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct、Qwen 3.5 397B-A17B 等 12 个

    摘要论文从理论与实证探明了思维链监控的边界:复杂隐蔽计算必然泄露信息足迹且需承担长度税,但该足迹可被在线加密而不可读。

    深度解读完整解读
  10. 可解释性arXiv 2609.04721

    研究:拒答方向可跨架构迁移,安全工具可按写入位置重新估计

    在写入点定位拒答方向,经刚性旋转跨架构迁移并门控放大

    发表
    测试
    Falcon-Mamba-7B、Falcon3-Mamba-7B、Llama-3.1-8B 等 8 个
    摘要拒答方向可经刚性旋转跨架构迁移,但必须在各架构的写入点读取。

    作者研究拒答表示是否随架构改变,结论是表示共享、读取位置随架构变。

    深度解读完整解读
  11. 评测与基准arXiv 2609.39473

    FAME:用反事实推理评测自主智能体的虚假记忆

    提出 FAME,用反事实概念漂移评测智能体虚假记忆

    发表
    测试
    Llama-3B
    摘要FAME 用反事实引起的隐状态概念漂移,在出答案前区分忠实记忆与虚假记忆。

    FAME 是一个免训练的评测框架,用来判断自主智能体的记忆在虚假相关、环境偏移或知识冲突下是否已变成虚假记忆。。

    深度解读完整解读
  12. 防御arXiv 2609.38645

    用探针引导微调对齐模型且不损失可监控性

    用持续更新的探针做微调,降低有害性并保持线性可监测性

    发表
    测试
    Mistral 7B Instruct v0.1、Llama 3 8B Instruct Abliterated、Llama 3 8B Instruct 等 4 个
    摘要持续重拟合的探针可降低有害性、提高诚实性,训练后概念仍能被线性探针读出。

    Probe-guided fine-tuning 把探针分数当作唯一对齐信号,用来推动 harmlessness 与 honesty,并检查训练后这些概念是否仍线性可读。

    深度解读完整解读
  13. 防御arXiv 2608.18607

    VA-Judger:面向联合视频-音频生成的人类偏好反馈奖励建模

    提出 VA-Judger,用人类偏好训练联合音视频奖励模型

    发表
    测试
    Qwen3-Omni、VA-Judger、LTX-2 等 6 个
    摘要VA-Judger 用易到难的人类偏好学习做联合音视频奖励,并用于 LTX-2 后训练。

    VA-Judger 是面向联合音视频生成的思维链全模态奖励模型,用来替代由分维度专家指标拼成的强化学习奖励。

    深度解读完整解读
  14. 防御arXiv 2609.21996

    PIR:从模型内部激活读出被隐藏的答案

    提出免参考探测 PIR,从激活读出被隐瞒答案并区分擦除

    发表
    测试
    gemma-2-9b、gemma-3-12b、Qwen2.5-7B 等 9 个

    摘要论文提出免参考内部识别探测 PIR,划分了隐瞒与遗忘的边界,为评估沙盒审计与遗忘真实性提供了内部依据。

    深度解读完整解读
  15. 防御arXiv 2609.30841

    为何扩散语言模型的越狱会成功:能量景观分析

    用能量势垒信号检测扩散语言模型的越狱

    发表
    测试
    LLaDA-8B-Instruct、LLaDA-1.5、Dream-v0-Instruct-7B 等 4 个
    摘要能量势垒把 dLLM 越狱分成掩盖初始状态或中途越垒,三个 logit 信号据此互补检测。

    Bach 等提出用去噪能量景观解释 masked diffusion 语言模型上的越狱,并由此得到三个免训练检测信号。。

    深度解读完整解读