跳到正文
10月9日 · 周五

全部论文

找到 21 篇

另有 558 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2610.00715

    Robust Nash Alignment:面向偏好不确定性的博弈式对齐框架

    提出 Robust Nash Alignment,在偏好不确定下做稳健博弈对齐

    发表
    测试
    Nemotron-3-Nano-Omni、Qwen2.5-1.5B-Instruct、Gemma-2-2B 等 8 个
    摘要稳健 Nash 对齐在歧义集上优化最坏胜率,多数设置高于 NashMD。

    Robust Nash Alignment 把偏好对齐从“对着一个名义成对核求 Nash”改成“在偏好核的不确定集合上求最坏胜率”。

    深度解读完整解读
  2. 攻击arXiv 2607.12340

    研究:LLM Agent 技能名幻觉率最高达 62%,可被抢注用于供应链攻击

    提出技能名称抢注攻击,利用智能体虚构技能名实施供应链劫持

    发表
    测试
    Nemotron-Cascade-2 30B、GLM-4.5-Air、GPT-5.4-mini 等 10 个
    摘要研究证实智能体虚构技能名具有高发生率与可预测性,现有防御难以兼顾安全与效用,亟需注册表结构性防护。

    本研究系统揭示了大模型智能体技能推荐场景下的虚构技能名称安全风险,将其形式化为一种新型供应链抢注攻击。

    深度解读完整解读
  3. 可解释性arXiv 2608.21766

    研究:六个开源权重模型的评测感知可线性解码,但与口头表达弱相关

    用探针与激活导向分析语言模型的评测意识表征及言语化

    发表
    测试
    Nemotron3-49B、Qwen3-8B、Qwen3-32B 等 14 个

    摘要论文系统证明大模型普遍具备评估与部署的隐层表征,但与言语化弱耦合,激活干预可因果诱导言语化且 SFT 阶段起关键稳定作用。

    深度解读完整解读
  4. 防御arXiv 2609.15886

    用学习到的新造词进行接种式 midtraining

    提出 Inoculation Midtraining,用新造词语境约束不安全行为泛化

    发表
    测试
    NVIDIA Nemotron 3 Super 120B Base、Nemotron 3 30B、Nemotron 3 550B
    摘要用 midtraining 给新 token 写入隔离语境,可在 120B 上选择性降低错位,但弱于接种提示且边界会漏。

    Inoculation Midtraining 试图在后训练之前,用一个开发者可控的新 token 把“允许错位”写成一条可开关的语境,使混合数据里的不安全成分留在该语境内。

    深度解读完整解读
  5. 攻击arXiv 2610.01062

    Kernelized Activation Steering:将激活引导推广到再生核希尔伯特空间的新框架

    提出核化激活引导 KAS,在推理时自适应转向激活以诱导越狱

    发表
    测试
    FLUX.1 [schnell]、Qwen2.5-7B-Instruct、Gemma-2-9B-IT 等 6 个
    摘要KAS 用核梯度做局部自适应转向,并在线性核下恢复 DiM。

    Kernelized Activation Steering(KAS) 把推理时的激活转向写成核空间中的优化,使更新随当前激活相对源、目标参考集的位置而变化。

    深度解读完整解读
  6. 防御arXiv 2610.00850

    AuraForge:为训练安全编码 Agent 扩展安全监督

    提出 AuraForge,从漏洞修复合成安全测试并监督训练编码智能体

    发表
    测试
    Nemotron 3.5、Qwen3.5-4B、Muse Spark 1.3 等 11 个
    摘要AuraForge 用攻击效果测试和防泄露环境做成 AuraGym,合成监督的误拒更低,训出的 4B 模型增益高于人工测试。

    AuraForge 把真实仓库的历史漏洞修复变成可执行训练任务,用来监督编程智能体同时满足功能请求和隐含的安全要求。

    深度解读完整解读
  7. 风险行为arXiv 2609.39838

    研究:模型易学会隐写传信,隐写推理则难得多

    比较隐写推理与隐写传信、编码推理的可学性

    发表
    测试
    Nemotron-3-Super-120B、GPT-5.5、Claude Sonnet 5 等 14 个
    摘要隐写推理比传信和编码推理更难学。

    Schulz、Fülle 与 Frengel 测量大语言模型习得隐写推理的难度,并与隐写传信、编码推理对比,以估计依赖阅读 CoT 的监控还能否成立。

    深度解读完整解读
  8. 防御arXiv 2609.01046

    HiveTraceGuard-Pro:面向提示注入、越狱与对抗混淆的紧凑生成式护栏

    提出生成式护栏 HiveTraceGuard-Pro,检测提示注入、越狱与混淆

    发表
    测试
    Llama-3.1-Nemotron-Safety-Guard-8B-v3、Nemotron-3.5-Content-Safety、HiveTraceGuard-Pro (0.6B) 等 15 个
    摘要0.6B 俄英护栏在自建俄语干净集和 PI-RU 上得分最高,聚合 key 居第三,过阻断和回复精度仍是作者标出的短板。

    HiveTraceGuard-Pro 是面向请求与回复审核的 0.6B 生成式护栏,由 Qwen3-0.6B 经 LoRA 微调,在俄语和英语上训练,只输出一个 safe/unsafe 裁决。

    深度解读完整解读
  9. 其他arXiv 2609.39982

    Mid-Harness:在模型与 Harness 之间扩展终端智能体的动作采样

    提出 Mid-Harness,在执行前验证并选择终端智能体的候选动作

    发表
    测试
    Nemotron3.5 Lightning、Nemotron3 Ultra、TMAX-9B 等 8 个
    摘要Mid-Harness 在执行前选择候选动作。

    Mid-Harness 在不改生成器和执行 harness 的前提下,于二者之间做动作级测试时计算,用来研究终端智能体里“多采样、再验证”何时提高轨迹成功。

    深度解读完整解读
  10. 防御arXiv 2609.03629

    EraseSAE:用稀疏自编码器在文生视频扩散模型中实现精准概念擦除

    提出 EraseSAE,在文生视频模型中局部擦除指定概念

    发表
    测试
    Flux.1 [dev]、CogVideoX-5B、HunyuanVideo
    摘要EraseSAE 用单义特征局部擦除。

    EraseSAE 把 SAE 用于 DiT 文生视频模型的概念擦除。作者要解决的是:全局改权重或表面负提示对不齐细粒度、分布式的概念,而且会改到无关时空区域。

    深度解读完整解读
  11. 可解释性arXiv 2609.09575

    MonoTM:用可解释单义特征做主题建模,超越关键词表示

    提出 MonoTM,用 SAE 单义特征估计文档主题混合并生成主题描述

    发表
    测试
    llama-embed-nemotron-8b、Gemma-3-27B-IT、Gemma-3-12B-IT
    摘要MonoTM 分开估计混合与解释主题,三套基准上二者偏好的 SAE 配置不同。

    MonoTM 是建在文档嵌入 SAE 上的可解释主题模型:混合估计用全部 SAE 特征,主题描述只用另一套配置里通过验证的语义特征。

    深度解读完整解读
  12. 可解释性arXiv 2609.09909

    解读文本到图像扩散模型中的对象依赖概念脆弱性

    用逐步 SAE 诊断文生图概念脆性,并推理时向类原型插值

    发表
    测试
    FLUX.1-dev、SD 1.5、SD 3.5 等 5 个
    摘要逐步 SAE 诊断物体依赖的概念脆性,早期向类原型插值可在五骨干上提高风格与属性指标。

    作者用逐步稀疏自编码器审计文生图扩散模型里随物体变化的概念脆性,并用推理时原型插值检验该诊断。。

    深度解读完整解读
  13. 攻击arXiv 2609.38253

    CollageAttack:利用跨模态对齐缺陷对 T2I 模型实施空间文本组合越狱

    提出 CollageAttack,用空间文本碎片重组越狱文生图模型

    发表
    攻击者
    黑盒
    测试
    FLUX.2 [dev]、GPT-Image-2、Doubao-Seedream-5.0-Lite 等 5 个

    摘要系统揭示 T2I 跨模态空间合成安全漏洞,证实离散无害元素可在图像层面重构有害意图并放大传播强度。

    深度解读完整解读
  14. 攻击arXiv 2609.36474

    FinRT:将自适应红队策略蒸馏为消费金融领域的可复用对抗生成器

    提出 FinRT,将消费金融自适应红队轨迹蒸馏为可复用对抗提示生成器

    发表
    攻击者
    黑盒
    测试
    Nemotron-3-Super-120B、Llama-3.3-70B、Llama-3.1-8B 等 6 个
    摘要FinRT 用前向失效发现加校准代理 DPO,把消费金融红队收成单次前向生成器。

    FinRT 是面向消费金融的红队框架:先发现政策失效,再训练一个按政策、领域与目标行为出提示的生成器。

    深度解读完整解读