跳到正文
10月9日 · 周五

全部论文

找到 19 篇

另有 441 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2602.24210

    研究者提出 Staged Decoding 与 SFT 数据集,减少大推理模型推理轨迹中的隐私泄露

    提出 Staged Decoding 与指令跟随训练,减少推理轨迹隐私泄露

    发表
    测试
    Phi 4 3.8B、Phi 4 14B、Qwen 3 1.7B 等 6 个
    摘要用一般指令跟随训练加分段解码,可降低轨迹隐私泄露,但数学效用下降。

    本文把大推理模型的隐私问题做成轨迹可控性:隐私指令是指令,轨迹不跟随就会把敏感上下文写进可被提示注入导出的文本。

    深度解读完整解读
  2. 评测与基准arXiv 2610.02293

    HakemBench:土耳其语类型化决策基准发布

    发布 HakemBench,评测土耳其语定型决策的质量、校准与选择性自动化

    发表
    测试
    open-jev (DeBERTa-v3-large)、Gemini 3.8 Flash、GPT-5.6 Sol 等 11 个
    摘要HakemBench 评测土耳其语定型决策。

    HakemBench v1.0 是土耳其语定型决策的开放基准,看模型在固定选项上给出的概率是否可用,以及不确定时能否把案例交给人。

    深度解读完整解读
  3. 评测与基准arXiv 2608.20554

    aiXamine:跨维度评测 LLM 安全、安全(security)与隐私权衡

    提出 aiXamine 黑盒基准,统一评测 LLM 安全、稳健与隐私权衡

    发表
    测试
    Phi-4、openai/gpt-5-mini、openai/gpt-4o 等 15 个
    摘要aiXamine 用九服务黑盒协议比较百余个模型,作者称单轴信任度进展可能削弱其他轴。

    aiXamine 是一套黑盒评测协议,用来在同一条件下比较 LLM 的 safety、security 与 privacy,而不是再产出一个能力分。

    深度解读完整解读
  4. 攻击arXiv 2610.01062

    Kernelized Activation Steering:将激活引导推广到再生核希尔伯特空间的新框架

    提出核化激活引导 KAS,在推理时自适应转向激活以诱导越狱

    发表
    测试
    FLUX.1 [schnell]、Qwen2.5-7B-Instruct、Gemma-2-9B-IT 等 6 个
    摘要KAS 用核梯度做局部自适应转向,并在线性核下恢复 DiM。

    Kernelized Activation Steering(KAS) 把推理时的激活转向写成核空间中的优化,使更新随当前激活相对源、目标参考集的位置而变化。

    深度解读完整解读
  5. 可解释性arXiv 2609.05074

    Influence Score 与 Transformer 可解释性:推理时注意力头有效影响的度量

    提出 influence score,量化提示注入检测器各注意力头的有效贡献

    发表
    测试
    DeBERTa-v3-base prompt-injection classifier
    摘要该分数把注意力头的方向与残差贡献连到分类,并分开正确与错误预测。

    这项工作在推理时给提示注入检测分类器的注意力头一个影响分数,用来看分类决策从哪些头来。缺口是电路分析往往要重插桩,只看输出又不知道内部组件的贡献。作者希望同时看到决策在哪一层形成、哪些头在推,以及正确与错误是否对应不同机制。

    深度解读完整解读
  6. 防御arXiv 2609.03629

    EraseSAE:用稀疏自编码器在文生视频扩散模型中实现精准概念擦除

    提出 EraseSAE,在文生视频模型中局部擦除指定概念

    发表
    测试
    Flux.1 [dev]、CogVideoX-5B、HunyuanVideo
    摘要EraseSAE 用单义特征局部擦除。

    EraseSAE 把 SAE 用于 DiT 文生视频模型的概念擦除。作者要解决的是:全局改权重或表面负提示对不齐细粒度、分布式的概念,而且会改到无关时空区域。

    深度解读完整解读
  7. 可解释性arXiv 2609.09909

    解读文本到图像扩散模型中的对象依赖概念脆弱性

    用逐步 SAE 诊断文生图概念脆性,并推理时向类原型插值

    发表
    测试
    FLUX.1-dev、SD 1.5、SD 3.5 等 5 个
    摘要逐步 SAE 诊断物体依赖的概念脆性,早期向类原型插值可在五骨干上提高风格与属性指标。

    作者用逐步稀疏自编码器审计文生图扩散模型里随物体变化的概念脆性,并用推理时原型插值检验该诊断。。

    深度解读完整解读
  8. 攻击arXiv 2609.09865

    CGMIA:用成员推理攻击检测代码生成基准的数据泄漏

    提出 CGMIA,用成员推理检测代码生成基准的数据泄漏

    发表
    攻击者
    灰盒
    测试
    Phi-2 (2.7B)、Qwen2.5-Coder (3B)、CodeGemma (2B) 等 5 个
    摘要CGMIA 融合相似度、通过率、困惑度与 CodeBERT,在模拟泄漏上优于八个 MIA 基线。

    CGMIA 用成员推断检测代码生成基准是否泄入 LLM 训练集,使评测不依赖对训练语料的直接访问。

    深度解读完整解读
  9. 可解释性arXiv 2609.36138

    SAKIKO:对工具调用 LLM 内部干预的机制审计框架

    提出 SAKIKO 框架,审计工具调用 LLM 的定向激活干预是否构成修复

    发表
    场景
    AI Agent
    测试
    Phi-3.5-mini、Qwen2.5-7B、Llama-3.1-8B 等 8 个
    摘要SAKIKO 用目的地、保持和预注册不确定性裁定内部转向是否算修复。

    SAKIKO 审计工具型 LLM 在执行前 K 路动作上的内部干预:行为净增益、到达正确动作、保住原本正确的决策、以及统计证据充分,是四件分开的事。

    深度解读完整解读
  10. 可解释性arXiv 2609.37737

    研究用因果激活修补定位模型服从提示注入指令的决策层

    用因果激活修补定位模型服从提示注入的决策层

    发表
    测试
    Phi-3-mini、Qwen3-4B、Qwen3-14B 等 7 个
    摘要合规的因果杠杆集中在网络后三分之一的低秩子空间,该层也是混淆下检测最好的位置。

    这篇工作用逐层激活修补定位提示注入合规发生在网络何处,并把该位置用于检测验证。。

    深度解读完整解读
已经到底了