跳到正文
10月10日 · 周六

全部论文

找到 63 篇

另有 194 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2610.09941

    OrthoPurify 用一步正交投影净化被后门污染的视觉语言模型

    提出 OrthoPurify,用正交投影清除视觉语言模型适配器中的劫持方向

    发表
    被测模型
    LLaVA-1.5-7B、Qwen3-VL-8B、LLaVA-1.5-13B 等 5 个
    摘要一次投影去掉劫持方向。

    OrthoPurify 是部署前的 LVLM 后门净化方法,用一次正交投影去掉被劫持的权重更新方向。

    深度解读完整解读
  2. 防御arXiv 2610.06576

    研究:智能体欺骗行为在外部显现前已可从内部表征预测

    提出基于决策前隐藏状态的检测与引导,预测并抑制智能体欺骗

    发表
    场景
    AI Agent
    被测模型
    Qwen3-14B

    摘要论文展示了智能体自发欺骗可在行为显现前由内部表征预测,并通过激活引导证实了表征的行为可操作性。

    深度解读完整解读
  3. 防御arXiv 2610.05219

    AURA:用正交适配缓解 LLM 推理与安全对齐的子空间干扰

    提出 AURA,用正交惩罚分开顺序适配中的推理与安全子空间

    发表
    被测模型
    Qwen-3-14B、Qwen-2.5-14B-Instruct、Llama-3-8B-Instruct 等 4 个
    摘要AURA 用子空间正交分开顺序任务。

    AURA 是面向共享骨干智能体的顺序 LoRA 正则,用来分开前后任务的残差子空间。

    深度解读完整解读
  4. 防御arXiv 2610.05162

    MemAdapter:用反事实适配缓解记忆诱发的谄媚

    提出 MemAdapter,在检索后约束记忆对智能体推理的影响

    发表
    场景
    AI Agent
    被测模型
    DeepSeek-V4-Flash、GPT-5.6-sol、Qwen3-8B
    摘要检索后三阶段调节记忆角色。

    MemAdapter 是给长期记忆智能体用的检索后调节框架,用来处理记忆诱发谄媚。

    深度解读完整解读
  5. 防御arXiv 2610.04412

    论文研究 LLM 数字孪生参与增强民主时的提示注入脆弱性

    提出检测、结构化与 GSPO 流程,降低共识生成的提示注入错位

    发表
    被测模型
    LLaMA-2 7B、LLaMA-3 8B、GPT 3.5 Turbo 等 14 个
    摘要三章依次做个体偏好预测、政党知识图谱审议,以及共识生成对提示注入的脆弱性与一条防御流程。

    这是一篇把 LLM 数字孪生放进增强民主的博士论文,分个体表示、政党聚合和共识生成的提示注入三章。

    深度解读完整解读
  6. 防御arXiv 2610.04699

    CoVer:用干预检验为 Agent 构造可判定规则边界

    提出 COVER,用干预门判定 Agent 规则谓词能否自动执行

    发表
    场景
    AI Agent
    被测模型
    Claude Sonnet、Claude Opus、GPT-4o 等 5 个
    摘要自可判定不能向模型索取。

    这篇工作测的是智能体验证器在检查之前的分流:外部规则里的哪条谓词能用固定过程解决,哪条必须交给评审。

    深度解读完整解读
  7. 防御arXiv 2610.02349

    MIRROR:面向多智能体通信的法定人数完整性防御

    提出 MIRROR,用多路径摘要多数表决保障多智能体通信完整性

    发表
    被测模型
    Gemma-4-31B-it、Gemini 2.5 Pro
    摘要MIRROR 靠多数路径。

    MIRROR 是 LLM 多智能体通信层上的多路径法定人数完整性原语,只处理不透明字节,不解释消息内容。要处理的是 Agent-in-the-Middle:中介合法终结 TLS 后可改在途消息,而语义校验有推理开销和误拦,签名又要求私钥管理。做法是生成结束后复制同一规范化载荷。

    深度解读完整解读
  8. 防御arXiv 2610.02005

    贝叶斯辩证论证(BDA):面向持续对抗下多 LLM 委员会的可校准聚合

    提出 BDA,按辩证动作可靠性加权聚合多 LLM 议会以抵抗持续对抗

    发表
    摘要BDA 用零额外调用的可靠性加权,给出可校准后验,并在持续对抗下反转不可靠席位。

    BDA 是一种不另调 LLM 的多 LLM 议会聚合方法,同时处理置信度校准和持续不可靠席位。

    深度解读完整解读
  9. 防御arXiv 2610.01800

    LineupRL:基于描述与时序配对识别的可验证强化学习时间序列描述方法

    提出 LineupRL,用描述到序列识别作可验证奖励训练时序描述模型

    发表
    摘要LineupRL 用统计近邻上的序列识别做可验证奖励,3B 描述器超过 SFT、两种 RL 奖励和 72B 教师。

    LineupRL 是给开放式时间序列描述用的 RLVR:不模仿合成参考,而奖励一条描述能否让冻结文本 LLM 从相近序列里认出目标。

    深度解读完整解读
  10. 防御arXiv 2610.00883

    DeBERTa-ConPara:面向部署的 AI 生成文本检测,推理端 Unicode 归一化提升对抗鲁棒性

    提出推理时 Unicode 归一化的检测器,识别遭字符级扰动的 AI 生成文本

    发表
    被测模型
    microsoft/deberta-v3-large、deberta-v3-base、bert-large-cased 等 4 个
    摘要推理时归一化消除两类 Unicode 攻击,训练时归一化则会删掉对抗监督。

    DeBERTa-ConPara 是一个面向部署的 AI 文本检测器:DeBERTa-v3-large 在多数据集原始文本上训练,推理前做确定性 Unicode 归一化,用一个固定阈值面对没有目标域标签的场景。

    深度解读完整解读
  11. 防御arXiv 2610.00850

    AuraForge:为训练安全编码 Agent 扩展安全监督

    提出 AuraForge,从漏洞修复合成安全测试并训练编码 Agent

    发表
    被测模型
    Qwen3.5-4B、GLM 4.7 Flash、Qwen3-Coder-Next 等 7 个
    摘要AuraForge 用攻击效果测试和防泄露环境做成 AuraGym,合成监督的误拒更低,训出的 4B 模型增益高于人工测试。

    AuraForge 把真实仓库的历史漏洞修复变成可执行训练任务,用来监督编程智能体同时满足功能请求和隐含的安全要求。

    深度解读完整解读