跳到正文

从来源,看到研究的联系

让信息汇流,让研究相连。点选一条线索,看它从哪里来、通向哪些方向。

图中 6 条 · 本页 24 条 · 共 951 条动态论文会议论文
关系图可左右滑动,完整标题也在下方列表中
1 / 4
材料关系图:来源、新闻与研究、细分方向的桑基流图01来源302新闻与研究603细分与主体7来源:arXivarXiv3 条材料来源:arXiv:后门、投毒与隐私arXiv:后门、投毒与隐私1 条材料来源:arXiv:Agent 与 MCP 安全arXiv:Agent 与MCP 安全2 条材料论文:WIFA:按意图分组监督缓解包装式越狱与过度拒答论文2026-08-13WIFA:按意图分组监督缓解包装式越狱与过度拒答论文:StepGuard:用可扩展监督训练步骤级护栏,兼顾安全与效用论文2026-08-25StepGuard:用可扩展监督训练步骤级护栏,兼顾安全与效用论文:Defense-as-Skill:为技能增强型 Agent 演化运行时护栏技能论文2026-09-01Defense-as-Skill:为技能增强型 Agent演化运行时护栏技能论文:MROP:针对 Deep JSCC 后门攻击的掩码区域优化净化方法论文2026-09-01MROP:针对 Deep JSCC 后门攻击的掩码区域优化净化方法论文:CONTINUITY:为可组合的 LLM Agent 安全控制引入安全上下文契约论文2026-09-04CONTINUITY:为可组合的 LLM Agent 安全控制引入安全上下文契约论文:CoER:用对抗协同演化与精炼防御自适应间接提示注入论文2026-09-07CoER:用对抗协同演化与精炼防御自适应间接提示注入方向:MetaMeta1方向:阿里巴巴 · Qwen阿里巴巴 ·Qwen1方向:其他方向其他方向1方向:防御与护栏防御与护栏6方向:Agent 安全Agent 安全4方向:后门与投毒后门与投毒1方向:提示注入提示注入1
流带宽度表示材料数量,多标签均分;连线表示来源与分类归属。1 个较少出现的方向归入「其他方向」,点选可查看。

点选节点,展开一条线索

查看材料的摘要与原文,或探索同一来源、同一方向下的内容。

本页材料

完整标题与摘要 · 24 条
  • 论文arXiv

    WIFA:按意图分组监督缓解包装式越狱与过度拒答

    论文提出 Wrapper-Based Intent-Form Augmentation(WIFA),一种自动意图分组增强方法,把带包装的有害示例与结构匹配的带包装良性反例配对,无需外部教师模型或逐包装的人工意图标注。WIFA 作为通用数据层支持两条微调路线:两阶段高安全配方 WIFA-Boost,以及 Anchored Group-Consistent Refusal Training(A-GCRT),后者在同一意图的不同包装间正则化拒答与合规决策分数,并把有害与良性分组锚定在间隔两侧。

  • 论文arXiv

    StepGuard:用可扩展监督训练步骤级护栏,兼顾安全与效用

    研究者提出 StepGuard,一个步骤级护栏模型,既能审计已完成的智能体轨迹,也能在工具动作执行前进行检查。为训练该模型,作者设计了 StepGen 数据引擎,生成上下文相同但在风险步骤上动作不同的安全与不安全轨迹;并提出 Balance-GRPO,根据观测到的准确率动态平衡安全与不安全动作的学习,以减少过度防御和防御不足。实验显示,StepGuard 在开放权重护栏模型中平均准确率最高,性能与 GPT-5.4 相当;在 AgentDojo 和 AgentDyn 上用于守护智能体时,相比无护栏设置将平均攻击成功率降低 77.3%,平均效用仅下降 2.8 个百分点。该工作已被 EMNLP 2026 接收。

  • 论文arXiv

    Defense-as-Skill:为技能增强型 Agent 演化运行时护栏技能

    论文提出 Defense-as-Skill 防御范式,把运行时护栏本身实现为可安装、可检查、可编辑的技能,以应对技能增强型 Agent 中恶意技能通过持久上下文长期操纵后续动作的问题。其护栏 SkillSonar 与不可信任务技能并行运行,按用户任务边界检查敏感动作,并给出允许、重新规划或确认三种决策,且不修改底层 Agent 运行时。作者构建了任务条件数据集 SCOPE-R,覆盖 6 类风险、21 个子类,含 206 个已确认攻击的恶意实例和 43 个良性任务,并用蒙特卡洛树搜索在训练子集上演化磁盘上的护栏技能。

  • 论文arXiv:后门、投毒与隐私

    MROP:针对 Deep JSCC 后门攻击的掩码区域优化净化方法

    针对 Deep JSCC 图像传输中的输入补丁后门攻击,研究者提出掩码区域优化净化(MROP)。该方法在推理阶段于编码器输入端放置逐像素掩码,通过 Gumbel-sigmoid 松弛优化定位触发补丁并细化触发区域,无需重新训练 JSCC 模型。在 CIFAR-10 和 STL-10 数据集及 DeepJSCC、SwinJSCC 模型上,MROP 大幅降低攻击成功率(ASR),同时保持干净重建的峰值信噪比(PSNR)。

  • 论文arXiv:Agent 与 MCP 安全

    CONTINUITY:为可组合的 LLM Agent 安全控制引入安全上下文契约

    论文提出 CONTINUITY 框架,用于解决 LLM Agent 安全控制的组合问题:来源追踪、授权、策略执行、协议适配与执行控制各自正确,但安全关键上下文在跨组件边界时可能被丢弃、放宽、重绑定或重新解释,作者将这一失效模式称为安全上下文不连续。CONTINUITY 用 assume-guarantee 契约建模每个组件,并通过签名根授权、来源承诺、角色绑定的转换回执、有界类型化释放、转换见证和效果绑定执行许可,在状态转换间传递经过认证的安全上下文。作者形式化了端到端后果完整性,要求每个实际发生的外部效果都有有效且当前的授权见证,串联主体、任务、来源、委托、策略状态、规范动作与终局边界。

  • 论文arXiv:Agent 与 MCP 安全

    CoER:用对抗协同演化与精炼防御自适应间接提示注入

    研究者提出 CoER,将带有多轮工具调用和多次注入的任务建模为一般和马尔可夫博弈,以此训练能够适应不断演化的攻击者的防御方案。该方法先用成功轨迹初始化攻击者,再用双边对抗强化学习(BA-RL)保留双方的历史策略作为对手种群并混合新旧对手,随后复用这些攻击者挑战教师智能体,只用经安全性验证并通过任务完成的示范来微调共同演进的防御者。在七个领域、三个随机种子上,CoER 将自适应攻击成功率从 41.3% 降至 0.2%,并将安全完成率从 39.6% 提高到 76.2%。外部基准上也表现出更强的抗攻击能力,消融实验进一步验证了历史对手混合与基于种群的精炼的有效性。

  • 论文arXiv:Agent 与 MCP 安全

    CapScope:面向编码 Agent 的抗提示注入能力范围授权机制

    研究者提出 CapScope,一种在 harness 层限制工具调用的授权机制,无需模型自行识别恶意文本。它先从可信输入推导任务级权限上限,再为每个 Agent 分配独立的能力集合,存放在模型上下文之外,每次工具调用都按发起该调用的 Agent 的能力进行检查,因此某个子 Agent 获得的权限不会自动传给另一个。作者在 Pi 编码 Agent 上实现该机制,并在一个由编排者向子 Agent 分派子任务的修复流程中评测,覆盖 5 个 Python 任务、5 个注入面、4 种授权条件和每格 3 次试验共 300 次运行。

  • 论文arXiv:Agent 与 MCP 安全

    面向 AI-SOC 的神经符号防御框架:用 SIEM 解码器与 NeMo Guardrails 阻断日志投毒提示注入

    论文提出一种神经符号纵深防御架构,用于保障 LLM 接入安全运营中心(SOC)后的管道完整性,应对通过日志投毒实施的间接提示注入。作者指出,攻击者可在系统日志中嵌入恶意载荷,形成多步 promptware 攻击链,劫持 LLM 的操作逻辑;而确定性防御语义盲、纯神经评估延迟高且存在概率性缺陷。该框架第一层用定制 SIEM 解码器作为确定性预过滤,在数据摄入边缘做结构化清洗,消除体量填充和基于签名的注入;第二层用 NeMo Guardrails 在 LLM 处理前对结构化 SIEM 告警做自检式语义边界校验;同时集成闭环遥测系统,在 SOC 仪表盘中为人工介入提供被拦截攻击的可见性。

  • 论文arXiv:可解释性

    RISA:面向大语言模型拒答校准的响应检查与选择性干预

    RISA 是一个推理时框架,通过检查 LLM 的初始响应并选择性纠正拒答错误,在不更新基座模型参数的前提下提升拒答可靠性。它先用固定上下文规则为明确案例打拒答分数,未匹配案例则由末层提示词隐藏状态经校准线性探针得出分数,并分别校准探针分数、表征支持边界与动作阈值以适配不同基座模型。运行时结合提示词分数与初始拒答状态,仅在必要时干预,实验显示其在提升拒答可靠性的同时基本保持模型效用。

  • 论文arXiv:可解释性

    GAPS:面向条件激活引导的维度级门控

    GAPS(Gated Activation steering via Posterior and Separability)通过维度级条件选择决定对哪些神经元施加激活引导,由两个免训练门控组成:静态可分性门控用 AUROC 筛选携带可靠概念信息的神经元,动态后验门控仅当神经元当前激活更符合目标概念时才干预。

  • 论文arXiv:可解释性

    EraseSAE:用稀疏自编码器在文生视频扩散模型中实现精准概念擦除

    EraseSAE 通过稀疏自编码器在 DiT 架构的文生视频扩散模型中实现精准概念擦除,先以 Partitioned Convolutional Sparse Autoencoder 将稠密时空激活分解为可解释稀疏特征,再用对比归因机制定位概念专属特征核,推理时按时间步生成时空掩码限制擦除范围。实验显示该方法在多种扩散模型和概念擦除任务上实现精确稳健的移除,生成质量损失极小,显著优于现有方法。该工作已被 ECCV 2026 接收,代码已公开。

  • 论文arXiv:可解释性

    局部稀疏性实现无监督 LLM 安全检测

    论文提出基于局部掩码 SAE 的无监督异常检测框架,用于大语言模型的部署期安全检测。作者指出,现有部署期安全方法多为监督式并依赖不安全训练数据,难以覆盖新出现的攻击与危害类别,因此转向只建模安全数据、标记分布外输入的异常检测思路。在线性表示假设下,SAE 恢复的概念空间中邻近点共享较小的公共激活支撑,这一局部稀疏性为高维激活空间中的异常检测提供了理论依据。作者在多种架构和数据集上验证了该方法,涵盖能力测试数据集与安全专用数据集。当允许算法使用 1% 的分布外数据做校准后,局部稀疏方法达到接近最优的性能,且仅用 1-2% 的 SAE 神经元参与计算。

  • 论文arXiv:对齐、欺骗与监督

    现代图像后置水印信道的优化与安全:SNW 方案

    针对现代多比特后置图像水印方案,研究提出其编码器-解码器对隐含定义了并行 AWGN 信道、以 BPSK 调制传输消息,因而受限于二进制字母表、容量被严重压缩,且因缺少密钥而本质不安全。为此提出 SNW 后置水印系统,不依赖固定码本或二进制字母表,借助可达容量的纠错码使速率接近香农容量,在容量上显著优于现有 SOTA 基线并提供强安全保证。

  • 论文arXiv:对齐、欺骗与监督

    TTMark:超越单 token 熵的成对无失真水印

    TTMark(Tandem Token WaterMark)将无失真水印从单个 token 扩展到相邻 token 对,通过对连续 token 的联合分布加水印,把有效水印字母表从 V 扩大到 V²,使检测器能同时利用 token 熵与条件熵。该方法引入分支隔离的串联生成算法,可在单次前向传播中构建联合分布,理论上在低熵场景下具有更强的期望检测强度。在多个语言模型、数据集和三种代表性无失真水印方案上的实验显示,TTMark 在不降低生成质量的前提下持续提升可检测性,并改善抗编辑鲁棒性与局部水印检测能力。

  • 论文arXiv:对齐、欺骗与监督

    SURE:构建可信 AI 的安全框架

    研究提出 SURE(A Safe and Unified AI Framework foR Everyone)框架,用于按国家、文化和企业政策定制 AI 安全属性并加以保障。该框架建立对抗性提示词分类体系并据此构造提示词,定义理想 AI 回复模板与绝对安全评分方案,再通过数据集进行 AI 对齐。在多种基座模型上的实验验证了 SURE 的有效性,论文已被 KDD 2025 EAI Workshop 接收。

  • 动态Help Net Security AI

    Google DeepMind 推出 SynthID Bio,为 AI 设计的蛋白质加水印且不破坏功能

    Google DeepMind 发布 SynthID Bio,一种面向 AI 设计蛋白质的水印方法,并在湿实验中验证其不损害蛋白质功能。该方法把签名隐藏在设计的氨基酸序列和预测三维结构的原子坐标中,DeepMind 称合成后的实体蛋白质也能检出该签名。团队将 AlphaProteo 设计方法与带 SynthID Bio 的 ProteinMPNN 序列生成器配对,在 VEGF-A、SARS-CoV-2 刺突蛋白受体结合域和 PD-L1 三个靶点上做湿实验,水印设计在命中率、结合亲和力和天然序列多样性上与未加水印版本持平。

  • 论文arXiv

    MiniRep:面向多智能体辩论的鲁棒声誉聚合方法

    MiniRep 是一种面向多智能体辩论(MAD)的声誉聚合系统,用于在存在恶意智能体时提升最终答案的可靠性。它基于声誉系统攻击与软件测试变异算子构建攻击分类体系,同时依据智能体在当前任务上的行为和长期声誉进行评估,并抑制高度相似回答的智能体群体主导决策。在 MATH 等任务上,MiniRep 无论是否遭受攻击都优于传统 MAD 聚合与常规声誉方法;在 10 个异构智能体的 MATH 设置下,于全部 28 种攻击条件下均优于所有基线。

  • 论文arXiv

    研究者提出梯度封堵实现 LLM 发布前的预防性遗忘

    研究者提出梯度封堵(gradient sealing)方法,用于在开放权重 LLM 发布前阻止下游微调重新习得被禁能力。作者先验证现有回顾式遗忘方法在发布前防护上不足:即使当前输出已抑制被禁能力,被禁领域数据仍能通过内部通路产生梯度,使能力在后续微调中被重新获得。梯度封堵的原理是把相关预激活推入负区间,使 ReLU 族激活的导数变为零或接近零,从而阻断这些通路。在多个 LLM 系列上的实验显示,该方法对下游能力习得的抵抗强于回顾式基线。

  • 论文arXiv:后门、投毒与隐私

    Unmerge:用任务算术实现高效机器遗忘

    Unmerge 将机器遗忘重构为任务算术的逆运算:微调得到的合并任务向量减去低秩遗忘分量即可恢复保留任务向量,因为遗忘激活在每层都集中在少数主方向构成的子空间内。在 CIFAR-100 和 Tiny ImageNet 上对 ResNet-50 做类别级遗忘时,其 Tug-of-War 指标比同等运行时间的基线最高提升约 24%,比运行慢约 5 倍的更强基线最高提升约 18%,成员推断暴露维持在重训练水平。该方法同样适用于 ViT-S/16,并可扩展到 Llama-3.2-3B,其逐层基几何还可作为判断遗忘何时何地结构性困难的诊断工具。

  • 论文arXiv:后门、投毒与隐私

    NDDL:用正常扩散动力学为文生图模型做后门防御

    研究者提出 Normal Diffusion Dynamics Learning(NDDL),一种仅用正常样本训练的文生图扩散模型后门防御框架。该方法观察到正常扩散轨迹在 cross-attention、潜空间和噪声空间中呈现结构化且随 timestep 变化的转移模式,而后门攻击会使其偏离这种正常演化。NDDL 构建紧凑的多空间轨迹表示,训练一个以 timestep 为条件的动力学模型来预测扩散演化,推理时用观测转移与预测转移之间的偏差量化动力学不一致性以检测后门。该框架还能在无需任何后门先验知识的情况下,通过低语义词替换实现触发器定位。多种后门攻击上的实验显示其有效性与泛化性。

  • 动态arXiv:Agent 与 MCP 安全

    可验证操作卡 VAC:为自主 Agent 提供可信人在回路控制

    论文提出可验证操作卡(VAC),一种从真实待执行的浏览器操作和可信意图来源重建审批信息、在可信浏览器界面中带外渲染、并把审批绑定到派发时重新验证的同一操作的架构级防护。VAC 结合来源隔离、真实操作描述符、默认拒绝确认、来源感知风险门控和执行绑定,并在一个完整的智能体浏览器中实现。在覆盖混淆代理攻击、Lies-in-the-Loop 对话伪造、间接提示注入、自适应操作替换、来源规避和正常任务的 24 场景基准上,无 VAC 时各评测 LLM 的攻击成功率为 68% 至 100%,VAC 将每个模型的攻击成功率降至 0%,正常任务完成率 78%,误拦截率 0%。

  • 动态arXiv:越狱、提示注入、投毒与防御

    ACTR:对齐推理链与回答以提升推理大模型的多语言安全

    研究者提出 ACTR 框架,通过强化推理大模型已有的安全推理来提升多语言安全对齐。该框架先用 think gap score(TGS)比较不同语言下推理链对注意力输出的归一化贡献,并用推理链替换衡量跨语言安全差距;再借助越狱查询语料,通过神经元掩码引起的回答表征变化评估神经元重要性,对比开启与关闭推理时的高重要性神经元集合,识别支撑安全推理使用的 safety think neurons;最后提出 neuron-selective consistency optimization(NSCO),用冻结的 judge 模型奖励推理链与回答在安全类别上的一致,只更新选定神经元的参数,无需人工标注回答或偏好数据。

  • 论文arXiv:越狱、提示注入、投毒与防御

    Aletheia:面向编码 Agent 规则的权限最小化测试框架

    Aletheia 是一个针对编码 Agent 仓库指令文件的权限最小化测试框架,用于发现恶意规则在生成正确补丁的同时索取凭据访问或数据传输权限。它把规则请求的权限翻译为带类型语言并合成可执行沙箱配置,在完整权限和逐项移除权限的独立限制下运行同一条未修改的规则与任务;若在严格削减权限后仍通过功能测试,就得到该权限可被舍弃的见证,再结合任务上下文诊断可疑请求。作者形式化了配置合成及见证与强制限制之间的条件。在共享重构任务上,Aletheia 执行并检出全部 314 条 AIShellJack 攻击输入,对五个良性模板无误报;在 80 条人工核验的良性 GHAgentFiles 规则中产生 3 个误报(3.75%)。

  • 论文arXiv:越狱、提示注入、投毒与防御

    推理层安全:防御对抗性推理与基础设施滥用

    论文研究 LLM 服务在推理层面临的对抗性交互,包括越狱、拒绝服务与知识蒸馏攻击,并以假设的前沿实验室 Five Elements Inc. 为例展开。由于缺少公开的对抗性 LLM 使用标注数据集,作者提出结构因果模型(SCM)生成带标签的用户会话数据集,包含协同多账号活动、平台反馈和三个层级的标签可观测性。在该数据集上训练的梯度提升检测器对 oracle 标签的二元分类 AUPRC 达 0.993,但面对真实 Trust & Safety 团队持有的运营标签时 AUPRC 仅 0.313,说明检测器比用于评估它的标签更准确。攻击类型归因方面,朴素 argmax 受 98% 良性先验主导,macro-F1 仅 0.295,改用简单阈值决策引擎后提升到 0.489 且不损失准确率。数据集已公开。