跳到正文

从来源,看到研究的联系

让信息汇流,让研究相连。点选一条线索,看它从哪里来、通向哪些方向。

图中 6 条 · 本页 24 条 · 共 946 条动态论文会议论文
关系图可左右滑动,完整标题也在下方列表中
1 / 4
材料关系图:来源、新闻与研究、细分方向的桑基流图01来源302新闻与研究603细分与主体5来源:论文追踪论文追踪1 条材料来源:arXivarXiv3 条材料来源:arXiv:越狱、提示注入、投毒与防御arXiv:越狱、提示注入、投毒与防御2 条材料论文:Uber 提出 ADR 企业级 Agent 检测系统,在 7200 台主机部署十个月论文2026-05Uber 提出 ADR 企业级 Agent 检测系统,在 7200 台主机部署十个月论文:面向音频深度伪造检测的任务感知联合剪枝与蒸馏框架论文面向音频深度伪造检测的任务感知联合剪枝与蒸馏框架论文:AVCE:面向扩散模型可验证概念擦除的审计感知遗忘框架论文AVCE:面向扩散模型可验证概念擦除的审计感知遗忘框架论文:Thrive:面向自回归 TTS 的抗重建攻击多比特语音水印框架论文Thrive:面向自回归 TTS 的抗重建攻击多比特语音水印框架论文:研究揭示 CaMeL 防护在多智能体系统中失效并提出 multi-CaMeL论文2026-10-05研究揭示 CaMeL 防护在多智能体系统中失效并提出 multi-CaMeL论文:SENTINEL:通过意图感知的输入-输出匹配防御 LLM 越狱论文SENTINEL:通过意图感知的输入-输出匹配防御 LLM 越狱方向:Agent 安全Agent 安全2方向:开源模型安全开源模型安全1方向:防御与护栏防御与护栏6方向:隐私与数据泄露隐私与数据泄露1方向:提示注入提示注入1
流带宽度表示材料数量,多标签均分;连线表示来源与分类归属。

点选节点,展开一条线索

查看材料的摘要与原文,或探索同一来源、同一方向下的内容。

本页材料

完整标题与摘要 · 24 条
  • 论文论文追踪

    Uber 提出 ADR 企业级 Agent 检测系统,在 7200 台主机部署十个月

    据 Uber 团队自报,Uber 团队提出 ADR(Agentic AI Detection and Response)系统,用于防护通过 MCP 运行的 AI 智能体,由采集提示词、推理步骤与工具调用因果链的 ADR Sensor、预部署红队的 ADR Explorer 和两级在线检测的 ADR Detector 组成。该系统在 Uber 部署超过十个月,覆盖 7200 多台主机、每日处理逾 1 万次 Agent 会话,发现 26 类凭证泄露,并支撑一个精确率 97.2% 的凭证泄露拦截层。ADR-Bench 与 ADR Sensor 及检测框架源码已在 GitHub 公开。 上述部署规模及效果来自团队自身报告,并非独立验证结果。

  • 论文arXiv

    面向音频深度伪造检测的任务感知联合剪枝与蒸馏框架

    针对基于自监督学习(SSL)的音频深度伪造检测器参数量普遍超过 300M、难以部署到资源受限设备的问题,研究者提出任务感知联合剪枝与蒸馏框架,将跨域知识蒸馏与运动引导结构化剪枝结合,在激进压缩下保留伪造判别知识与关键结构。该框架把模型压缩至 31.9M 参数、FLOPs 降低 6.3 倍,在多个数据集上相比未压缩基线平均性能仅下降 1.30%。

  • 论文arXiv

    AVCE:面向扩散模型可验证概念擦除的审计感知遗忘框架

    研究者提出 AVCE(Auditing-Aware Unlearning for Verifiable Concept Erasure in Diffusion Models),一种把概念擦除落到模型潜空间表征的遗忘框架。作者指出,多数擦除方法只在文本接口干预,通过提示词修改或文本条件权重的局部更新实现,并以给定提示词下的输出作为评估依据,而潜空间审计绕过文本条件直接探测去噪网络,显示被擦除概念仍可从内部表征中恢复,这一问题在抗对抗提示词的方法中同样存在,且随擦除概念数量增加而加剧。AVCE 审计每个概念的嵌入向量邻域,将发现的脆弱方向压缩为最弱几何点上的锚点,在该锚点以闭式解编辑交叉注意力和自注意力投影,再用路径级审计损失微调两条路径,并通过正交梯度投影整合多个概念。

  • 论文arXiv

    Thrive:面向自回归 TTS 的抗重建攻击多比特语音水印框架

    针对自回归 TTS 合成语音在分发编辑中经历学习式重建后水印难以可靠恢复的问题,研究者提出多比特生成式语音水印框架 Thrive,覆盖离散 token 与连续表示两种生成范式。其 Rise 模块将水印注入中间表示并与后续生成同步,Care 模块按比特可靠性融合波形与频谱专家。实验显示 Thrive 在保持合成保真度的同时,于重建攻击下取得 87.6% 平均恢复准确率,并支持最多 10,000 个候选身份的来源归属。

  • 论文arXiv:越狱、提示注入、投毒与防御

    研究揭示 CaMeL 防护在多智能体系统中失效并提出 multi-CaMeL

    牛津大学等机构的研究者发现,为每个智能体单独部署 CaMeL 防护不足以保证多智能体系统安全:不可信数据跨越智能体边界后被下游智能体当作可信输入,从而劫持其控制流,作者将这一失效模式称为 boundary laundering,并构造了具体攻击。为此他们提出 multi-CaMeL,在智能体间通信中把可信自然语言指令与不可信数据分离到不同通道,并在运行时保留数据来源信息。在扩展 AgentDojo 得到的 MultiAgentDojo 基准上,multi-CaMeL 将攻击成功率从无防护的 12.9%、单智能体 CaMeL 的 0.2% 降至 0.0%;在 AssetOpsBench 上相对单智能体 CaMeL 平均仅增加 3.2 个百分点的效用损失,且模型能力越强损失越小。作者同时开源了 MultiAgentDojo 及 multi-CaMeL 实现。

  • 论文arXiv:越狱、提示注入、投毒与防御

    SENTINEL:通过意图感知的输入-输出匹配防御 LLM 越狱

    研究者提出生成时越狱防御方法 SENTINEL,将防御重构为意图提取问题,利用指令微调 LLM 的输入-输出语义一致性,匹配语义对齐区域以提取暴露意图的子序列,并用拒答方向投影打分、必要时中止生成。在 HarmBench 上对多个 LLM 的实验中,SENTINEL 将越狱成功率降至接近 5%,同时保持较低的过度拒答,并对自适应攻击表现出鲁棒性。

  • 论文arXiv:越狱、提示注入、投毒与防御

    无需目标答案的潜在空间安全对齐:无监督对抗训练提升 LLM 越狱鲁棒性

    针对现有对抗训练依赖固定有害目标或固定良性—有害数据对做定向激活消融、导致对抗样本行为单一的问题,研究者提出无目标对抗训练框架 Target-free Latent Safety Alignment,以无监督方式放大并多样化模型潜在空间中的行为级偏移,生成语义多样的对抗样本。该方法用语义熵作为输出层面的对抗行为多样性度量,在目标模型上诱发出多种有害行为,缓解行为窄化并提升对越狱攻击的鲁棒性。

  • 论文论文追踪

    SRFT:让 Agent 从失败经验中自我反思以抵御提示注入

    研究者提出 Self-Reflection Fine-Tuning(SRFT)训练框架,让 LLM Agent 通过从自身在对抗条件下的失败经验中学习来提升鲁棒性。该方法不被动模仿专家行为,而是让 Agent 接触由注入攻击构造的被污染轨迹,再由专家模型生成结构化的自我反思推理,对比不安全动作与最优动作,从而学会识别恶意指令、推理其后果并保持与原始用户意图一致。作者基于 Llama-3.1-8B-Instruct 和 Qwen3-8B 构建了 SR-Agent,并在静态与自适应提示注入基准上评测,结果显示 SRFT 大幅降低攻击成功率,同时保持任务性能,在自适应攻击下也表现出较强泛化能力。代码已公开。

  • 论文Hugging Face Daily Papers

    OmniConfess:用 Token 级「忏悔」缓解全模态幻觉

    研究提出免训练的 OmniConfess,通过固定候选回答、在受控的分通道证据干预下按 token 粒度重新打分,生成结构化的「token×通道忏悔」,从而定位回答依赖的证据,保留有依据内容、纠正由无关或矛盾证据驱动的表述。作者同时构建了 OmniHalluBench,由六个数据集组成、覆盖文本、图像、音频、视频及判断与自由生成,共 3,540 个样例;实验显示该方法在多种模态与任务设置下均能缓解幻觉,代码与基准已公开。

  • 论文论文追踪

    RAISED:用自蒸馏抵御工具调用中的提示注入

    论文提出 RAISED(Robust Attack Invariance through Self-Distillation)训练框架,用于抵御工具调用型语言模型智能体面临的间接提示注入。作者指出,现有训练式防御会显著改变模型输出分布,在良性场景下也造成行为漂移,并存在一种失败模式:在良性工具使用任务中,模型会省略完成授权任务所需的步骤,尤其是该步骤由工具输出指示时。RAISED 先让模型自行生成工具使用场景,重点覆盖需要依据工具输出中的合法指引才能完成任务的情形,再通过自蒸馏让学生在同一轨迹的干净版本与注入版本上都对齐教师的干净上下文行为。论文称该方法大幅降低工具响应中提示注入的攻击成功率,且不同于此前的训练式防御,在智能体与通用基准上都能保持效用。

  • 论文arXiv:可解释性

    EmoRSS:缓解大语言模型由情绪引发的过度拒答

    研究发现情绪化表达会系统性提高大语言模型对良性请求的拒答倾向,造成不必要的过度拒答。为此提出的 EmoRSS 是一种激活引导方法:先用逐层线性探针定位拒答敏感层,并基于与探针方向对齐的稀疏自编码器(SAE)特征构建拒答子空间,再用同一查询的常规与情绪化请求对估计该子空间特征的平均激活偏移,将其解码为激活干预向量,在推理时沿反向拒答方向施加,且不更新主干参数。在两个大语言模型上的实验显示,当请求含情绪化表达时,EmoRSS 在拒答有害请求与回答良性请求之间取得了优于既有过度拒答缓解基线的权衡,同时更好地保留通用任务性能。

  • 论文论文追踪

    研究:任务范围授权可将工具调用有害执行降至零

    该研究讨论任务范围授权与配对重放。

  • 动态Undercode News

    Dify 1.17.1 收紧知识库安全并修复 RAG 抽取

    Dify 1.17.1 引入按数据集范围划分的知识库 API key,修复源文档抽取问题,并加固对不可信文档的处理。该版本还提示内置 Weaviate 需分阶段升级。上述内容来自 Undercode News 的二手报道,原始发布说明未被查阅。

  • 论文Hugging Face Daily Papers

    FailBank:用运行时反馈自进化提升 VLA 模型任务成功率

    针对视觉-语言-动作(VLA)模型中运行时护栏只纠正单次动作、不改变底层策略的问题,研究者提出四阶段自进化框架 FailBank,把运行时反馈转化为持久的策略改进。在 VLA-Arena 基准的两个难度等级和两个 VLA 主干上,FailBank 相比基础策略将任务成功率提升 8.5 和 6.9 个百分点,策略引发的累计代价降低 35.6% 和 23.8%;相比运行时护栏,成功率提升 25.4 和 9.5 个百分点,累计代价相当。

  • 论文论文追踪

    MIRROR:面向多智能体通信的法定人数完整性防御

    研究者提出 MIRROR,一种通信层完整性原语,用于防御 LLM 多智能体系统中的 Agent-in-the-Middle(AiTM)攻击。该方法将同一规范化载荷复制到 k 条逻辑路由,仅当严格多数路由报告相同摘要时才接受消息,其安全性来自诚实路由占多数的假设,而非密钥认证。作者在路由被攻陷比例 alpha < 0.5 下给出保证,并扩展到路由故障相关的情形,指出关键量是最大共享故障组规模而非路由数量;同时证明可用性与完整性在同一阈值退化,低于 alpha = 0.5 时法定人数拒绝和丢消息攻击者无法阻断诚实流量。该工作已被 NeurIPS 2026 FLMSec Workshop 接收。

  • 动态Goodfire

    Goodfire 推出基于蛋白质模型嵌入向量的生物安全序列感知监控器

    Goodfire研究人员提出基于蛋白语言模型表征的序列风险监控器,用于生物研究智能体工作流中的双重用途筛查。他们在自建基准上发现,所测前沿模型的拒答主要受任务描述影响,对危险和良性序列的区分不足;序列监控器在被测改写、片段化和部分留出条件下优于序列比对筛查。作者报告该方法达到毫秒级处理,但重设计蛋白是否保留生物活性仅通过计算估计,未经实验验证。结果限定于被测序列与基准,不能视为全面生物安全保证。

  • 论文arXiv

    Pheo 提出 OATS:用确定性解析器在运行时治理 Agent 技能动作

    Pheo Inc 的 Rohit Taneja 等人提出 OATS(Open Agent Trust System),在 Agent 决定动作但尚未执行时做运行时治理,回答的是某个动作在当前机器和操作者策略下是否被允许,而非技能是否恶意。作者在 66,192 个公开 ClawHub 技能版本上测量发现,705 个被三个扫描器和注册表评审全部判为 clean 的技能,仍指示了 CIS Control 2.7 和 NIST SP 800-53 CM-11 列为禁止的动作,涉及 135 个发布者,其中单一发布者占 506 个;对 100 个样本的人工审计给出 92% 精确率(95% CI [84.8%, 96.5%])。OATS 的解析器不读技能文档、不调用模型,中位端到端耗时 67.6 ms,输出接入按(资源, 类别)计数的信任账本,升级阈值由操作者自述风险容忍度推导,而非固定十次干净批准。

  • 论文论文追踪

    HASTE:用稀疏威胁证据自动演化 Agent 护栏以抵御新兴攻击

    HASTE 是一个多智能体框架,通过安全规范生成与攻击用例生成之间的对抗循环,从威胁报告和预印本中稀疏的描述或少量攻击样例出发,自动演化 Agent 护栏。安全规范引导护栏更新以修补已识别的安全漏洞,攻击用例则在每次更新后探测残余漏洞,评估结果反馈回两个过程,使护栏能应对初始证据之外的新兴攻击。在多种基座模型、攻击类型和证据形式上的实验显示,HASTE 持续降低攻击成功率,同时保持良性任务的效用。代码已公开。

  • 论文arXiv

    RMCW:基于 Reed-Muller 码的抗删除 LLM 水印方法

    研究者提出 RMCW,一种基于 Reed-Muller 码的大语言模型水印方法,用于应对删除攻击导致的 token 位置偏移和水印对齐失效。生成阶段通过密钥化的词表划分把 Reed-Muller 结构注入文本序列;检测阶段将文本映射到密钥词表分箱,并用 Berlekamp-Welch 检验测试局部子序列的低次 Reed-Solomon 一致性,从而寻找存活的局部代数结构而非恢复全局码字。在 C4 和 ELI5 数据集、OPT-1.3B 与 Llama-3.1-8B-Instruct 上的实验显示,RMCW 保持较强的干净文本可检测性,并在多种删除与改写攻击下优于或持平基线方法。代码已开源于 https://github.com/BaichengDanny/RMCW。

  • 论文arXiv:越狱、提示注入、投毒与防御

    Persona Guardrail:面向智能体系统的生产级防御框架

    作者提出 Persona Guardrail,通过基于智能体预定功能的输入输出校验限定其行为范围。摘要报告,在 PAGE 评测中,相较通用 LLM 护栏,整体准确率、域外检测率和误放行率均有改善。作者称该框架已用于生产部署并满足延迟预算;这些是论文摘要中的自报结果,本条没有独立复现,不能推及未测场景或普遍安全保证。

  • 论文arXiv:越狱、提示注入、投毒与防御

    SecJev:为 System One 决策模型引入安全专业知识

    研究者提出 SecJev,据称是首个面向安全的 Jev 类决策模型家族,参数规模覆盖 0.8B 至 9B,基于 Kev 的单次候选打分器,从文本、遥测和观测历史中学习布尔、选择与有序决策。团队构建 SecJev-Corpus,统一 14 项任务、8 类来源的源标签预测与显式策略评估,覆盖工具输出、流量、联邦更新、共识、认证与车辆消息。安全专业化使家族中每个模型均有提升,SecJev-0.8B 在任务宏平均准确率上超过通用 Kev-9B 达 20.51 个百分点,并在提示注入与流量决策上复现增益,同时伴随依赖捕获的误报。

  • 论文arXiv:越狱、提示注入、投毒与防御

    论文提出在 Kubernetes 上保护 AI Agent 的七层纵深防御框架与参考架构

    论文主张不应把模型本身当作安全边界,Agent 在 Kubernetes 上的安全应作为基础设施问题处理,所有保证都需在 Agent 已被提示注入完全攻陷的假设下成立。作者提出十类威胁分类法(对齐 OWASP 智能体应用指南)、九条设计原则(核心是工具边界的完全中介,以及打破不可信输入、敏感访问与外部外发三者的组合)、七层纵深防御框架,并映射到工作负载身份、RBAC 与 ValidatingAdmissionPolicy、基于 SIG Apps Agent Sandbox 项目的 gVisor/Kata 沙箱、FQDN 感知的外发策略、带策略即代码的 Agent/MCP 网关与 eBPF 运行时执行等 Kubernetes 原生机制。作者未报告实测的攻击成功率或性能开销数据,而是列出残余风险和验证该框架所需的测量项。

  • 论文arXiv:越狱、提示注入、投毒与防御

    研究提出基于收缩约束状态空间模型的有界可达性与越狱检测方法

    论文研究基于状态空间模型(SSM)的安全头何时能被认证为对嵌入空间有界扰动内的所有输入给出相同预测,证明关键在于状态转移矩阵的 l∞ 范数满足收缩条件(‖A‖∞<1),此时可对线性时不变分类器做精确区间界传播(IBP)认证。收缩条件成立时可达输出区间稳态宽度有界,样本可被认证为鲁棒分类;条件不成立时区间随序列长度指数增长,任何实际扰动半径下都无法认证。作者用 hinge 惩罚强制收缩,在有毒评论数据上把认证比例从 41% 提升到 59%,并在 ‖A‖∞=1 处观察到与理论一致的相变。将收缩正则化的 S4 头用于 JailbreakBench 越狱检测,零样本迁移到 AdvBench 的 DR=0.994、HarmBench 的 DR=0.988。

  • 论文arXiv:越狱、提示注入、投毒与防御

    Whiteout:用混淆样本阻止 LLM 泄露个人敏感信息

    研究者提出 Whiteout,一种在个人提出请求后阻止 LLM 复述其真实个人敏感信息(PSI)的工具,做法是用精确设计的混淆样本覆盖这些信息。作者指出,现有基于机器遗忘的缓解方法往往删除过多信息、损害模型效用与安全性,且易受攻击。Whiteout 在多家厂商、不同规模的现代 LLM 上评估,其中包括一款广泛使用的 OpenAI 模型,结果显示它能有效阻止目标 PSI 被披露,对模型效用与安全性影响可忽略,并优于现有替代方案。研究还测试了 Whiteout 对黑盒攻击(如越狱)和白盒自适应攻击(如重学习、量化)等反制手段的鲁棒性,并讨论了其安全与伦理影响。