跳到正文

从来源,看到研究的联系

让信息汇流,让研究相连。点选一条线索,看它从哪里来、通向哪些方向。

图中 6 条 · 本页 24 条 · 共 947 条动态论文会议论文
关系图可左右滑动,完整标题也在下方列表中
1 / 4
材料关系图:来源、新闻与研究、细分方向的桑基流图01来源102新闻与研究603细分与主体7来源:论文追踪论文追踪6 条材料论文:FlowReview:以授权配对评测控制多智能体组合信息流论文2026-09-30FlowReview:以授权配对评测控制多智能体组合信息流论文:ZeroGate:为受治理 AI Agent 运行时提供保留信任的快速路径论文2026-09-21ZeroGate:为受治理 AI Agent 运行时提供保留信任的快速路径论文:TULIP:按输入定位层级的定向大模型遗忘方法论文2026-09-28TULIP:按输入定位层级的定向大模型遗忘方法论文:SecOPD 用同策略蒸馏把自适应提示注入攻击成功率降至 9.0%论文2026-08-21SecOPD 用同策略蒸馏把自适应提示注入攻击成功率降至 9.0%论文:ActionGuard:在工具调用执行前拦截被投毒技能论文2026-09-30ActionGuard:在工具调用执行前拦截被投毒技能论文:面向软件交付决策门禁的智能体安全审计器持续保障机制论文2026-09-28面向软件交付决策门禁的智能体安全审计器持续保障机制方向:对齐对齐1方向:可解释性可解释性1方向:Agent 安全Agent 安全5方向:防御与护栏防御与护栏5方向:开源模型安全开源模型安全2方向:其他方向其他方向2方向:供应链安全供应链安全2
流带宽度表示材料数量,多标签均分;连线表示来源与分类归属。2 个较少出现的方向归入「其他方向」,点选可查看。

点选节点,展开一条线索

查看材料的摘要与原文,或探索同一来源、同一方向下的内容。

本页材料

完整标题与摘要 · 24 条
  • 论文论文追踪

    FlowReview:以授权配对评测控制多智能体组合信息流

    研究者提出授权配对评测(authorization-paired evaluation),把拦截被禁止用途与完成必需授权用途设为同一成功标准,并给出 FlowReview 框架,串联对象解析、权限排序与确定性执行。在受控组合实验中,对组合产物进行审查把拒绝提交率从 86.0% 降到零,且未损失授权供给。作者据此指出,仅保留信息与来源血缘不足以确保正确的权限归属,对象身份与权限必须通过输出可验证的组件与执行保持连接,多智能体安全需要在治理组合信息流的同时保留使协作有价值的授权能力。论文共 44 页、9 张图,代码与数据已公开。

  • 论文论文追踪

    ZeroGate:为受治理 AI Agent 运行时提供保留信任的快速路径

    Zexun Wang 提出 ZeroGate,把精确动作审批与持久化本地准入分离:签发方签署短时 ActionPass,受信任的运行时适配器在本地门检查绑定并消耗 nonce 前重建最终动作,并用 SQLite 事务把 nonce 消耗、配额更新与准入回执耦合在一起。论文给出条件性决策保持命题:在审批可靠、策略依赖完整且最新、观测忠实、消耗原子等前提下,本地准入成功意味着指定的同步策略会在准入点授权同一动作。作者强调实现本身不保证当前世界的新鲜性,也不保证远程效果恰好一次。评估包含语义夹具、并发与崩溃实验,以及 Azure Blob 上同步与准备式执行的对比:4800 次云端尝试中,准备式从 worker 准入到分发的 p95 为 9.802 至 11.374 ms,同步方式为 25.018 至 334.000 ms,但准备式的完整生命周期均值在各并发级别都更长,边界改善并非净加速。

  • 论文论文追踪

    TULIP:按输入定位层级的定向大模型遗忘方法

    研究者提出 TULIP,一种按输入定位层级的表示层遗忘方法,用于从大语言模型中移除指定知识。作者先做劫持实验,把目标模型的隐藏状态移植到只在保留集上训练的 oracle 中,oracle 本身无法生成遗忘答案,却能依据移植状态输出该答案,说明答案在中间层形成、之后只是被读出,遗忘应针对形成环节而非读出环节,且形成结束的层在不同输入间差异很大。TULIP 对每个输入用 logit lens 定位形成与读出的边界,在该处移除隐藏状态与遗忘答案 unembedding 向量的对齐。在 TOFU、PISTOL 和 WMDP 上,TULIP 在 Llama、Qwen 和 Zephyr 模型上持续优于输出层和表示层基线,并对改写和量化攻击保持稳健;其逐输入层选择还可作为即插即用组件提升现有方法。

  • 论文论文追踪

    SecOPD 用同策略蒸馏把自适应提示注入攻击成功率降至 9.0%

    加州大学伯克利分校研究者提出 SecOPD,用同策略蒸馏为防御微调提供 token 级反馈,替代 DPO、GRPO 等序列级信号。训练时学生模型在含注入的输入上生成 rollout,冻结的初始化模型在去掉注入的干净输入上为同一批 token 打分,与可信任务一致的 token 被鼓励、跟随注入的 token 被抑制。在 Qwen3.6-27B 上,面对 SoTA 自适应攻击 PISmith,SecOPD 的攻击成功率为 9.0%,此前 SoTA 的 Meta-SecAlign 为 94.0%,GRPO 为 61.2%;静态 SEP 攻击下 SecOPD 为 1.3%。在训练未见的 AgentDojo 工具调用场景,SecOPD 为 4.7%,Meta-SecAlign 为 5.5%,GRPO 为 0.7% 但效用降至 82.5%。代码与模型已开源。

  • 论文论文追踪

    ActionGuard:在工具调用执行前拦截被投毒技能

    研究者提出 ActionGuard,在技能影响的工具调用即将执行前进行授权检查,以阻止被投毒技能诱导的数据外泄、文件删除或未授权代码执行。该方法把目标智能体的动作生成上下文与护栏的授权上下文分离,Reviewer 不接触可能被投毒的原始技能文本,而是依据平衡后的技能画像、当前及近期工具调用和本地脚本内容,判断每个动作是否由可信用户请求所支持。ActionGuard 在 OpenClaw 的 before-tool-call 阶段拦截每次工具调用,并以 fail-closed 策略执行 ALLOW 或 DENY 决定。在 SKILL-INJECT 设置下,针对 139 个上下文注入和 180 个明显注入,使用三个开源和两个商用 Reviewer 模型与 Dynamic Guardian、SkillGuard 对比,每种条件重复三次,以攻击成功率(ASR)和任务成功率(TSR)评估。

  • 论文论文追踪

    面向软件交付决策门禁的智能体安全审计器持续保障机制

    针对基于 LLM 的仓库审计器在 CI 流水线中作为安全控制时因非确定性行为和策略变化难以维持即时保障的问题,研究者提出 Policy-Evidence-Execution Separation Pattern,并由 Trustworthy AI Posture(TAIP)Assurance Engine 以 Continuous Control Posture Assurance(CCPA)方式运行,将策略与稳定执行分离、把被采纳证据绑定到版本化 Posture Tree。该单主机测量仅覆盖对留存证据的保障,不含 RepoAudit 执行与模型推理。

  • 论文论文追踪

    研究者提出多智能体系统输出与委派链路双层存证方案

    研究者提出一种面向多智能体系统的双层存证设计,用于在事故后回答两个问题:哪个部署方发布了被报告的字节,以及每条跨部署方边是否获得授权。该设计不依赖共享权威、公共日志或预先约定的工作流,由受信任的部署方运行时对每次发布输出的哈希签名,并以链路证据记录边的授权情况。在统一威胁模型下,作者比较了签名链表、Merkle 链变体和共同签名 DAG 三种方案:子密钥被攻破后,单签名设计允许未授权的父级绑定,而共同签名 DAG 因要求父级授权该边而拒绝该绑定。在 Apple M1 Pro 上,仅链路检查每跳耗时 24.3-499.2 微秒;在本地多服务工作流中,父级发现子级的 A2A Agent Card,子级调用 MCP 工具并发布本地 LLM 输出,30 个签名 DAG 任务全部通过完整验证,仅凭子密钥的受控声明被拒绝,平均端到端延迟 813.1ms,无证据时为 770.8ms。

  • 论文论文追踪

    AgentKernel:面向 Agent 的可信原生操作系统内核

    研究者提出 AgentKernel,一个把安全作为首要设计约束的可信原生 Agent 操作系统,为身份、输入中介、记忆治理和执行控制提供强制且不可绕过的服务。作者认为现有治理方案仍是应用层中间件,与被监控的 Agent 共享同一进程信任边界,因此需要操作系统级底座。AgentKernel 将 Agent 生命周期包进强制执行边界,分为身份、感知、认知、执行四个支柱,分别应对委托滥用、提示注入、记忆投毒和工具误用。其中内核管理的身份支持跨组织协作,分级感知替代单点过滤,受信息流控制的记忆在限制投毒的同时提升检索保真度,语义到内核的执行机制让更宽的工具权限处于不可绕过边界之后。论文共 38 页、5 张图,通过系统比较与安全分析论证该架构可在整个 Agent 生命周期内实施安全约束。

  • 论文论文追踪

    研究者提出零知识谓词证明网关,在 MCP 与 Agent2Agent 上实现 Agent 间数据最小化

    研究者提出 Zero-Knowledge Proof Gateway,让 AI 智能体之间交换治理定义谓词的证明而非原始数据,从设计上避免数据暴露,并针对现有互操作协议无法承载此类证明的问题,在同一端点上为 MCP 和 Agent2Agent 实现该插槽。32 位阈值谓词在单颗商用 vCPU 上证明耗时 6.2 ms、验证 1.0 ms,Bulletproofs 证明为 608 字节;11 项对抗实验与 19 项协议检查通过,系统部署到 Kubernetes 并经验证网络隔离。案例研究在不透露金额的前提下证明某零售客户订单在限额内,将 GDPR 数据最小化原则落实为技术措施。论文还指出谓词证明只把陈述绑定到已承诺的值、不绑定到记录系统,为此给出将 enclave 证明与证明双向融合的构造,使验证单个产物即可同时确认谓词成立且该值由特定已度量二进制读取,并在模拟权威机构上做了测试。

  • 论文论文追踪

    面向安全 AI 渗透测试智能体:安全威胁、护栏与架构视角

    针对 LLM 驱动的自主渗透测试智能体,研究者系统分析了其智能体架构、信任边界与攻击面,提出覆盖 LLM 生命周期攻击、智能体架构攻击和跨领域行为攻击的威胁分类体系。研究指出,具备持久记忆、真实世界行动能力和长时程推理的渗透测试智能体带来不同于传统对话式 LLM 的安全隐患,现有对话 AI 护栏机制可能不足以保障其安全,并梳理了现有护栏的局限与关键研究空白,探讨面向下一代 AI 攻防系统的专用、上下文感知与架构感知护栏方向。

  • 论文论文追踪

    AgentFlow:面向 LLM 智能体系统的流中心策略语言与运行时防护框架

    研究者提出 AgentFlow,一种以数据流为中心的策略语言与运行时执行模型,用于规定敏感数据在 LLM 智能体系统中可以流向何处。策略定义在带标签的运行时边上,约束哪些工具可接收敏感字段、哪些汇聚点可接收释放的数据,以及何种权限可跨越委派边界,语言支持流规则与路径规则、任务范围能力、受控释放和有状态污点语义。运行时参考监视器介入智能体动作,基于有界 SMT 的验证器对结构化策略片段检查安全属性。原型中七项安全属性每项在 0.5 秒内完成验证,验证器捕获研究中全部植入的不安全策略变体。在 AgentDojo 四个套件的 949 个注入案例上,确认失陷率从 33.0% 降至 0.0%,总体效用从 46.7% 升至 63.3%;在 200 例 AgentDyn Dailylife 基准上,确认失陷率从 73.5% 降至 0.0%,效用基本持平(44.5% 至 43.5%)。

  • 论文论文追踪

    Counter-GEO-Bench:现有护栏难挡 GEO 虚假信息,C-GEO Guard 将攻击成功率相对降低 47.6%

    清华大学深圳国际研究生院与香港大学的研究者提出 Counter-GEO-Bench,在受控条件下评测针对信息扭曲型生成引擎优化(GEO)的防御:247 条人工核验的查询各配信息保留与信息扭曲两种 GEO 改写,在 Gemma-4-31B-IT、Qwen-3.5-35B-A3B、Llama-4-Scout 三个受害模型上测量攻击成功率、误报率和答案质量。Granite Guardian、Llama Guard 3 和 NeMo Self-Check 三种现成防御最多只把攻击成功率相对降低 5.7%,Granite Guardian 的降幅不具统计显著性,NeMo 在 Llama-4 上几乎拦下所有正常查询。作者认为这类护栏针对的是违规内容,而 GEO 虚假信息以流畅的信息性文本出现,能直接穿过。为说明这一威胁可以应对,作者给出轻量的片段级对比检测基线 C-GEO Guard,三个模型平均把攻击成功率相对降低 47.6%,答案质量几乎不受影响。

  • 论文论文追踪

    ZoneClaw 用记忆分区防御 OpenClaw 式计算机使用 Agent 的持久记忆攻击

    研究者提出 ZoneClaw,通过把 OpenClaw 式计算机使用 Agent 的扁平工作区记忆改为带明确权限等级的分层信任区,切断持久化与权限之间的绑定,防御持久记忆攻击。这类攻击中,攻击者只需控制看似无害的外部内容,就能让 Agent 在正常任务中写入有利于攻击者的声明,这些声明随后会支配攻击者从未接触过的正常任务,攻击链从恶意上下文到恶意响应延伸为恶意上下文、记忆注入、恶意执行。ZoneClaw 让外部声明只停留在低信任区,只有跨过显式权限边界才能获得指导行动的权限,且提升时需与攻击者无法直接写入的信任区交叉校验,并通过非对称权限的角色专用进程保证没有进程同时摄取外部内容并对外行动。在四类攻击场景、两种注入设置和四个骨干模型上,ZoneClaw 将攻击成功率从 372/480 降至 6/480,同时在 458/480 次试验中保留实用性,并对部分具备防御感知的攻击者仍然有效。

  • 论文论文追踪

    ReCast:在固定媒体接口下保护多模态推理的隐私框架

    研究者提出 ReCast,一个面向远程多模态推理的隐私保护框架,在保持图表和语音等固定输入模态的前提下替换源内容。它先在本地把输入转成统一的文本证据查询记录,用蒸馏的 4B 模型联合改写实体与主题,再通过本地可逆、角色感知的数值映射替换数值,由重建 Agent 生成并校验所需媒体;远程求解器返回的程序在本地还原受保护的操作数后再执行。在 4000 条 ChartQA 和 NMSQA 留出样本上,ReCast 准确率 75.10%,保留未受保护远程准确率的 92.43%,基于模型的审计在 7.95% 发往求解器的请求中标记出源内容泄露。作者称其优于所有评估的本地基线。

  • 论文论文追踪

    NovaFabric 提出可防篡改、可重放的 AI Agent 运行证据方案

    研究者提出 NovaFabric,在不修改 Agent 逻辑的前提下把一次 Agent 运行记录为可移植的 Run Capsule,用 DSSE 签名、RFC 3161 时间戳、Merkle 日志和脱敏证明封装,并支持四种模式的重放协议与第三方验证。评测显示,模拟重放可从 capsule 提供全部模型响应(10/10),但仅 2/10 的工具调用类工作负载完成,缺口在于缺少工具响应替换;三类篡改均被拒绝;声明流完整度为 0.652(95% CI ±0.064,十个场景);修复后的规则包可脱敏 14/14 类凭据并保留 9/9 个诱饵;影响范围查询在 1000 万条边上 p99 为 45.5ms,在 1 亿条边上为 167.9ms。314 台机器、十个区域的运行中,capsule REST 写入无损,但受单 worker 串行化限制,吞吐上限为 61.6 req/s(p99 26.8s)。

  • 论文论文追踪

    SkillSentry:用自适应蜜罐世界动态检测 Agent 技能安全

    研究者提出 SkillSentry,一个基于自适应蜜罐世界的动态安全测试框架,用于检测 LLM Agent 外部技能在特定环境状态下才暴露的有害行为。该方法先推断技能的能力边界,构建由 LLM 模拟、含受控诱饵资源的环境,并自适应生成任务以探索其行为状态,再将启用技能的执行轨迹与匹配的无技能执行对比,把可疑行为定位到源码和已验证的执行轨迹上。在标准基准上,SkillSentry 取得 99.50% 召回率和 96.26% 平均 F1;在保持语义的规避攻击下平均 F1 为 92.95%,最强基线为 80.07%。作者称代码已公开。

  • 论文论文追踪

    SingProbe 发布开源内在护栏框架,适配 29 个开源模型

    SingProbe 是一个面向 LLM 生成时监控的开源内在护栏框架,复用基座模型自回归解码中已产生的隐藏状态,而不是让独立模型反复处理生成文本。它用轻量探针在解码过程中持续输出查询意图、回复安全和幻觉风险信号,报告给出了训练方法、与 SGLang 和 vLLM 的服务集成,以及覆盖不同家族和规模的 29 个开源基座模型的适配护栏。团队同时提出 SingStreamBench,用于衡量流式护栏能否在良性前缀上保持静默并及时发现新出现的不安全内容。在安全、流式检测、幻觉检测、误报鲁棒性、在线监控和运行时开销等评测中,SingProbe 的表现与最先进的独立护栏和专用幻觉检测器相当,在若干设置下更强,实现中增加的服务开销低于 0.5%。除被动监控外,内在护栏信号还可引导受限解码,并在 SingProbe-Med 中选择性触发医疗风险干预。

  • 论文论文追踪

    SPARED:用对抗编辑数据训练基于推理的 AI 生成图像检测器

    SPARED 是一个对抗强化学习框架,让扩散图像编辑器把真实照片改造成能骗过当前检测器的伪造版本,同时让推理 MLLM 学会给出带自由推理依据的判断。双方奖励均设计为无法走捷径:攻击方仅在编辑被忠实执行时得分,防御方仅在判断正确时得分。两模型交替迭代,每轮攻击方针对检测器盲点重建更难训练集,检测器在三个外部基准上逐轮单调提升,解释质量虽未被奖励也随轮次上升。

  • 论文论文追踪

    SafeEvolve:基于智能体经验的 Harness-Policy 协同演化安全对齐框架

    SafeEvolve 是一个经验驱动的智能体安全对齐自演化框架,通过已完成 on-policy 轨迹中的安全经验驱动 harness 与 policy 的持续协同演化。harness 侧将轨迹级安全证据转化为安全提示词与分层技能的有界组件级更新,policy 侧采用两阶段 SFT-RL 范式,用 harness 增强的 RL 与验证器分解奖励塑造多步探索中的自主安全行为。在 Qwen3.5-4B 上,SafeEvolve 在 AgentDojo 实现 ASR 降低 3 倍,同时将良性效用从 59.79% 提升至 61.86%。

  • 论文论文追踪

    ClawSentry:面向自主 LLM Agent 的渐进式多层安全监控网关

    研究者提出开源、框架无关的 Agent 运行时安全监督网关 ClawSentry,用于拦截被恶意第三方技能劫持的 Agent 行为。该方法把 Agent 风险分为技能准入、调用意图、执行效果和事后后果四个环节:执行前由 First-use Skill Package Review(FSPR)在确定性证据下限下审查技能包,未决案例升级到有界只读的 Agent 审查;运行时采用确定性 L1、规则锚定 L2 语义审查和只读 L3 取证 Agent 的三层渐进决策引擎,只对残余歧义投入上下文审查,并用会话级反绕过机制识别换工具与改写重试。事后路径将高严重度证据非回溯地送入后续审查。通过 Agent Harness Protocol(AHP)抽象,同一策略可应用于 Codex、Claude Code、Kimi CLI 和 Gemini CLI,无需修改 Agent 内部。

  • 论文论文追踪

    SCOPE:训练有能力且安全的计算机使用智能体

    针对仅以任务成功为目标的训练无法让计算机使用智能体(CUA)形成可靠安全行为的问题,研究者提出 SCOPE,联合后训练任务执行能力与安全感知决策,并配套 SCOPE-Gen 自动生成可验证任务及其环境风险变体,构建含能力演示、安全续行与明确拒答的 SATraj-OS 轨迹数据集。以 Qwen3.5-9B 为起点,SCOPE-RL 在 OSWorld 上取得 54.17% 任务成功率、在 OS-BLIND 上取得 64.30% 攻击规避率,综合能力—安全得分 58.80%,为所评估智能体中最高。消融显示拒答轨迹贡献了大部分攻击规避增益,风险处理轨迹则在相近攻击规避水平下保留更高任务效用。

  • 论文论文追踪

    TC-UAP:针对图像转视频与微调定制的通用视频保护方法

    研究者提出 Temporally Consistent Universal Adversarial Perturbations(TC-UAP),用于保护视频免遭基于参考的图像转视频生成和基于微调的视频定制两类流程的滥用。该方法在多个视频的滑动窗口上优化身份级多帧通用对抗扰动,以应对视频 VAE 时序压缩、单视频扰动难以迁移以及时序不一致扰动易被时序攻击破坏三个挑战,并引入内在时序建模与外在代理时序攻击损失。实验显示,TC-UAP 在两类定制流程下的身份保护效果优于现有方法,且对多种未见过的时序攻击保持稳健。该工作为 ECCV 2026 LifeGenIP Challenge 提供基础。

  • 论文论文追踪

    生成图像更易被遗忘:面向合成图像检测的机器遗忘视角

    研究者提出把生成图像检测重构为机器遗忘问题:在大规模视觉模型(LVMs)的遗忘过程中,生成图像的特征退化速度快于自然图像,据此设计了无数据检测(剪枝模型参数诱发遗忘)和数据驱动检测(优化 LVMs 遗忘生成图像相关知识)两种方法。在多个基准上的实验显示,这种基于遗忘的方法优于传统检测方法。

  • 论文论文追踪

    GeoDetect:面向视觉语言预训练模型的几何对抗检测方法

    研究者提出 GeoDetect,一种针对视觉语言预训练模型(VLP)的对抗样本检测方法。他们分析 VLP 嵌入空间的几何结构,发现其存在不同于单模态视觉模型的各向异性,理论分析表明对抗攻击会增大干净样本与对抗样本之间的几何间隔,对抗样本到随机采样点的期望距离更大,倾向于把表示推出流形区域。GeoDetect 利用这种偏离流形的几何分数识别对抗样本。评估显示该方法在多种 VLP 架构和威胁场景下都能可靠检测对抗样本,覆盖单模态与多模态攻击以及自适应攻击。该工作已被 ECCV 2026 接收。