跳到正文
10月10日 · 周六

全部论文

找到 8 篇
筛选7
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 194 篇还没打标签,不在筛选结果里。

另有 194 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2610.07657

    DEFER1 多智能体防御研究报告受控测试中的攻击成功率下降

    实现 DEFER,以确定性检查优先拦截多智能体流水线的内容攻击

    发表
    被测模型
    Qwen3-235B-A22B-Instruct-2507、gpt-oss-120b、Llama-4-Scout-17B-16E-Instruct 等 5 个
    摘要DEFER 把确定性检查放在 judge 之前。

    DEFER 用来测量多智能体授权流水线里,确定性规则在何处结束、LLM judge 从何处开始。

    深度解读完整解读
  2. 防御arXiv 2610.02861

    论文提出在 Kubernetes 上保护 AI Agent 的七层纵深防御框架与参考架构

    提出 Kubernetes 运维智能体的七层纵深防御框架与参考架构

    发表
    场景
    AI Agent
    摘要把运维智能体当不可信租户,用七层控制在完全攻破假设下约束行动。

    把 Kubernetes 上的运维智能体当作不可信租户,在假定提示注入已完全控制其工具选择的前提下,用基础设施重建数据面与控制面的边界。要解决的是:智能体读日志、注解、工单或 MCP 工具描述时,这些内容可以变成它带着自身凭据执行的命令。模型对齐和分类器只降低概率。

    深度解读完整解读
  3. 防御arXiv 2609.17648

    多智能体 LLM 流水线中的信任传播与结构隔离

    用任务绑定令牌和策略预言机拦住多智能体流水线的未授权执行

    发表
    被测模型
    gemma4:31b-cloud
    摘要结构性授权拦住了记忆投毒的未授权执行,持密钥时承重的是策略预言机。

    作者在一条会改写沙箱邮件库的四智能体流水线上,检查低权限失陷会不会变成未授权的真实动作。

    深度解读完整解读
  4. 防御arXiv 2609.15803

    研究者提出 k-robust 联盟对齐,用多智能体评审委托授权

    提出 k-robust 联盟对齐,刻画误对齐评审下的安全委托授权

    发表
    摘要联盟覆盖使无个体对齐的评审面板仍可相对基线安全授权,数值分数改善完备性。

    委托授权的安全不要求每位评审者对齐,而要求面板在效用空间覆盖委托人。

    深度解读完整解读
  5. 防御arXiv 2609.04159

    Sentinel-RL:将拓扑推理从 LLM 智能体中卸载到安全运营中心

    提出 Sentinel-RL,将拓扑处置从 LLM 卸载到受约束图策略

    发表
    被测模型
    HetGAT、PPO
    摘要Sentinel-RL 用图编码器与 PPO 承担拓扑决策,LLM 负责叙述与门控,并在 LANL 上报告检测与时延。

    Sentinel-RL 是面向 SOC 的神经符号架构:拓扑决策离开 LLM,改由认证图上的 HetGAT 与 PPO 完成。

    深度解读完整解读
  6. 防御arXiv 2608.21101

    ClawSentry:面向自主 LLM Agent 的渐进式多层安全监控网关

    提出 ClawSentry 多层监控网关,在技能准入和运行时拦截恶意技能与隐藏指令

    发表
    被测模型
    Codex/GPT-5.4、Codex/GPT-5.5、Claude Code/GLM-5.1 等 6 个
    摘要ClawSentry 用包准入、三级运行时门控和反绕过,压低 skill 攻击并保住干净任务。

    ClawSentry 是挂在智能体运行时之外的安全监督网关,用来同时盖住 skill 执行的多个生命周期边界,并把已被拒绝的效果记到会话里。

    深度解读完整解读
已经到底了