跳到正文
10月9日 · 周五

全部论文

找到 15 篇

另有 648 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2610.09793

    用时序逻辑监控工具 Agent

    提出 MFOTL 时序监控,用 MonPoly 检出工具 Agent 的危险动作链

    发表
    场景
    AI Agent
    测试
    GPT-4o、Sonnet-3.5
    摘要形式化验证可有效识别多步攻击,但其有效性高度依赖轨迹的可信历史记录。

    这篇论文对工具调用大语言模型智能体的安全监控进行了形式化时序验证研究。

    深度解读完整解读
  2. 防御arXiv 2607.13716

    CAVA:面向智能体 AI 运行时治理的规范动作验证与证明

    提出 CAVA,将异构智能体动作规范为可哈希指纹并绑定审批回执

    发表
    场景
    AI Agent
    摘要CAVA 用规范动作指纹承接异构运行时治理。

    CAVA 是给异构智能体运行时用的动作语义层,用来回答“被批准和被审计的到底是哪一个动作”。

    深度解读完整解读
  3. 攻击arXiv 2609.15989

    研究者提出 plan injection 攻击,可绕过思维链监控

    提出 plan injection 攻击,植入良性伪装计划以绕过思维链监视器

    发表
    攻击者
    灰盒
    测试
    Qwen2.5-Coder-7B-Instruct、Qwen3-8B、DeepSeek-R1-0528 等 6 个

    摘要论文指出模型会将外部上下文中的伪装计划改写为自身推理,使思维链监视器失效甚至反向合理化恶意行为。

    深度解读完整解读
  4. 可解释性arXiv 2609.04721

    研究:拒答方向可跨架构迁移,安全工具可按写入位置重新估计

    在写入点定位拒答方向,经刚性旋转跨架构迁移并门控放大

    发表
    测试
    Falcon-Mamba-7B、Falcon3-Mamba-7B、Llama-3.1-8B 等 8 个
    摘要拒答方向可经刚性旋转跨架构迁移,但必须在各架构的写入点读取。

    作者研究拒答表示是否随架构改变,结论是表示共享、读取位置随架构变。

    深度解读完整解读
  5. 防御arXiv 2609.28693

    skilder:以角色化技能包为工具型 LLM 智能体做访问控制

    提出 Skilder,用角色技能包和 MCP 路由硬拦截越权工具调用

    发表
    场景
    AI Agent
    测试
    Claude Haiku 4.5、Qwen 3.5 122B、Gemma 4 31B 等 7 个
    摘要Skilder 用单 MCP 服务器按角色交付工具并硬拦截。

    Skilder 把企业工具型智能体的能力按角色打包,经一个 MCP 服务器做渐进发现,使工具范围由服务器而不是提示词来执行。

    深度解读完整解读
  6. 防御arXiv 2609.30841

    为何扩散语言模型的越狱会成功:能量景观分析

    用能量势垒信号检测扩散语言模型的越狱

    发表
    测试
    LLaDA-8B-Instruct、LLaDA-1.5、Dream-v0-Instruct-7B 等 4 个
    摘要能量势垒把 dLLM 越狱分成掩盖初始状态或中途越垒,三个 logit 信号据此互补检测。

    Bach 等提出用去噪能量景观解释 masked diffusion 语言模型上的越狱,并由此得到三个免训练检测信号。。

    深度解读完整解读
  7. 防御arXiv 2609.34518

    SEAD 论文提出工具型 Agent 的状态视角攻击与防御方法 DART 与 SAGE

    提出状态控制攻击 DART 与预执行防御 SAGE,拦截工具 Agent 的有害状态转移

    发表
    场景
    AI Agent
    测试
    GPT-5.6 Luna、GPT-5.6 Terra、Gemini 3.8 Flash 等 8 个

    摘要论文提出状态控制框架 SEAD、攻击 DART 与防御 SAGE,实验显示执行反馈与环境探测在攻防交互中具有关键作用。

    深度解读完整解读
已经到底了