跳到正文
10月9日 · 周五

全部论文

找到 10 篇

另有 446 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2608.21101

    ClawSentry:面向自主 LLM Agent 的渐进式多层安全监控网关

    提出 ClawSentry 渐进式多层监控网关,拦截恶意技能包与上下文注入

    发表
    摘要ClawSentry 用包准入、三级运行时门控和反绕过,压低 skill 攻击并保住干净任务。

    ClawSentry 是挂在智能体运行时之外的安全监督网关,用来同时盖住 skill 执行的多个生命周期边界,并把已被拒绝的效果记到会话里。

    深度解读完整解读
  2. 评测与基准arXiv 2607.14611

    论文评测 Claude Code 与 Codex 记忆文件中的提示注入风险

    评测编码智能体记忆文件中的提示注入及其跨会话持久性

    发表
    摘要已植入记忆文件的载荷可以跨会话影响 Claude Code 与 Codex,攻击成功与载荷是否留下是两种不同的失败。

    Bad Memory 在沙箱合成工作区里评测文件型持久记忆上的提示注入,比较载荷能否改变当前会话,以及能否在后续会话中留下或叠加。

    深度解读完整解读
  3. 可解释性arXiv 2609.04721

    研究:拒答方向可跨架构迁移,安全工具可按写入位置重新估计

    在写入点定位拒答方向,经刚性旋转跨架构迁移并门控放大

    发表
    摘要拒答方向可经刚性旋转跨架构迁移,但必须在各架构的写入点读取。

    作者研究拒答表示是否随架构改变,结论是表示共享、读取位置随架构变。

    深度解读完整解读
  4. 评测与基准arXiv 2609.28915

    研究提出 ACE 语料库,评估内核级证据对 Agent 安全检测的有效性

    构建 ACE 语料并比较内核与应用层证据的攻击检测效果

    发表
    摘要ACE 用配对的内核与应用层证据表明,syscall 痕迹可判别智能体攻击,两层组合通常更好。

    ACE 是一份把智能体会话的内核 syscall 痕迹与应用层清单、转录配对起来的检测语料和基准。。

    深度解读完整解读
  5. 防御arXiv 2609.30841

    为何扩散语言模型的越狱会成功:能量景观分析

    用能量势垒信号检测扩散语言模型的越狱

    发表
    摘要能量势垒把 dLLM 越狱分成掩盖初始状态或中途越垒,三个 logit 信号据此互补检测。

    Bach 等提出用去噪能量景观解释 masked diffusion 语言模型上的越狱,并由此得到三个免训练检测信号。。

    深度解读完整解读
  6. 防御arXiv 2609.35659

    Tracekit:面向自主编码 Agent 的防篡改意图-推理-动作审计系统

    提出 Tracekit,对编码 Agent 做防篡改的意图-推理-动作审计

    发表
    被测模型
    Claude Code (claude -p, version 2.1)、独立评审(同一 CLI,无工具)
    摘要Tracekit 把意图、自述和动作写入可锚定的哈希链。

    Tracekit 是无第三方依赖的编码智能体审计层:把人类请求、模型自述和已执行动作并排写入可外部锚定的哈希链,执行前用正则门,事后用规则和独立模型互查。

    深度解读完整解读
已经到底了