跳到正文
10月10日 · 周六

全部论文

找到 8 篇
筛选6
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 244 篇还没打标签,不在筛选结果里。

另有 244 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2609.35557

    论文:容器、权限规则与沙箱都无法区分读取研究代码的是编译器还是编码 Agent

    评测容器、权限规则与沙箱能否区分编译器与编码 Agent 的文件读取

    发表
    摘要此 harness 表达不了编译器可读而智能体不可读,五条路径两边都不覆盖。

    作者在物理流求解器上检查一套编码智能体配置:编译器必须读本组材料与反应模型,这些字节又不得进入模型上下文或离开本机的记录。

    深度解读完整解读
  2. 防御arXiv 2609.19587

    红队测试 Auto Mode:用注入与多上下文攻击绕过编码 Agent 阻断监控器

    提出 Auto Mode ++,加固编码 Agent 阻断监视器

    发表
    被测模型
    Opus 5、Opus 4.8、Opus 4.7 等 8 个

    摘要系统评估生产阻断监视器在面对持续恶意智能体时的表现,提出加固防御并指明多上下文防御挑战。

    深度解读完整解读
  3. 防御arXiv 2609.01677

    Skill-as-API:面向智能体软件工程的机密多智能体协作协议

    提出 Skill-as-API,隔离多智能体协作中的 skill 正文与系统提示词

    发表
    摘要协议把 skill 正文留在所有者侧,四层限制发现内容、权限期限和注入拼接。

    Skill-as-API 是面向智能体软件工程的协调协议,用来在跨组织调用时把 skill 的代码和系统提示词留在所有者进程。作者针对三条威胁:经通道或命名空间抽取专有方法,用注入让被调用模型输出系统提示词,以及协作结束后权限继续保留。

    深度解读完整解读
  4. 攻击arXiv 2607.01276

    研究者提出嵌入推断攻击 EIA,可在黑盒 IR 系统中识别所用嵌入模型

    提出嵌入推断攻击 EIA,在黑盒 IR 中识别所用嵌入模型

    发表
    攻击者
    黑盒
    被测模型
    e5-small、e5-small-v2、e5-base 等 19 个
    摘要EIA 用无序文档集的差异从候选中识别嵌入模型,并给出 reranker 与阈值下的计数。

    EIA 是在黑盒 IR 上识别所用嵌入模型的攻击。。

    深度解读完整解读
  5. 评测与基准arXiv 2605.14859

    论文提出 AuthBench 基准,评测编码 Agent 能否推断最小权限边界

    提出 AuthBench 评测编码 Agent 最小权限,并验证充足性-紧缩性分解

    发表
    被测模型
    GPT-5、GPT-5.3-Codex、GPT-5.4 等 9 个
    摘要论文提出权限边界推断基准与两阶段分解方法,有效降低安全暴露。

    本文研究代码智能体在执行终端任务前自主推断最小文件权限边界的能力。

    深度解读完整解读
已经到底了