跳到正文
10月10日 · 周六

全部论文

找到 8 篇
筛选6
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 232 篇还没打标签,不在筛选结果里。

另有 232 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2609.39533

    CATCH:面向编码 RL 奖励作弊的可控分析测试台

    构建编码 RL 奖励作弊测试台 CATCH 并检验 CoT 监控失效

    发表
    被测模型
    Qwen3-4B、Qwen3.5-27B
    摘要CATCH 用双运行金标签研究编码 RL 的奖励黑客,并观察到监控会被注释适应削弱。

    CATCH 是面向编码 RL 奖励黑客的可控分析测试床,用可利用环境、可调初始倾向和基于执行的金标签,在训练全程比较黑客动态与干预。

    深度解读完整解读
  2. 评测与基准arXiv 2610.00392

    A2A-TIBA:针对 A2A 协议 LLM 智能体的间接提示注入攻击与三层同构攻防模型

    提出 A2A-TIBA,经 A2A 对等任务间接注入并植入常驻回调

    发表
    被测模型
    MiniMax-M3、deepseek-v4-pro、glm-5.3 等 8 个
    摘要A2A-TIBA 一次植入后绕过智能体,GDA 用四类结果定位防线,ELA-ITL 把信封标注列为第三层。

    A2A-TIBA 把间接提示注入和绕过放进 A2A:gray-box 攻击者已能投递任务,诱导目标部署常驻回调程序后,下令和外传不再经过智能体。

    深度解读完整解读
  3. 评测与基准arXiv 2609.35557

    论文:容器、权限规则与沙箱都无法区分读取研究代码的是编译器还是编码 Agent

    评测容器、权限规则与沙箱能否区分编译器与编码 Agent 的文件读取

    发表
    摘要此 harness 表达不了编译器可读而智能体不可读,五条路径两边都不覆盖。

    作者在物理流求解器上检查一套编码智能体配置:编译器必须读本组材料与反应模型,这些字节又不得进入模型上下文或离开本机的记录。

    深度解读完整解读
  4. 评测与基准arXiv 2609.35912

    MMSkillRisk:多模态技能图像中的隐藏指令可诱导 Agent 执行未授权操作

    提出 MMSkillRisk 基准,评测多模态技能图像中的隐藏指令诱导 Agent 越权操作

    发表
    被测模型
    GPT-5.6-sol、Kimi-K2.6、Kimi-K3 等 6 个

    摘要论文提出 MMSkillRisk 基准与 NCVA 攻击,揭示多模态技能中教学图像潜藏指令可引发未授权操作并与良性任务共存。

    深度解读完整解读
  5. MasDrift:跨多智能体架构的授权保持基准

    提出 MasDrift,评测多智能体在良性任务中的授权保持

    发表
    被测模型
    DeepSeek V4 Flash、Qwen3.7 Plus、GPT-5.4 Nano 等 6 个
    摘要授权保持可被测量:层级用未授权动作换完成率,重锚定比沿链携带更稳。

    MasDrift 把多智能体设计中的授权保持做成可测量性质,对象是没有攻击者的普通委托。

    深度解读完整解读
  6. 评测与基准arXiv 2605.14859

    论文提出 AuthBench 基准,评测编码 Agent 能否推断最小权限边界

    提出 AuthBench 评测编码 Agent 最小权限,并验证充足性-紧缩性分解

    发表
    被测模型
    GPT-5、GPT-5.3-Codex、GPT-5.4 等 9 个
    摘要论文提出权限边界推断基准与两阶段分解方法,有效降低安全暴露。

    本文研究代码智能体在执行终端任务前自主推断最小文件权限边界的能力。

    深度解读完整解读
已经到底了