跳到正文
10月10日 · 周六

全部论文

找到 3 篇
筛选9
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 216 篇还没打标签,不在筛选结果里。

另有 216 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2610.07657

    DEFER1 多智能体防御研究报告受控测试中的攻击成功率下降

    实现 DEFER,以确定性检查优先拦截多智能体流水线的内容攻击

    发表
    被测模型
    Qwen3-235B-A22B-Instruct-2507、gpt-oss-120b、Llama-4-Scout-17B-16E-Instruct 等 5 个
    摘要DEFER 把确定性检查放在 judge 之前。

    DEFER 用来测量多智能体授权流水线里,确定性规则在何处结束、LLM judge 从何处开始。

    深度解读完整解读
  2. Mind2Web-Injection:面向网页 Agent 视觉提示注入护栏的证据对齐评测

    提出 Mind2Web-Injection 评测网页 Agent 视觉注入护栏

    发表
    被测模型
    GPT-5.6-luna、Qwen3-VL-32B、Qwen3-VL-8B 等 6 个
    摘要作者称检测、定位和反事实响应在六个 VLM 上可分开。

    Mind2Web-Injection 用来检查网页截图护栏的判决是否对齐到该用的画面证据。。

    深度解读完整解读
已经到底了