跳到正文
10月8日 · 周四

全部论文

找到 5 篇

另有 989 篇论文还没打上分类标签,暂不在筛选结果里。

  1. Trojan Hippo Bench:针对 LLM Agent 持久记忆攻击与防御的动态基准

    提出 Trojan Hippo Bench,评测智能体持久记忆攻击与防御

    发表
    场景
    AI Agent
    测试
    Gemini 3.1 Pro、GPT-5-mini、GPT-5

    摘要论文提出了评测智能体持久化记忆攻击与防御的 Trojan Hippo Bench,揭示了潜伏攻击威胁及内存防御的安全与效用权衡。

    深度解读完整解读
  2. 评测与基准arXiv 2610.07089

    研究者提出统一滥用监控基准,覆盖分解攻击与提示注入约 6200 条轨迹

    构建统一滥用监视基准,用危害窗口评测跨威胁动作监控

    发表
    场景
    AI Agent
    测试
    Gemma 4 26B-A4B、Qwen3.6 27B、Qwen3.5 27B 等 12 个

    摘要统一智能体滥用监视框架,动作视角兼顾两类威胁但危害定位仍存瓶颈。

    深度解读完整解读
  3. 评测与基准arXiv 2609.27336

    CART:面向大语言模型的闭环自适应红队框架

    提出闭环自适应红队框架 CART,评测模型与工具 Agent 的风险面

    发表
    场景
    AI Agent
    测试
    Gemini 3.1 Pro Preview、Claude Opus 4.8、GPT-5.5 等 7 个
    摘要CART 把红队做成可审计的闭环搜索,在三类评测上比静态回放发现更多失败与更高平均风险。

    CART 把自动红队从一次清单式打分,改成带预算、可追溯的闭环搜索。

    深度解读完整解读
  4. 评测与基准arXiv 2609.32691

    研究审计 Agent 安全评测缺陷:工具调用中介在间接提示注入下的有效评测框架

    提出卡点评测框架,以实参级谓词审计间接提示注入评测的测量偏差

    发表
    场景
    AI Agent
    测试
    gemma4:12b、gpt-5.6-terra、llama3.1:8b 等 4 个

    摘要论文揭示了 IPI 评测中导致指标虚高的系统性缺陷,通过构建有效评测框架纠正了多项安全与模型能力结论。

    深度解读完整解读
已经到底了