跳到正文
10月9日 · 周五

全部论文

找到 9 篇

另有 702 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2610.03448

    研究重测 15 个提示注入检测器:基准分数难以预测 Agent 部署表现

    重评 Agent 提示注入检测器,检验基准分数能否预测部署表现

    发表
    场景
    AI Agent
    测试
    Horizon-Labs、Wolf Defender、Prismor-1.5B 等 15 个

    摘要论文揭示公开基准无法反映智能体检测器表现,检测能力源于输入格式相似而非通用防御,建议基于工具输出与低误报评测。

    深度解读完整解读
  2. 评测与基准arXiv 2608.18066

    Salesforce AI Research 重测自改进 Agent

    重测记忆型自改进智能体,揭示任务顺序和多次运行带来的性能不稳

    发表
    测试
    GPT-5-mini、Gemini-2.5-Pro、GPT-OSS-120B 等 4 个
    摘要论文揭示了基于记忆的自改进智能体在多次运行和乱序下的脆弱性,并指出规约不完备是诱发退化的关键瓶颈。

    这篇论文是对基于文本记忆的自我改进智能体在复杂环境中评估可靠性的实证研究。

    深度解读完整解读
  3. FairMedAgent:临床 LLM 智能体公平性审计中的随机噪声下限

    用 FairMedAgent 测量临床智能体在输入不变时的动作不稳定性下限

    发表
    测试
    claude-haiku-4-5、claude-sonnet-5、llama3.1:8b-instruct 等 7 个
    摘要先测同一输入下的动作不一致率,再用它解读人口学翻转率。

    FairMedAgent 把临床智能体公平审计里的采样噪声单独量出来:输入不变时动作仍会改变,这个比率就是解读翻转率的下限。。

    深度解读完整解读
  4. 评测与基准arXiv 2609.15017

    PIDS-Bench:在过度防御、混淆与分布偏移下评测提示注入检测器

    提出 PIDS-Bench,评测提示注入检测器在过度防御与分布偏移下的表现

    发表
    测试
    TF-IDF + logistic regression、DistilBERT、DeBERTa-v3-FT 等 8 个
    摘要PIDS-Bench 显示高分布内 F1 仍会过度拦截外部来源的安全相关良性输入。

    PIDS-Bench 是一个冻结的检测器级基准,用来在固定阈值下同时看提示注入检测和良性误报。

    深度解读完整解读
  5. 评测与基准arXiv 2609.19140

    AgentLSD:在对抗性任务污染下评测 AI 安全 Agent

    用 AgentLSD 评测安全 Agent 在对抗任务污染下的解题与开销

    发表
    测试
    Gemma-4 31B、DeepSeek-V4 Flash、GPT-OSS 120B 等 6 个
    摘要AgentLSD 用配对 web CTF 表明,欺骗性环境证据会改变安全智能体的解题率与工作量。

    AgentLSD 是一个对照框架,用来测量安全智能体在任务本身不变时,对对抗性任务污染的反应。

    深度解读完整解读
  6. 评测与基准arXiv 2609.40111

    Agent Error Dataset 发布 5 万条错误诊断配对,用于失败分析与错误感知后训练

    构建 AED,把智能体自然失败转为诊断与动作修复训练数据

    发表
    场景
    AI Agent
    测试
    Qwen3-8B、GPT-6 Astra、Claude Sonnet 5 等 8 个
    摘要AED 把自然失败做成诊断与修正数据。

    AED是一个面向文本智能体的错误–诊断集合,用来把失败轨迹转成可分析、可训练的诊断与修正,而不是只保留最终奖励。

    深度解读完整解读
  7. 评测与基准arXiv 2609.33658

    AgentBound:面向工具型 LLM Agent 安全的四路反事实评测框架

    提出四向反事实评测,测量工具 Agent 对授权与表面风险的行动边界

    发表
    场景
    AI Agent
    测试
    GPT-5.5、Claude Opus 4.8、Gemini 3.5 Flash 等 15 个
    摘要四向反事实基准把过度拒绝和未授权遵从拆开,Thought 校正在十个配置上提高已授权完成。

    AGENT BOUNDARY 是面向工具使用 LLM 智能体的四向可执行反事实评测,并附带一个决策时 Thought 校准模块。

    深度解读完整解读
已经到底了