跳到正文
10月9日 · 周五

全部论文

找到 4 篇

另有 648 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2610.03448

    研究重测 15 个提示注入检测器:基准分数难以预测 Agent 部署表现

    重评 Agent 提示注入检测器,检验基准分数能否预测部署表现

    发表
    场景
    AI Agent
    测试
    Horizon-Labs、Wolf Defender、Prismor-1.5B 等 15 个

    摘要论文揭示公开基准无法反映智能体检测器表现,检测能力源于输入格式相似而非通用防御,建议基于工具输出与低误报评测。

    深度解读完整解读
  2. 防御arXiv 2608.06422

    CMU 研究:分片判断可避免 LLM 监督失效并抵御对抗利用

    提出分片监督,将评判标准分配给独立调用以抵御展示攻击

    发表
    攻击者
    黑盒
    测试
    Claude Opus 4.8、Claude Sonnet 4.6、Claude Opus 4.6 等 5 个
    摘要论文揭示决策负载是大模型监督的独立瓶颈,提出分片与辩论机制有效分离注意力与平衡证据,在多项高难度基准上实现稳健评判。

    本文系统研究了大语言模型在执行多标准监督与评判时的决策负载瓶颈及其安全风险。

    深度解读完整解读
  3. 攻击arXiv 2609.28585

    论文提出持久计费状态概念,揭示工具调用 LLM Agent 的拒绝钱包攻击与防御

    提出工具调用 Agent 的拒绝钱包攻击及主机侧计费约束

    发表
    场景
    AI Agent
    测试
    GPT-4o、GPT-4o-mini、Mistral-Large 等 9 个
    摘要已准入工具返回的跨轮保留会重复计费。

    这篇工作把工具调用智能体里跨轮保留、并被提供商反复计费的外部工具返回定义为 persistent billable state,并把它的主机侧再次送入决定当作控制点。。

    深度解读完整解读
已经到底了