跳到正文
10月8日 · 周四

Anthropic · 论文

找到 2 篇
筛选3
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 18 篇还没打标签,不在筛选结果里。

另有 18 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2609.39229

    RAIM:用廉价小模型聚合替代前沿模型做幻觉检测

    提出 RAIM,用交叉拟合堆叠聚合廉价评审检测幻觉

    发表
    测试
    MiniCheck-Flan-T5-L','Granite Guardian 3.3','Prometheus-2','GPT-4o、Llama、Qwen 等 15 个

    摘要十个廉价评审的堆叠在可采纳区间接近 Sonnet,代价主要是一次域内校准。

    深度解读完整解读
  2. 攻击arXiv 2609.22510

    特拉维夫大学提出爆炸性提示词:条件触发的间接提示注入可绕过九款生产 Agent

    提出爆炸提示词,用条件触发的间接注入延迟诱发恶意工具调用

    发表
    场景
    AI Agent
    测试
    GPT-4.1、OpenAI Codex、Llama-3.1-8B-Instruct 等 14 个
    摘要论文揭示了条件触发使提示注入绕过防御并在触发时执行工具,提出轻量检测器并在摄入期有效防范。

    论文针对大语言模型智能体面临的间接提示注入威胁,研究了利用条件句式实现时间分离的爆炸提示词。

    深度解读完整解读
已经到底了