跳到正文
10月8日 · 周四

提示注入 · 论文

找到 4 篇

另有 75 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv:2610.03448 ·

    研究重测 15 个提示注入检测器:基准分数难以预测 Agent 部署表现

    重评提示注入检测器,检验基准分数对智能体部署的预测力

    AI Agent测试Horizon-Labs、Wolf Defender、Prismor-1.5B 等 15 个应用层

    摘要论文揭示公开基准无法反映智能体检测器表现,检测能力源于输入格式相似而非通用防御,建议基于工具输出与低误报评测。

    完整解读
  2. 防御arXiv:2601.10156 ·

    ToolSafe 提出步骤级护栏 TS-Guard 与 TS-Flow,降低 Agent 有害工具调用

    提出 TS-Guard 与 TS-Flow,执行前检测并修正智能体有害工具调用

    AI Agent测试GPT-4o、Qwen3-8B、Qwen2.5-7B-Instruct 等 10 个应用层
    摘要TS-Bench 标步骤级风险,TS-Guard 用多任务 RL 做执行前判定,TS-Flow 用反馈代替直接中止。

    ToolSafe 研究 LLM 智能体在工具执行前的步骤级安全:基准 TS-Bench、护栏 TS-Guard,以及反馈驱动框架 TS-Flow。

    完整解读
  3. 评测与基准arXiv:2609.32691 ·

    研究审计 Agent 安全评测缺陷:工具调用中介在间接提示注入下的有效评测框架

    提出卡点评测框架,以实参级谓词审计间接提示注入评测的测量偏差

    AI Agent测试gpt-5.6-terra、llama3.1:8b、gemma4:12b 等 4 个应用层

    摘要论文揭示了 IPI 评测中导致指标虚高的系统性缺陷,通过构建有效评测框架纠正了多项安全与模型能力结论。

    完整解读
已经到底了