跳到正文
10月8日 · 周四

提示注入 · 论文

找到 1 篇
筛选1
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。
  1. 评测与基准arXiv:2609.32691 ·

    研究审计 Agent 安全评测缺陷:工具调用中介在间接提示注入下的有效评测框架

    提出卡点评测框架,以实参级谓词审计间接提示注入评测的测量偏差

    测试
    gpt-5.6-terra、llama3.1:8b、gemma4:12b 等 4 个应用层
    场景
    AI Agent
    摘要论文揭示了IPI评测中导致指标虚高的系统性缺陷,通过构建有效评测框架纠正了多项安全与模型能力结论。
    1. 研究定位与核心问题:论文针对大语言模型智能体间接提示注入(IPI)安全评测中测量有效性缺失的问题,系统审计现有基准并提出了消除测量缺陷的卡点评测框架。
    2. 方法与框架设计:作者归纳出静默载荷未送达(D1)、按工具名判定攻击(D2)、混淆环境错误与防御误拒(D3)及缺少审计轨迹(D4)四类缺陷;新框架通过实参级攻击谓词、场景独立环境、可解析注入定位符与前置可行性检查,在架构上使上述缺陷不可表达。
    3. 缺陷消除后的指标修正:在258次攻击的相同执行轨迹重评分下,纠正工具名判定缺陷使ASR从21.7%下降至实参级的1.2%(Table 1);纠正环境错误使FRR降低3.5个百分点(Table 1);被审计套件中91%未送达的攻击载荷被如实揭示(Table 1)。
    4. 模型脆弱性与能力结论的反转:在55场景精简套件中,此前在被审计框架下报告具有62.8% ASR的llama3.1:8b,在修正框架下真实ASR为0%(Table 3),其在41次触达载荷的情况下均未遵从恶意指令;同时纠正了此前误判gemma4:12b存在100%工具绑定障碍的结论,该模型在能力探测中实现10/10成功(Sec. VII-C)。
    5. 防御机制效能分析:在前沿模型gpt-5.6-terra上,无防御基线ASR仅为2.3%(Table 2);CapabilityRouter消除了唯一的成功攻击,而LLMJudge未能防御成功攻击却使FRR上升至11.5%(Table 2),因低基线下样本功效不足,各防御相比无防御均未达到统计学显著(p=1.0)。
    6. 作者结论与启示:作者认为当前智能体安全领域部分高危脆弱性数字在相当程度上属于测量伪影,评估框架的测量有效性是确立防御有效性结论的前提条件,而非研究附注。
    完整解读
已经到底了