跳到正文
10月8日 · 周四

全部论文

找到 4 篇
筛选3
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 717 篇还没打标签,不在筛选结果里。

另有 717 篇论文还没打上分类标签,暂不在筛选结果里。

  1. Counter-GEO-Bench:现有护栏难挡 GEO 虚假信息

    构建 COUNTER-GEO-BENCH,评测生成式搜索对信息扭曲 GEO 的防御

    发表
    测试
    Gemma-4-31B-IT、Qwen-3.5-35B-A3B、Llama-4-Scout-17B-16E 等 11 个

    摘要论文构建了针对 GEO 虚假信息的首个防御基准,揭示通用护栏的失效与反作用,并提出了有效的轻量对比检测基线。

    深度解读完整解读
  2. 评测与基准arXiv 2609.15017

    PIDS-Bench:在过度防御、混淆与分布偏移下评测提示注入检测器

    提出 PIDS-Bench,评测提示注入检测器在过度防御与分布偏移下的表现

    发表
    测试
    TF-IDF + logistic regression、DistilBERT、DeBERTa-v3-FT 等 8 个
    摘要PIDS-Bench 显示高分布内 F1 仍会过度拦截外部来源的安全相关良性输入。

    PIDS-Bench 是一个冻结的检测器级基准,用来在固定阈值下同时看提示注入检测和良性误报。

    深度解读完整解读
  3. 评测与基准arXiv 2609.33401

    论文评估 System One 模型在 Agent 安全决策中的可靠性、校准与选择性自动化

    评测 System One 模型对 Agent 安全输入的分类可靠性与校准

    发表
    测试
    Jev 1.13、Decider, approximately 2B、Bespoke Nimble, approximately 9B 等 14 个
    摘要离线评测表明,安全判定的总体分数和校准不能代替分组误差和带预算的自动决策检查。

    Liu 离线评测 System One 模型能否为智能体安全输入给出可自动化的概率决策。问题是分类是否可靠,以及概率能否在指定漏检和误拦上限内支持放行、拦截或复核。

    深度解读完整解读
已经到底了