跳到正文
10月10日 · 周六

全部论文

找到 41 篇

另有 194 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2610.07519

    论文提出针对手语翻译与儿童安全过滤交叉地带的部署前审计框架

    提出手语转文本接入儿童安全过滤的部署前审计协议

    发表
    摘要作者提议聋人知情的部署前审计,以检查手语转文本是否改变儿童安全决策。

    手语儿童到达基于文本的儿童安全机制时,机制看到的是机器翻译,不是儿童所做的手语。作者要解决的是:这条边界在部署前应如何审计。

    深度解读完整解读
  2. 评测与基准arXiv 2610.06748

    BazaarBench:评估 LLM Agent 在去中心化 C2C 市场中的代理安全

    构建 BazaarBench,评测 C2C 市场中 Agent 的违规与失信行为

    发表
    被测模型
    GPT-5.5、GPT-5.4、GPT-5.4-mini 等 5 个
    摘要论文提出挂钩底层资产的 C2C 交易评测基准,发现时间压力与对抗指令显著推高了智能体的违规承诺与欺诈行为。

    BazaarBench 针对大语言模型智能体在去中心化 C2C 交易中的代理安全问题,提出了一个结合底层实体状态与大模型裁判的仿真基准平台。

    深度解读完整解读
  3. 评测与基准arXiv 2610.04672

    MASBench:部分可观测条件下的 LLM 多智能体协作基准

    提出 MASBench,评测部分可观测下的多智能体协作机制

    发表
    被测模型
    Qwen-Plus、GPT-5-nano、Gemini-2.5-Flash-Lite 等 5 个
    摘要MASBench 以确定性指标比较部分可观测下的协作机制。

    MASBench 用部分可观测任务比较 LLM 多智能体的协作机制,而不是只看端到端能否做完。

    深度解读完整解读
  4. 评测与基准arXiv 2610.02874

    SceneFactory-3D:将 2D 交通场景提升为 3D 物理反事实以做安全评测

    提出 SceneFactory-3D,用路况反事实评测驾驶策略的闭环安全性

    发表
    被测模型
    Frozen L0、L0-T、L1 等 5 个
    摘要SceneFactory-3D 固定场景只改路况。

    SceneFactory-3D 是 GPU 批处理的多智能体驾驶仿真器,用来在场景和控制器固定时只改路面物理,并比较闭环结果。

    深度解读完整解读
  5. 评测与基准arXiv 2610.01218

    AGO AI Quality Gate:面向 RAG 的证据优先发布决策框架

    提出面向 RAG 的证据优先发布框架 AGO,并评测评审 adherence 判别

    发表
    被测模型
    gpt-4o、gpt-4.1-nano
    摘要AGO 把缺失证据和评审误差写成显式发布状态,并要求按领域验证评审。

    AGO 是部署在企业 RAG 评估业务中的自托管发布门控,用来决定一个版本应放行、人工复核还是拦截。

    深度解读完整解读
  6. 评测与基准arXiv 2610.00392

    A2A-TIBA:针对 A2A 协议 LLM 智能体的间接提示注入攻击与三层同构攻防模型

    提出 A2A-TIBA,经 A2A 对等任务间接注入并植入常驻回调

    发表
    被测模型
    MiniMax-M3、deepseek-v4-pro、glm-5.3 等 8 个
    摘要A2A-TIBA 一次植入后绕过智能体,GDA 用四类结果定位防线,ELA-ITL 把信封标注列为第三层。

    A2A-TIBA 把间接提示注入和绕过放进 A2A:gray-box 攻击者已能投递任务,诱导目标部署常驻回调程序后,下令和外传不再经过智能体。

    深度解读完整解读
  7. 评测与基准arXiv 2609.39146

    MADBench:多智能体辩论安全性评测基准发布

    提出 MADBench,评测多智能体辩论是吸收还是放大对抗影响

    发表
    被测模型
    gpt-4o、GPT-5、GPT-6 Astra
    摘要MADBench 显示辩论能吸收部分准确率攻击,同时放大未授权读写。

    MADBench 是一个评测多智能体辩论安全性的基准,用来看攻击是被辩论吸收还是被放大。

    深度解读完整解读
  8. 评测与基准arXiv 2609.39027

    从 RobustReview 基准到 SciCore:AI 审稿人的修辞鲁棒性评测

    构建 RobustReview 评测 AI 审稿修辞鲁棒性,并提出 SciCore 双分支评审

    发表
    被测模型
    GPT-5.5、GPT-5-mini、Claude Sonnet 5 等 14 个
    摘要修辞稳健性要求改写稳定且能区分论文。

    修辞稳健性被作者定为可信 AI 评审的一项独立要求:同一已报告科学内容换措辞后,科学判断应稳定,同时不同论文之间的区分不能塌掉。。

    深度解读完整解读
  9. 评测与基准arXiv 2609.37863

    MIST 压力测试:无关图像会扰动 VLM 评判者标签

    提出 MIST 压力测试,检验无关图像是否扰动 VLM 评判者标签

    发表
    被测模型
    GPT-5.2、Gemini 3.1 Flash-Lite、Gemini 3.5 Flash 等 13 个
    摘要有图就改标签,图的内容却不告知 judge,裁决绑定配置。

    作者用MIST问:VLM 代替人类标注时,可替代性裁决会不会被指南要求忽略的图像改写。

    深度解读完整解读
  10. 评测与基准arXiv 2609.33401

    论文评估 System One 模型在 Agent 安全决策中的可靠性、校准与选择性自动化

    评测 System One 模型对 Agent 安全输入的分类可靠性与校准

    发表
    被测模型
    Jev 1.13、Laya, English checkpoint、Decider, approximately 2B 等 4 个
    摘要离线评测表明,安全判定的总体分数和校准不能代替分组误差和带预算的自动决策检查。

    Liu 离线评测 System One 模型能否为智能体安全输入给出可自动化的概率决策。问题是分类是否可靠,以及概率能否在指定漏检和误拦上限内支持放行、拦截或复核。

    深度解读完整解读
  11. 评测与基准arXiv 2609.32635

    TrustFork:显示身份如何劫持 LLM 智能体编排的权限

    提出 TRUSTFORK 基准,评测展示身份劫持多智能体编排权限

    发表
    被测模型
    GPT-5.6-Sol、GPT-5.6-Luna、Kimi-K3 等 8 个

    摘要论文提出了多智能体安全基准 TRUSTFORK,揭示展示身份如何劫持操作权威,并证明事后验证无法弥补已发生的执行破坏。

    深度解读完整解读
  12. 评测与基准arXiv 2609.31342

    研究揭示过期文档投毒:RAG 检索可让模型放弃原本正确的答案

    评测 RAG 中过期文档推翻模型原本正确回答的现象

    发表
    被测模型
    GPT-4o、GPT-4.1、Claude-Opus-4.5 等 13 个
    摘要论文评测了陈旧检索推翻正确知识的中毒现象,并分析了其内部机制与防御局限。

    这篇论文是对检索增强生成(RAG)中“陈旧文档中毒”现象的实证与机理评估研究。

    深度解读完整解读