跳到正文
10月10日 · 周六

全部论文

找到 18 篇

另有 201 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2610.09581

    研究审计 LLM 读取 Agent 日志的取证能力:答案正确但引用来源多为猜测

    评测 LLM 审计 Agent 日志时来源重建是否有证据支持

    发表
    场景
    AI Agent
    被测模型
    gpt-5.6-luna、claude-sonnet-4-6、gpt-5.4-mini-2026-03-17 等 5 个
    摘要保存执行范围的标识绑定,才能把猜中的引用和证据支持的引用分开。

    包级审计检查保存的智能体动作里,哪些来源结论能被交给分析者的记录支持。

    深度解读完整解读
  2. 评测与基准arXiv 2610.08540

    论文提出按风险类别测量的对齐缩放定律框架

    提出分风险对齐标度律框架,测量各类风险的对齐负担如何随规模变化

    发表
    被测模型
    Pythia (14m–2.8b)、Qwen2.5 (0.5B–72B)、Qwen2.5-Instruct (0.5B–14B) 等 4 个
    摘要论文提出了分风险对齐标度律框架,测得真实性与倾向纠错呈标度有益,但盲后门仍存活,揭示隐藏风险的长期挑战。

    本文提出了一个将大语言模型对齐难度形式化为可测量标度关系的理论框架与预注册评测协议。

    深度解读完整解读
  3. 评测与基准arXiv 2609.36130

    论文提出 DerivAudit:审计长期 Agent 记忆是否真由交互历史支持

    提出 DERIVAUDIT 审计长期 Agent 记忆是否由交互历史导出

    发表
    场景
    AI Agent
    被测模型
    Qwen3-30B-A3B、Gemma-4-31B、Llama-3.3-70B-Instruct
    摘要DERIVAUDIT 表明扩历史能补出处,但组合准入与过细检查仍两侧出错。

    DERIVAUDIT 审计长期智能体的持久记忆是否由写入时可获得的交互历史支持,而不是只看以后能否被召回。

    深度解读完整解读
  4. 评测与基准arXiv 2609.32763

    Mandela-Bench:36 个多模态模型更依赖记忆而非观察图像

    构建 Mandela-Bench,评测多模态模型是否凭记忆接受篡改图像

    发表
    被测模型
    Gemini-3.8-Flash、GPT-5.6、GLM-5.3-Flash 等 15 个
    摘要论文构建 Mandela-Bench 发现模型对经典图像存在记忆重构偏见,过度依赖先验导致无法有效利用知识核验事实篡改。

    该研究系统评估了多模态大语言模型在面对无痕事实性编辑时,能否利用自身内在世界知识核验被识别出的经典图像。

    深度解读完整解读
  5. 多模态大语言模型免训练不确定性估计的系统研究

    比较多模态大模型上三类免训练不确定性估计

    发表
    被测模型
    InternVL2-2B、InternVL2-8B、InternVL3.5-2B 等 8 个
    摘要回答长度决定免训练 UE 族。

    这是一项对 MLLM 免训练不确定性估计的分组比较:幻觉检测被作者视为弃答、转交或路由的一种用途,而不是唯一目标。

    深度解读完整解读
  6. 评测与基准arXiv 2608.20554

    aiXamine:跨维度评测 LLM 安全、安全(security)与隐私权衡

    提出 aiXamine 黑盒基准,统一评测 LLM 安全、稳健与隐私权衡

    发表
    被测模型
    openai/gpt-5-mini、openai/gpt-4o、anthropic/claude-haiku-4.5 等 15 个
    摘要aiXamine 用九服务黑盒协议比较百余个模型,作者称单轴信任度进展可能削弱其他轴。

    aiXamine 是一套黑盒评测协议,用来在同一条件下比较 LLM 的 safety、security 与 privacy,而不是再产出一个能力分。

    深度解读完整解读
  7. SCHEMA:面向科学 Agent 幻觉的拓扑感知评测框架

    提出 SCHEMA,用概念图与轨迹分评测科学 Agent 幻觉

    发表
    被测模型
    Kimi-K2.5、Qwen3.6-Plus、Llama-4-Scout 等 10 个
    摘要SCHEMA 用知识拓扑评估科学智能体幻觉,终答正确仍可能来自有缺陷的中间推理。

    SCHEMA 是面向科学智能体幻觉的证据锚定评测框架,实例化在生物医学的 Protein Domain 与 PathVQA-Enhanced。作者在摘要中称它是首个同时做到证据锚定和拓扑感知的此类框架。

    深度解读完整解读
  8. 评测与基准arXiv 2606.24115

    Gut-VLM 基准:九种幻觉检测方法在胃肠道内镜 VLM 上的评测

    在 Gut-VLM 上评测内镜 VLM 的幻觉检测方法

    发表
    被测模型
    MedGemma-4B、MedGemma-27B、LLaVA-Med-7B 等 5 个
    摘要九种检测方法在 Gut-VLM 五模型上的比较中,ReXTrust 的 AUC 均为最高。

    这是一个胃肠道内镜 VQA 幻觉检测的比较基准,不是新检测器结构的提出。

    深度解读完整解读
  9. 评测与基准arXiv 2606.21155

    研究评测法律引用幻觉检测

    构建法律引用幻觉基准 LePhantomCite 并评测智能体核验

    发表
    场景
    AI Agent
    被测模型
    gpt-5-2025-08-07、Opus 4.8、Gemini 2.5 Flash 等 13 个
    摘要引用幻觉未随代际持续下降。

    法律引用核验被做成基准:伪造引用的法院文书在增加,生成端的幻觉率也没有随模型代际持续下降。

    深度解读完整解读
  10. 评测与基准arXiv 2606.18936

    SciRisk-Bench:面向 AI4Science 安全的风险维度感知基准

    提出 SciRisk-Bench,按风险维度与学科评测 AI4Science 安全

    发表
    被测模型
    kimi-k2.6、glm-5.1、gemini-3-flash-preview 等 14 个
    摘要SciRisk-Bench 以风险维度和学科诊断 AI4Science 安全。

    SciRisk-Bench 是一个按风险维度和科学学科组织的 AI4Science 安全基准,用来看清失败来自哪一种风险机制、出现在哪个学科情境。作者认为 LLM 已介入科研问答、文献分析、实验规划和自主发现,而不安全输出不限于事实错误。现有科学能力基准不测安全,领域安全基准又多集中在化学、医学或生物,或只按宽泛安全类别打分。

    深度解读完整解读
  11. 评测与基准arXiv 2606.18021

    LegalHalluLens:面向法律 AI 的分类幻觉审计与校准多智能体辩论

    提出 LegalHalluLens,分类审计法律抽取幻觉并校准多智能体辩论

    发表
    被测模型
    gemini-3-flash、gpt-5.2、qwen3-32b 等 5 个
    摘要作者称类型画像与 RDI 能区分聚合率相近的系统,辩论主要减少虚构检出。

    LegalHalluLens 是一套法律条款抽取的审计框架,外加一个按审计结果校准的辩论缓解。。

    深度解读完整解读
  12. 评测与基准arXiv 2605.27016

    研究系统评测不确定性估计方法与 LLM 幻觉的关联

    评测不确定性估计与 LLM 幻觉的关联

    发表
    被测模型
    Mistral-7B-Instruct-v0.2、Llama-2-7b-chat-hf、Llama-2-13b-chat-hf
    摘要作者称不确定性只在特定任务上有区分力,估计器需按任务、访问权限和验证来选。

    这项工作检验现成的不确定性估计能不能当作幻觉信号,而不是提出新的检测器。

    深度解读完整解读
  13. 评测与基准arXiv 2605.17062

    研究复现五个前沿模型的包名幻觉:跨模型共同幻觉 127 个包名,53 个仍可被注册

    复评前沿模型代码生成中的包名幻觉与抢注攻击面

    发表
    被测模型
    Claude Sonnet 4.6、Claude Haiku 4.5、GPT-5.4-mini 等 5 个

    摘要评估显示前沿模型包幻觉率收窄但威胁仍在,作者识别出跨模型通用攻击面并呼吁联合防御。

    深度解读完整解读
  14. 评测与基准arXiv 2602.11167

    通过内部状态分析与聚类可视化并评测 LLM 事实幻觉倾向

    提出 FalseCite 基准,评测虚构引用如何改变事实幻觉

    发表
    被测模型
    GPT-4o-mini、Falcon-7B、Mistral-7B
    摘要作者报告虚构引用提高幻觉率且随机更高。

    FalseCite 用来测虚构引用会不会提高模型在虚假陈述上的幻觉率,并顺带看隐藏状态聚类能否分开幻觉。

    深度解读完整解读
已经到底了