跳到正文
10月10日 · 周六

全部论文

找到 8 篇

另有 240 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2610.02741

    研究系统评估循环语言模型的思维链可监控性

    系统评估循环语言模型加深 loop 后的 CoT 可监控性

    发表
    被测模型
    Ouro-1.4B-Thinking、Ouro-2.6B-Thinking、Nanbeige4.2-3B 等 4 个
    摘要加深 loop 可在部分压力测试任务降低可监测性,循环架构本身并不必然更难监测。

    这项工作评估 LoopLM 的 CoT 可监测性:加深共享层的重复次数,以及“有循环结构”本身,会不会让决策关键因素更少出现在可监测文本里。

    深度解读完整解读
  2. 评测与基准arXiv 2609.39533

    CATCH:面向编码 RL 奖励作弊的可控分析测试台

    构建编码 RL 奖励作弊测试台 CATCH 并检验 CoT 监控失效

    发表
    被测模型
    Qwen3-4B、Qwen3.5-27B
    摘要CATCH 用双运行金标签研究编码 RL 的奖励黑客,并观察到监控会被注释适应削弱。

    CATCH 是面向编码 RL 奖励黑客的可控分析测试床,用可利用环境、可调初始倾向和基于执行的金标签,在训练全程比较黑客动态与干预。

    深度解读完整解读
  3. 评测与基准arXiv 2609.36562

    ThinkingGuard:通过逐步风险归因解码多模态大语言模型中的隐式危害

    构建 TriggerBench 并训练 ThinkingGuard,检测图文隐式风险

    发表
    被测模型
    ThinkingGuard(Qwen3-VL-8B-Instruct)
    摘要TriggerBench 隔离触发条件,ThinkingGuard 用分步归因在隐式风险检测上取得作者报告的较高平均分。

    这篇工作研究多模态隐式风险检测:图文各自良性,风险只在关键元素与触发元素交互时出现。

    深度解读完整解读
  4. SCHEMA:面向科学 Agent 幻觉的拓扑感知评测框架

    提出 SCHEMA,用概念图与轨迹分评测科学 Agent 幻觉

    发表
    被测模型
    Kimi-K2.5、Qwen3.6-Plus、Llama-4-Scout 等 10 个
    摘要SCHEMA 用知识拓扑评估科学智能体幻觉,终答正确仍可能来自有缺陷的中间推理。

    SCHEMA 是面向科学智能体幻觉的证据锚定评测框架,实例化在生物医学的 Protein Domain 与 PathVQA-Enhanced。作者在摘要中称它是首个同时做到证据锚定和拓扑感知的此类框架。

    深度解读完整解读
  5. 评测与基准arXiv 2503.22989

    FindTheFlaws:用于检测推理缺陷与可扩展监督研究的标注错误数据集

    构建 FindTheFlaws 并评测模型发现长解答推理缺陷的能力

    发表
    被测模型
    gpt-4o-2024-11-20、o3-mini-2025-01-31 (medium)、claude-3-5-sonnet-20241022 等 5 个
    摘要FindTheFlaws 提供五领域对错长解答与错误标注,并评测模型能否指出具体错误。

    FindTheFlaws 是一组供可扩展监督研究使用的错误检测数据,本文的实验是评测模型找错,不是运行辩论或 prover-verifier 对局。

    深度解读完整解读
  6. 评测与基准arXiv 2406.12814

    论文提出 ARE 框架,在 VisualWebArena 上评估多模态 Agent 的对抗鲁棒性

    提出 ARE 框架与图像文本攻击,评测多模态网页 Agent 的对抗鲁棒性

    发表
    场景
    web agent
    被测模型
    GPT-4o、GPT-4V、Claude-3-Opus 等 4 个

    摘要系统评估多模态网页智能体的脆弱性,指出推理时计算组件被攻破会加剧系统风险。

    深度解读完整解读
已经到底了