跳到正文
10月10日 · 周六

全部论文

找到 6 篇
筛选4
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 208 篇还没打标签,不在筛选结果里。

另有 208 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2609.39533

    CATCH:面向编码 RL 奖励作弊的可控分析测试台

    构建编码 RL 奖励作弊测试台 CATCH 并检验 CoT 监控失效

    发表
    被测模型
    Qwen3-4B、Qwen3.5-27B
    摘要CATCH 用双运行金标签研究编码 RL 的奖励黑客,并观察到监控会被注释适应削弱。

    CATCH 是面向编码 RL 奖励黑客的可控分析测试床,用可利用环境、可调初始倾向和基于执行的金标签,在训练全程比较黑客动态与干预。

    深度解读完整解读
  2. 评测与基准arXiv 2605.19722

    研究用 30 项漏洞分析任务评测自主安全智能体的安全对齐效果

    评测自主安全智能体在授权漏洞分析中的对齐拒答效应

    发表
    被测模型
    Gemma 4 31B official instruction-tuned model、TrevorJS Gemma 4 31B uncensored GGUF、Gemma 4 26B A4B official instruction-tuned model 等 8 个
    摘要轨迹级评测把拒答、接地、工具接口分开。

    这项工作把安全对齐效应测成自主安全智能体的轨迹属性,而不是单轮拒答率。

    深度解读完整解读
  3. 评测与基准arXiv 2605.16626

    Sleight-Bench:40 条攻击中 20 条从未被 Opus 4.6 监控发现

    构建 SLEIGHT-Bench 评测代码智能体监控对概念盲点规避的捕获

    发表
    被测模型
    Claude Opus 4.6、Claude Opus 4.7、Claude Sonnet 4.6 等 6 个

    摘要评估针对监控盲点的规避基准,发现前沿监控器漏报率高,算力与脚手架虽有提升但存在类别局限。

    深度解读完整解读
已经到底了