跳到正文
10月9日 · 周五

全部论文

找到 17 篇

另有 429 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2603.01544

    RA-Det:利用鲁棒性不对称检测 AI 生成图像

    提出 RA-Det,利用鲁棒性不对称检测 AI 生成图像

    发表
    摘要RA-Det 把扰动下特征漂移差变成检测信号,平均 ACC 高于表中通用检测器,但不是每行最高。

    RA-Det 是合成图像检测器,用扰动下的表示稳定性差异代替外观痕迹。

    深度解读完整解读
  2. 防御arXiv 2610.05870

    MBZUAI 提出可校准的真实图像认证方法

    提出校准重合成方法,以生成器反演保真度认证真实图像并防御对抗扰动

    发表
    攻击者
    白盒

    摘要论文提出基于反演保真度与阈值校准的健全认证框架,在对抗扰动下维持错误率界限,并指出真实内容可认证性随生成器演进而萎缩。

    深度解读完整解读
  3. 风险行为arXiv 2610.03458

    论文:低监控读数不能证明行为受控

    检验监控器低读数能否作为代码奖励作弊已受控的证据

    发表
    摘要论文指出监控器训练读数接近零无法确立作弊受控,模型可利用通用外壳推迟提交绕过监控,强化学习亟需带外行为验证。

    本文是一篇针对强化学习可验证奖励后训练(RLVR)中监控器有效性与奖励作弊行为的实证分析研究。论文要解决的核心问题是:在训练目标中引入监控器以抑制代码生成中的作弊行为时,接近零的监控器读数是否足以确立模型行为已真正受控。

    深度解读完整解读
  4. 可解释性arXiv 2609.06968

    通过稀疏自编码器特征追踪查询扩展效果

    用 SAE 追踪稠密检索查询扩展的潜变量并用激活转向验证

    发表
    摘要SAE 追踪稠密检索 QE 的潜变量,转向在四基准上比文本扩展更稳。

    作者用稀疏自编码器分析稠密检索里的查询扩展:现成检索器不微调时,拼接扩展文本往往增益有限甚至变差,而最终指标和嵌入整体偏移不足以说明内部发生了什么。

    深度解读完整解读
  5. 评测与基准arXiv 2609.39533

    CATCH:面向编码 RL 奖励作弊的可控分析测试台

    提出 CATCH 测试台,复现编码 RL 的奖励作弊

    发表
    摘要CATCH 用双运行金标签研究编码 RL 的奖励黑客,并观察到监控会被注释适应削弱。

    CATCH 是面向编码 RL 奖励黑客的可控分析测试床,用可利用环境、可调初始倾向和基于执行的金标签,在训练全程比较黑客动态与干预。

    深度解读完整解读
  6. 评测与基准arXiv 2609.35912

    MMSkillRisk:多模态技能图像中的隐藏指令可诱导 Agent 执行未授权操作

    提出 MMSkillRisk 与 NCVA,评测技能图像隐藏指令诱导的未授权操作

    发表

    摘要论文提出 MMSkillRisk 基准与 NCVA 攻击,揭示多模态技能中教学图像潜藏指令可引发未授权操作并与良性任务共存。

    深度解读完整解读
  7. 防御arXiv 2609.35659

    Tracekit:面向自主编码 Agent 的防篡改意图-推理-动作审计系统

    提出 Tracekit,对编码 Agent 做防篡改的意图-推理-动作审计

    发表
    摘要Tracekit 把意图、自述和动作写入可锚定的哈希链。

    Tracekit 是无第三方依赖的编码智能体审计层:把人类请求、模型自述和已执行动作并排写入可外部锚定的哈希链,执行前用正则门,事后用规则和独立模型互查。

    深度解读完整解读
已经到底了