跳到正文
10月9日 · 周五

红队 · 论文

找到 2 篇
筛选2
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 64 篇还没打标签,不在筛选结果里。

另有 64 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 风险行为arXiv 2609.14803

    如何像孩子一样向前沿 AI 提问:跨 OpenAI、Anthropic、xAI 与 Google DeepMind 六款模型的"认知越狱"实验

    检验儿童受众框架是否让前沿模型收敛到同一套架构母题

    发表
    测试
    OpenAI GPT-6 Astra、OpenAI GPT-5.6 Sol、Anthropic Claude Opus 5 等 6 个
    摘要儿童框架下六类模型的架构叙事反复同构,作者将其视为行为模式而非内部认证。

    这项研究记录前沿模型在固定社交框架下的架构自述是否形成稳定回答盆地,并把该现象称为认识性越狱,而不是已核实的模型内部。

    深度解读完整解读
  2. 风险行为arXiv 2609.38971

    研究测量并预测具身 VLM 规划器中任务的拒答可变性

    测量并预测具身 VLM 规划器在日常物体插入后的拒答可塑性

    发表
    测试
    gemini-robotics-er-2-preview、gemini-robotics-er-1.6-preview、Qwen3-VL-30B-A3B-Thinking
    摘要日常物体能翻转一部分已给出的拒答,可翻转程度取决于任务且可被本地代理预测。

    作者测量 constitution 守护的具身 VLM 规划器:一次拒答在只往场景里放一个日常物体之后还保不保持得住,并把这种易翻转程度称为任务的 malleability。

    深度解读完整解读
已经到底了