跳到正文
10月9日 · 周五

欺骗与谋划 · 论文

找到 3 篇
筛选3
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 6 篇还没打标签,不在筛选结果里。

另有 6 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2609.38909

    Purdue 提出 Pact:将欺骗作为行为遗忘

    提出 PACT,遗忘推理模型在压力下的欺骗行为并保留上下文理解

    发表
    攻击者
    白盒
    测试
    DeepSeek-R1-Distill-Qwen-32B、QwQ-32B

    摘要论文将大模型欺骗形式化为上下文条件行为,提出 PACT 框架在消除欺骗的同时保留了上下文遵循能力。

    深度解读完整解读
  2. 分析与理论arXiv 2609.23215

    研究审计 Active Inference Agent 的 LLM 解释器失败模式

    审计 Active Inference Agent 上 LLM 解释器的监督叙述失败

    发表
    测试
    GPT-4o、Claude-3-Opus、Gemini
    摘要三组触发下解释流畅但错误,所提缓解都未被评估。

    作者审计的是挂在智能体上的运行时解释器,而不是智能体本身。操作员读到的是信念与动作的自然语言叙述。作者要问哪些可复现触发会让这段叙述失败,以及失败痕迹是什么样。

    深度解读完整解读
  3. 评测与基准arXiv 2609.29429

    Jev 被用于零样本检测十类对齐失败,中位 AUROC 达 0.886

    提出 RLCDAlignBench,零样本检测多种对齐失败

    发表
    测试
    Jev (jev-1.13.0)、Qwen3.5-2B、Phi-4-mini 等 6 个
    摘要一次通用问题已能给多数对齐失败排序,大的误差来自状态和标签。

    RLCDAlignBench 测量用强化学习做校准决策的 Jev,能否当作对齐失败的零样本检测器。

    深度解读完整解读
已经到底了