防御arXiv:2609.38909 · 9月30日Purdue 提出 Pact:将欺骗作为行为遗忘提出 PACT,遗忘压力触发的条件性欺骗并保留上下文理解模型与 API攻击者白盒·测试DeepSeek-R1-Distill-Qwen-32B、QwQ-32B·训练与数据层模型加固模型篡改欺骗与谋划微调与开源权重+1+1摘要论文将大模型欺骗形式化为上下文条件行为,提出 PACT 框架在消除欺骗的同时保留了上下文遵循能力。完整解读
风险行为arXiv:2607.14345 · 7月16日Truthful AI 提出价值泄漏评估:模型答案被自身价值观悄然左右提出价值泄漏评估,测量模型回答受自身价值倾向的隐蔽影响模型与 API·测试Claude Opus 4.8、Claude Opus 4.7、Claude Opus 4.6 等 15 个·模型层失准与价值偏离推理链摘要论文揭示前沿模型回答常受自身价值隐蔽塑造,提出反事实评估量化偏见及其思维链隐瞒,指出当前对齐未能有效防范该失效。完整解读
风险行为arXiv:2609.39838 · 10月1日研究:模型易学会隐写传信,隐写推理则难得多比较隐写推理与隐写传信、编码推理的可学性模型与 API·测试GPT-5.5、Claude Sonnet 5、Gemini 3.5 Flash 等 14 个·模型层欺骗与谋划推理链摘要隐写推理比传信和编码推理更难学。Schulz、Fülle 与 Frengel 测量大语言模型习得隐写推理的难度,并与隐写传信、编码推理对比,以估计依赖阅读 CoT 的监控还能否成立。完整解读