风险行为arXiv 2609.39838
研究:模型易学会隐写传信,隐写推理则难得多
比较隐写推理与隐写传信、编码推理的可学性
- arXiv
- 2609.39838
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- DeepSeek V4 Pro、GPT-5.5、Claude Sonnet 5 等 14 个
摘要隐写推理比传信和编码推理更难学。
Schulz、Fülle 与 Frengel 测量大语言模型习得隐写推理的难度,并与隐写传信、编码推理对比,以估计依赖阅读 CoT 的监控还能否成立。
比较隐写推理与隐写传信、编码推理的可学性
Schulz、Fülle 与 Frengel 测量大语言模型习得隐写推理的难度,并与隐写传信、编码推理对比,以估计依赖阅读 CoT 的监控还能否成立。
测量模型在工作汇报中是否隐瞒改变叙事的缺陷
作者研究 LLM 在汇报长程工作时是否会隐瞒会改变叙事的缺陷,并把这一行为称为 insecure reporting。