研究

研究

我们如何构建、为什么这样构建 —— 方法、评测与公开的工程笔记。

DeepSeek-V4-Flash 的混合精度压缩

DeepSeek-V4-Flash 的混合精度压缩

按 tensor 家族分配精度,可以把 DeepSeek-V4-Flash-0731 的 284B 权重压到 80.76 GiB,全部 256 个路由专家一个不删,在一台 128 GB 的机器上跑 262,144 的物理上下文。这篇给出配方、引擎推翻纸面配方的两处、压完之后的容量实测,以及压缩没有解决的那一半——为补上带宽差距而引入的投机解码,在这套实现里并不无损:同一个 prompt、温度 0,三个验证深度给出三组互不相同的稳定输出。