page struct的三种存放方式-电子发烧友网

随着硬件能力的提升，系统内存容量变得越来越大。尤其是在服务器上，过T级别的内存容量也已经不罕见了。

如此海量内存给内核带来了很多挑战，其中之一就是page struct存放在哪里。

page struct的三种存放方式

在内核中，我们将物理内存按照页大小进行管理。这样每个页就对应一个page struct作为这个页的管理数据结构。

随着内存容量的增加，相对应的page struct也就增加。而这部分内存和其他的内存略有不同，因为这部分内存不能给到页分配器。也就是必须在系统能够正常运行起来之前就分配好。

在内核中我们可以看到，为了应对这样的变化进化出了几个不同的版本。有幸的是，这部分内容我们现在还能在代码中直接看到，因为这个实现是通过内核配置来区分的。我们通过查找_pfn_to_page的定义就能发现一下几种memory model：

CONFIG_FLATMEM

CONFIG_SPARSEMEM

CONFIGSPARSEMEMVMEMMAP

接下来让小编给各位看官一一道来。

1) FLATMEM

在这种情况下，宏_pfn_to_page的定义是：

#define__pfn_to_page(pfn)(mem_map+((pfn)-ARCH_PFN_OFFSET))

而这个mem_map的定义是

structpage*mem_map;

所以在这种情况下，page struct就是一个大数组，所有的人都按照自己的物理地址有序得挨着。

2) SPARSEMEM

虽然第一种方式非常简单直观，但是有几个非常大的缺点：

内存如果有空洞，那么中间可能会有巨大的page struct空间浪费

所有的page struct内存都在一个NUMA节点上，会耗尽某一个节点内存，甚至是分配失败

且会产生夸NUMA访问导致性能下降

所以第二种方式就是将内存按照一定粒度，如128M，划分了section，每个section中有个成员指定了对应的page struct的存储空间。

这样就解决了上述的几个问题：

如果有空洞，那么对应的 page struct就不会占用空间

每个section对应的page struct是属于本地NUMA的

怎么样，是不是觉得很完美。这一部分具体的实现可以可以看函数sparse_init()函数。

有了这个基础知识，我们再来看这种情况下_pfn_to_page的定义：

#define __pfn_to_page(pfn) ({ unsigned long __pfn = (pfn); struct mem_section *__sec = __pfn_to_section(__pfn); __section_mem_map_addr(__sec) + __pfn; })

就是先找到pfn对应的section，然后在section中保存的地址上翻译出对应pfn的page struct。

既然讲到了这里，我们就要对sparsemem中重要的组成部分mem_section多说两句。

先来一张mem_section的整体图解：

这是一个 NRSECTIONROOTS x SECTIONSPERROOT的二维数组。其中每一个成员就代表了我们刚才提到的128M内存。

当然最开始它不是这个样子的。

其实最开始这个数组是一个静态数组。很明显这么做带来的问题是这个数组定义太大太小都不合适。所以后来引进了CONFIGSPARSEMEMEXTREME编译选项，当设置为y时，这个数组就变成了动态的。

如果上面这个算作是空间上的限制的话，那么接下来就是一个时间上的限制了。

在系统初始化时，每个mem_section都要和相应的内存空间关联。在老版本上，这个步骤通过对整个数组接待完成。原来的版本上问题不大，因为整个数组的大小还没有很大。但随着内存容量的增加，这个数值就变得对系统有影响了。如果系统上确实有这么多内存，那么确实需要初始化也就忍了。但是在内存较小的系统上，哪怕没有这么多内存，还是要挨个初始化，那就浪费了太多的时间。

commit c4e1be9ec1130fff4d691cdc0e0f9d666009f9aeAuthor: Dave Hansen Date: Thu Jul 6 15:36:44 2017 -0700 mm, sparsemem: break out of loops earl

Dave在这个提交中增加了对系统最大存在内存的跟踪，来减少不必要的初始化时间。

瞧，内核代码一开始其实也没有这么高大上不是。

3) SPARSEMEM_VMEMMAP

最后要讲的，也是当前x86系统默认配置的内存模型是SPARSEMEM_VMEMMAP。那为什么要引入这么一个新的模型呢？那自然是sparsemem依然有不足。

细心的朋友可能已经注意到了，前两种内存模型在做pfn到page struct转换是有着一些些的差异。为了看得清，我们把这两个定义再拿过来对比一下：

先看看FLATMEM时的定义：

#define__pfn_to_page(pfn)(mem_map+((pfn)-ARCH_PFN_OFFSET))

再来看看使用SPASEMEM后的定义：

#define __pfn_to_page(pfn) ({ unsigned long __pfn = (pfn); struct mem_section *__sec = __pfn_to_section(__pfn); __section_mem_map_addr(__sec) + __pfn; })

更改后，需要先找到section，然后再从section->memmap的内容中换算出page的地址。

不仅计算的内容多了，更重要的是还有一次访问内存的操作

可以想象，访问内存和单纯计算之间的速度差异那是巨大的差距。

既然产生了这样的问题，那有没有办法解决呢？其实说来简单，内核开发者利用了我们常见的一个内存单元来解决这个问题。

页表

是不是很简单粗暴？如果我们能够通过某种方式将page struct线性映射到页表，这样我们不就能又通过简单的计算来换算物理地址和page struct了么？

内核开发者就是这么做的，我们先来看一眼最后那简洁的代码：

#define__pfn_to_page(pfn)(vmemmap+(pfn))

经过内核开发这的努力，物理地址到page struct的转换又变成如此的简洁。不需要访问内存，所以速度的问题得到了解决。

但是天下没有免费的午餐，世界哪有这么美好，鱼和熊掌可以兼得的情况或许只有在梦境之中。为了达到如此简洁的转化，我们是要付出代价的。为了实现速度上的提升，我们付出了空间的代价。

至此引出了计算机界一个经典的话题：

时间和空间的转换

话不多说，也不矫情了，我们来看看内核中实现的流程。

既然是利用了页表进行转换，那么自然是要构建页表在做这样的映射。这个步骤主要由函数vmemmap_populate()来完成，其中还区分了有没有大页的情况。我们以普通页的映射为例，看看这个实现。

int __meminit vmemmap_populate_basepages(unsigned long start, unsigned long end, int node){ unsigned long addr = start; pgd_t *pgd; p4d_t *p4d; pud_t *pud; pmd_t *pmd; pte_t *pte; for (; addr < end; addr += PAGE_SIZE) { pgd = vmemmap_pgd_populate(addr, node); if (!pgd) return -ENOMEM; p4d = vmemmap_p4d_populate(pgd, addr, node); if (!p4d) return -ENOMEM; pud = vmemmap_pud_populate(p4d, addr, node); if (!pud) return -ENOMEM; pmd = vmemmap_pmd_populate(pud, addr, node); if (!pmd) return -ENOMEM; pte = vmemmap_pte_populate(pmd, addr, node); if (!pte) return -ENOMEM; vmemmap_verify(pte, node, addr, addr + PAGE_SIZE); } return 0;}

内核代码的优美之处就在于，你可能不一定看懂了所有细节，但是从优美的结构上能猜到究竟做了些什么。上面这段代码的工作就是对每一个页，按照层级去填充页表内容。其中具体的细节就不在这里展开了，相信有兴趣的同学会自行去探索。

那这么做的代价究竟是多少呢？

以x86为例，每个section是128M，那么每个section的page struct正好是2M，也就是一个大页。

(128M / 4K) * 64 = (128 * (1 < 20) / (1 < 12)) * 64 = 2M

假如使用大页做页表映射，那么每64G才用掉一个4K页表做映射。

128M * 512 = 64G

所以在使用大页映射的情况下，这个损耗的级别在百万分之一。还是能够容忍的。

好了，我们终于沿着内核发展的历史重走了一遍安放page struct之路。相信大家在这一路上领略了代码演进的乐趣，也会对以后自己代码的设计有了更深的思考。

声明：本文内容及配图由入驻作者撰写或者入驻合作网站授权转载。文章观点仅代表作者本人，不代表电子发烧友网立场。文章及其配图仅供工程师学习之用，如有内容侵权或者其他违规问题，请联系本站处理。举报投诉

服务器

服务器

+关注

关注
12

文章
8116

浏览量
82500
数据结构

数据结构

+关注

关注
3

文章
564

浏览量
39899
PAGE

PAGE

+关注

关注
0

文章
10

浏览量
20090

原文标题：page结构体，何处安放你的灵魂？

文章出处：【微信号：LinuxDev，微信公众号：Linux阅码场】欢迎添加关注！文章转载请注明出处。

运放的三种应用

运放在电路中主要存在三种应用，放大器，滤波器，振荡器。再这三种应用电路中，运放的两大特点虚短虚断仍然成立吗？在阻尼振荡器中，工作过程是否按照我描述的这样，在反相输入端加一个近似锯齿波的电流源，正半

发表于 01-26 16:18

介绍三种建模方式

据量大，而是指样本的完备性。还有就是大数据或者AI被专业学者或者行业工程师所诟病的就是，纯粹的数据驱动搞不出所以然出来，需要领域知识（即Domain Knowledge）的协助。此外，还有第三种建模方式就是混合驱动，即基础物理模型加上数据驱动的

发表于 01-23 10:48 •462次阅读

嵌入式Linux开发的三种方式

嵌入式Linux开发主要有三种方式：裸机开发、SDK开发和驱动开发。

发表于 01-22 14:22 •252次阅读

分布式锁的三种实现方式

分布式锁的三种实现方式分布式锁是在分布式系统中用于实现对共享资源进行访问控制的一种机制。分布式锁的实现需要考虑高可用性、高性能和正确性等方面的问题。在实际应用中，有多种不同的方式可以实现分布式

发表于 12-28 10:01 •334次阅读

三极管的偏置电压和三种连接方式

电子发烧友网站提供《三极管的偏置电压和三种连接方式.zip》资料免费下载

发表于 11-20 14:44 •0次下载

三极管的偏置电压和<b class='flag-5'>三种</b>连接<b class='flag-5'>方式</b>

线缆怎么存放更好

线缆存放的正确性对于线缆的保护和安全使用具有至关重要的影响。以下是线缆存放正确的重要性：防止物理损伤：线缆在存放过程中可能会受到挤压、摩擦、撞击等物理损伤，导致线缆变形、破损或断裂。正确的存

发表于 11-14 11:16 •276次阅读

地址映像有哪三种方式

为Cache地址，这个变换过程叫作地址变换。地址映像方式通常采用直接映像、全相联映像、组相联映像三种： 1-直接映像每个主存地址映像到Cache中的一个指定地址的方式，称为直接映像方式

发表于 10-31 11:39 •552次阅读

快充的三种实现方式是什么？快充对电池的损害程度大吗？

快充的三种实现方式是什么？快充对电池的损害程度大吗？快充技术在近年来随着移动设备的普及而得到广泛应用。传统的充电方式需要几个小时才能完成，但是快充技术大大缩短了充电时间。这种技术被广泛应用于手机

发表于 10-22 15:08 •711次阅读

请问如何用单片机让三极管出现三种不同的电平状态？

如何用单片机让三极管出现三种不同的电平状态？

发表于 10-10 06:56

非隔离型开关电源的三种工作方式

非隔离型开关电源一般有三种基本工作方式，降压型、升压型、极性反转型三种，而其他的都是这三种形式转换而来，例如反激式、正激式、推挽式、半桥式、全桥式。

发表于 09-24 11:28 •1.2w次阅读

stm32在不同数据在ram存放方式？

比如8位和16位数据32位数据，在ram中怎么存放的

发表于 09-21 06:37

降低运动控制应用中可闻噪声的三种出色方式

降低运动控制应用中可闻噪声的三种出色方式

发表于 08-24 13:37 •305次阅读

浅谈伺服电机的三种控制方式

伺服电机控制方式有脉冲、模拟量和通讯控制这三种，在不同的应用场景下，该如何确定选择伺服电机控制方式？

发表于 07-26 09:22 •1087次阅读

我看MS51有三种Flash大小的，除了Flash大小不同外，其他配置一样吗？

我看MS51有三种Flash大小的，除了Flash大小不同外，其他配置一样吗

发表于 06-15 10:15

全面讲解C语言的结构体(struct)

结构体(struct)是由一系列具有相同类型或不同类型的数据构成的数据集合，也叫结构。

发表于 06-05 14:33 •778次阅读