CPU Cache伪共享问题-电子发烧友网

先看下这两段代码：

代码段1：

const int row = 10240;
const int col = 10240;
int matrix[row][col];
int TestRow() {
  //按行遍历
  int sum_row = 0;
  for (int r = 0; r < row; r++) {
    for (int c = 0; c < col; c++) {
      sum_row += matrix[r][c];
    }
  }
  return sum_row;
}

代码段2：

int TestCol() {
  //按列遍历
  int sum_col = 0;
  for (int c = 0; c < col; c++) {
    for (int r = 0; r < row; r++) {
      sum_col += matrix[r][c];
    }
  }
  return sum_col;
}

两段代码的目的相同，都是为了计算矩阵中所有元素的总和。

但有些区别：一个是按行遍历元素做计算，一个是按列遍历元素做计算。

它俩的运行速度有什么区别吗？

如图：

图中可以看到，行遍历的代码速度比列遍历的代码速度快很多。

为什么按行遍历的代码比按列遍历的代码速度快？这里就是CPU Cache在起作用。

什么是CPU Cache？

可以先看下这个存储器相关的金字塔图：

从下到上，空间虽然越来越小，但是处理速度越来越快，相应的，设备价格也越来越贵。

图中的寄存器和主存估计大家都知道，那中间的L1 、L2、L3是什么？它们起到了什么作用？

它们就是CPU 的Cache，如下图：

可以理解为CPU Cache就是CPU与主存之间的桥梁。

当CPU想要访问主存中的元素时，会先查看Cache中是否存在，如果存在（称为Cache Hit），直接从Cache中获取，如果不存在（称为Cache Miss），才会从主存中获取。Cache的处理速度比主存快得多。

所以，如果每次访问数据时，都能直接从Cache中获取，整个程序的性能肯定会更高。

那，如何提高CPU Cache的命中率？

这里我不多介绍，感兴趣的直接移步到我这篇文章：https://mp.weixin.qq.com/s/iKWQZxn6XYKU9KnlBRynfg

但CPU Cache这里还有个小问题，看下这两段代码：

代码段1：

struct Point {
  std::atomic<int> x;
  // char a[128];
  std::atomic<int> y;
};
void Test() {
  Point point;
  std::thread t1(
      [](Point *point) {
        for (int i = 0; i < 100000000; ++i) {
          point->x += 1;
        }
      },
      &point);
  std::thread t2(
      [](Point *point) {
        for (int i = 0; i < 100000000; ++i) {
          point->y += 1;
        }
      },
      &point);
  t1.join();
  t2.join();
}

代码段2：

struct Point {
  std::atomic<int> x;
  char a[128];
  std::atomic<int> y;
};
void Test() {
  Point point;
  std::thread t1(
      [](Point *point) {
        for (int i = 0; i < 100000000; ++i) {
          point->x += 1;
        }
      },
      &point);
  std::thread t2(
      [](Point *point) {
        for (int i = 0; i < 100000000; ++i) {
          point->y += 1;
        }
      },
      &point);
  t1.join();
  t2.join();
}