中位数的中位数 - Median of Medians,选取近似的中位数作为pivot元素

问题描述

median of medians是一种中位数(近似)选取算法,常用于其他选择算法中(主要是QuickSelect算法中)进行pivot元素的选取。

在如QuickSelect这样的选择算法中,我们pivot元素的选取对于我们算法的效率有很大的影响,median of medians算法可以帮助我们在线性时间内选出中位数附近的元素,这使得QuickSelect的最坏时间复杂度由O(n^2)降为O(n)

算法分析

(主要来自自己对wiki的翻译和理解)

Median of medians算法也被称作BFPRT算法(由Blum、Floyd、Pratt、Rivest、Tarjan五人提出),可以对照我github上的代码或者wiki上的伪代码来看。我的代码基本是伪代码的C++直接翻译。

算法一共4个函数:

#ifndef BFPRT_H
#define BFPRT_H

/**
 * put the k-th element at L[k] (0 indexed)
 */
void select(int L[], int left, int right, int k);

/**
 * actual median of medians algo
 */
int pivot(int L[], int left, int right);

/**
 * three way partition: ---[=]=[=]+++
 */
int partition(int L[], int left, int right, int pivot_index, int k);

/*
 * <= 5 elements, insertion sort, and pick the middle as partition index
 */
int partition5(int L[], int left, int right);

#endif
  • select函数从L中选择第k小的元素(left, rightk 均从0起,是L的索引,left <= k <= right
  • pivot函数从[left, right]范围中选出靠近中位数的元素,并返回其索引
  • partition函数采用three way partition,并根据k值返回:最左边的pivot索引/最右边pivot索引/k (可能有多个元素等于L[pivot\_index]
  • partition5函数是在right-left<5时,即范围内元素个数小于等于5时使用,其它情况则都使用上面的partition函数

pivot 函数

median of medians思想的核心即是在pivot函数,函数如下:

int pivot(int L[], int left, int right) {
  if (right - left < 5) return partition5(L, left, right);
  for (int i = left; i <= right; i += 5) {
    int sub_right = min(i + 4, right);
    int median5 = partition5(L, i, sub_right);
    swap(L[median5], L[left + (i - left) / 5]);
  }

  // approximate median index
  int mid = (right - left) / 10 + left + 1;
  select(L, left, left + (right - left) / 5, mid);
  return mid;
}

函数在[left, right]范围内寻找适合作为pivot的数(也就是median附近的数),返回这个数的下标。
如果少于等于5个元素,调用partition5获取,partition5使用插入排序,然后将中间元素作为pivot,返回其下标。
将范围内元素每5个一组进行划分,对每一组进行partition5操作,获取每一组的median,这一步也就是获取medians
最后用select从上一步获得的medians中进一步获取median,也就是median of medians

select函数

void select(int L[], int left, int right, int k) {
  while (true) {
    if (left == right) return;
    int pivot_index = pivot(L, left, right);
    pivot_index = partition(L, left, right, pivot_index, k);
    if (k == pivot_index)
      return;
    else if (k < pivot_index)
      right = pivot_index - 1;
    else
      left = pivot_index + 1;
  }
}

partition 函数

partition函数采用的是三路划分(three way partition),普通的两路划分也是可以的,三路书写跟两路都差不多简单,三路可以根据提供的k来判断返回最左边的pivot值的下标/最右边的pivot值的下标/中间的pivot值的下标 -- 直接就是k (看最后函数返回那几行懂了)

int partition(int L[], int left, int right, int pivot_index, int k) {
  int pivot_value = L[pivot_index];
  swap(L[pivot_index], L[right]);
  // ---[=]=[=]+++
  int store_index = left;
  for (int i = left; i < right; ++i) {
    if (L[i] < pivot_value) {
      swap(L[store_index++], L[i]);
    }
  }
  int store_index_eq = store_index;
  for (int i = store_index; i < right; ++i) {
    if (L[i] == pivot_value) {
      swap(L[store_index_eq++], L[i]);
    }
  }
  swap(L[right], L[store_index_eq]);
  if (k < store_index)
    return store_index;
  else if (k < store_index_eq)
    return k;
  else
    return store_index_eq;
}

partition5 函数

排序(这里采用的插入排序)然后返回中间元素的下标(left + right)/2即可

int partition5(int L[], int left, int right) {
  for (int i = left + 1; i <= right; ++i) {
    int j = i;
    while (j > left && L[j - 1] > L[j]) {
      swap(L[j - 1], L[j]);
      --j;
    }
  }
  return (left + right) / 2;  // return middle index (the median index)
}

最坏时间复杂度

分析最坏时间复杂度的关键在于知道选取的分割点pivot能够将[left, right]范围内的数最坏分成几比几。

(下面考虑最坏情况:选取的pivot使得下一次partition时元素尽可能多,即本次partition减少元素尽可能少)
pivot是median of medians of [left, right],设范围内有n个数,分成n/5份,n/10份的中位数小于pivotn/10份的中位数大于pivot,所以至少有3n/10个数小于pivot,所以最坏情况就是本次partition只能排除3n/10个元素,下一次partition需要在剩下的7n/10中寻找。

\begin{align*} T(n)=T(n/5)+T(7n/10)+an \end{align*}

证明T(n)=O(n),假设T(n)=tn

\begin{align*} T(n) &\leq tn/5+7tn/10+an \\\\ &= tn - \frac{tn}{10} + an \end{align*}

t\leq 10a即可,所以T(n)=O(n)

示例代码

详细源代码在: github,里面除了上面这样的几个函数分开的代码实现,还有一个简化的版本,将上面的几个函数合并到了一起,见文件BFPRT-simple.cpp

参考

最后编辑于
©著作权归作者所有,转载或内容合作请联系作者
  • 序言:七十年代末,一起剥皮案震惊了整个滨河市,随后出现的几起案子,更是在滨河造成了极大的恐慌,老刑警刘岩,带你破解...
    沈念sama阅读 202,905评论 5 476
  • 序言:滨河连续发生了三起死亡事件,死亡现场离奇诡异,居然都是意外死亡,警方通过查阅死者的电脑和手机,发现死者居然都...
    沈念sama阅读 85,140评论 2 379
  • 文/潘晓璐 我一进店门,熙熙楼的掌柜王于贵愁眉苦脸地迎上来,“玉大人,你说我怎么就摊上这事。” “怎么了?”我有些...
    开封第一讲书人阅读 149,791评论 0 335
  • 文/不坏的土叔 我叫张陵,是天一观的道长。 经常有香客问我,道长,这世上最难降的妖魔是什么? 我笑而不...
    开封第一讲书人阅读 54,483评论 1 273
  • 正文 为了忘掉前任,我火速办了婚礼,结果婚礼上,老公的妹妹穿的比我还像新娘。我一直安慰自己,他们只是感情好,可当我...
    茶点故事阅读 63,476评论 5 364
  • 文/花漫 我一把揭开白布。 她就那样静静地躺着,像睡着了一般。 火红的嫁衣衬着肌肤如雪。 梳的纹丝不乱的头发上,一...
    开封第一讲书人阅读 48,516评论 1 281
  • 那天,我揣着相机与录音,去河边找鬼。 笑死,一个胖子当着我的面吹牛,可吹牛的内容都是我干的。 我是一名探鬼主播,决...
    沈念sama阅读 37,905评论 3 395
  • 文/苍兰香墨 我猛地睁开眼,长吁一口气:“原来是场噩梦啊……” “哼!你这毒妇竟也来了?” 一声冷哼从身侧响起,我...
    开封第一讲书人阅读 36,560评论 0 256
  • 序言:老挝万荣一对情侣失踪,失踪者是张志新(化名)和其女友刘颖,没想到半个月后,有当地人在树林里发现了一具尸体,经...
    沈念sama阅读 40,778评论 1 296
  • 正文 独居荒郊野岭守林人离奇死亡,尸身上长有42处带血的脓包…… 初始之章·张勋 以下内容为张勋视角 年9月15日...
    茶点故事阅读 35,557评论 2 319
  • 正文 我和宋清朗相恋三年,在试婚纱的时候发现自己被绿了。 大学时的朋友给我发了我未婚夫和他白月光在一起吃饭的照片。...
    茶点故事阅读 37,635评论 1 329
  • 序言:一个原本活蹦乱跳的男人离奇死亡,死状恐怖,灵堂内的尸体忽然破棺而出,到底是诈尸还是另有隐情,我是刑警宁泽,带...
    沈念sama阅读 33,338评论 4 318
  • 正文 年R本政府宣布,位于F岛的核电站,受9级特大地震影响,放射性物质发生泄漏。R本人自食恶果不足惜,却给世界环境...
    茶点故事阅读 38,925评论 3 307
  • 文/蒙蒙 一、第九天 我趴在偏房一处隐蔽的房顶上张望。 院中可真热闹,春花似锦、人声如沸。这庄子的主人今日做“春日...
    开封第一讲书人阅读 29,898评论 0 19
  • 文/苍兰香墨 我抬头看了看天上的太阳。三九已至,却和暖如春,着一层夹袄步出监牢的瞬间,已是汗流浃背。 一阵脚步声响...
    开封第一讲书人阅读 31,142评论 1 259
  • 我被黑心中介骗来泰国打工, 没想到刚下飞机就差点儿被人妖公主榨干…… 1. 我叫王不留,地道东北人。 一个月前我还...
    沈念sama阅读 42,818评论 2 349
  • 正文 我出身青楼,却偏偏与公主长得像,于是被迫代替她去往敌国和亲。 传闻我的和亲对象是个残疾皇子,可洞房花烛夜当晚...
    茶点故事阅读 42,347评论 2 342