Redis使用zipList 节省大量的空间

redis作为目前最流行的nosql缓存数据库，凭借其优异的性能、丰富的数据结构已成为大部分场景下首选的缓存工具。
由于redis是一个纯内存的数据库，在存放大量数据时，内存的占用将会非常可观。那么在一些场景下，通过选用合适的数据结构来存储，可以大幅减少内存的占用，甚至于可以减少80%-99%的内存占用。

一、利用zipList来替代大量的Key-Value

先来看一下场景，在Dsp广告系统、海量用户系统经常会碰到这样的需求，要求根据用户的某个唯一标识迅速查到该用户的id。譬如根据mac地址或uuid或手机号的md5，去查询到该用户的id。

特点是数据量很大、千万或亿级别，key是比较长的字符串，如32位的md5或者uuid这种。

如果不加以处理，直接以key-value形式进行存储，我们可以简单测试一下，往redis里插入1千万条数据，1550000000 - 1559999999，形式就是key（md5（1550000000））→ value(1550000000)这种。

然后用info memory看一下内存占用。

image.png

可以看到，这1千万条数据，占用了redis共计1.17G的内存。当数据量变成1个亿时，实测大约占用8个G。

同样的一批数据，我们换一种存储方式，先来看结果：

image.png

在我们利用zipList后，内存占用为123M，大约减少了85%的空间占用，这是怎么做到的呢？我们来从redis的底层存储来剖析一下。

01 redis数据结构和编码方式

image.png

02 redis如何存储字符串

string是redis里最常用的数据结构，redis的默认字符串和C语言的字符串不同，它是自己构建了一种名为“简单动态字符串SDS”的抽象类型。

image.png

具体到string的底层存储，redis共用了三种方式，分别是int、embstr和raw。

譬如set k1 abc和set k2 123就会分别用embstr、int。当value的长度大于44（或39，不同版本不一样）个字节时，会采用raw。

image.png

int是一种定长的结构，占8个字节（注意，相当于java里的long），只能用来存储长整形。

embstr是动态扩容的，每次扩容1倍，超过1M时，每次只扩容1M。

raw用来存储大于44个字节的字符串。

具体到我们的案例中，key是32个字节的字符串（embstr），value是一个长整形（int），所以如果能将32位的md5变成int，那么在key的存储上就可以直接减少3/4的内存占用。

这是第一个优化点。

03 redis如何存储Hash

从1.1的图上我们可以看到Hash数据结构，在编码方式上有两种，1是hashTable，2是zipList。

hashTable大家很熟悉，和java里的hashMap很像，都是数组+链表的方式。java里hashmap为了减少hash冲突，设置了负载因子为0.75。同样，redis的hash也有类似的扩容负载因子。细节不提，只需要留个印象，用hashTable编码的话，则会花费至少大于存储的数据25%的空间才能存下这些数据。它大概长这样：

image.png

zipList，压缩链表，它大概长这样：

image.png

可以看到，zipList最大的特点就是，它根本不是hash结构，而是一个比较长的字符串，将key-value都按顺序依次摆放到一个长长的字符串里来存储。如果要找某个key的话，就直接遍历整个长字符串就好了。

所以很明显，zipList要比hashTable占用少的多的空间。但是会耗费更多的cpu来进行查询。

那么何时用hashTable、zipList呢？在redis.conf文件中可以找到：

image.png

就是当这个hash结构的内层field-value数量不超过512，并且value的字节数不超过64时，就使用zipList。

通过实测，value数量在512时，性能和单纯的hashTable几乎无差别，在value数量不超过1024时，性能仅有极小的降低，很多时候可以忽略掉。

而内存占用，zipList可比hashTable降低了极多。

这是第二个优化点。

04 用zipList来代替key-value

通过上面的知识，我们得出了两个结论。用int作为key，会比string省很多空间。用hash中的zipList，会比key-value省巨大的空间。

那么我们就来改造一下当初的1千万个key-value。

第一步：

我们要将1千万个键值对，放到N个bucket中，每个bucket是一个redis的hash数据结构，并且要让每个bucket内不超过默认的512个元素（如果改了配置文件，如1024，则不能超过修改后的值），以避免hash将编码方式从zipList变成hashTable。

1千万 / 512 = 19531。由于将来要将所有的key进行哈希算法，来尽量均摊到所有bucket里，但由于哈希函数的不确定性，未必能完全平均分配。所以我们要预留一些空间，譬如我分配25000个bucket，或30000个bucket。

第二步：

选用哈希算法，决定将key放到哪个bucket。这里我们采用高效而且均衡的知名算法crc32，该哈希算法可以将一个字符串变成一个long型的数字，通过获取这个md5型的key的crc32后，再对bucket的数量进行取余，就可以确定该key要被放到哪个bucket中。

image.png

第三步：

通过第二步，我们确定了key即将存放在的redis里hash结构的外层key，对于内层field，我们就选用另一个hash算法，以避免两个完全不同的值，通过crc32（key） % COUNT后，发生field再次相同，产生hash冲突导致值被覆盖的情况。内层field我们选用bkdr哈希算法（或直接选用Java的hashCode），该算法也会得到一个long整形的数字。value的存储保持不变。

image.png

第四步：

装入数据。原来的数据结构是key-value，0eac261f1c2d21e0bfdbd567bb270a68 → 1550000000。

现在的数据结构是hash，key为14523，field是1927144074，value是1550000000。

通过实测，将1千万数据存入25000个bucket后，整体hash比较均衡，每个bucket下大概有300多个field-value键值对。理论上只要不发生两次hash算法后，均产生相同的值，那么就可以完全依靠key-field来找到原始的value。这一点可以通过计算总量进行确认。实际上，在bucket数量较多时，且每个bucket下，value数量不是很多，发生连续碰撞概率极低，实测在存储50亿个手机号情况下，未发生明显碰撞。

测试查询速度：

在存储完这1千万个数据后，我们进行了查询测试，采用key-value型和hash型，分别查询100万条数据，看一下对查询速度的影响。

key-value耗时：10653、10790、11318、9900、11270、11029毫秒

hash-field耗时：12042、11349、11126、11355、11168毫秒。

可以看到，整体上采用hash存储后，查询100万条耗时，也仅仅增加了500毫秒不到。对性能的影响极其微小。但内存占用从1.1G变成了120M，带来了接近90%的内存节省。

二、总结

大量的key-value，占用过多的key，redis里为了处理hash碰撞，需要占用更多的空间来存储这些key-value数据。

如果key的长短不一，譬如有些40位，有些10位，因为对齐问题，那么将产生巨大的内存碎片，占用空间情况更为严重。所以，保持key的长度统一（譬如统一采用int型，定长8个字节），也会对内存占用有帮助。

string型的md5，占用了32个字节。而通过hash算法后，将32降到了8个字节的长整形，这显著降低了key的空间占用。

zipList比hashTable明显减少了内存占用，它的存储非常紧凑，对查询效率影响也很小。所以应善于利用zipList，避免在hash结构里，存放超过512个field-value元素。

如果value是字符串、对象等，应尽量采用byte[]来存储，同样可以大幅降低内存占用。譬如可以选用google的Snappy压缩算法，将字符串转为byte[]，非常高效，压缩率也很高。

为减少redis对字符串的预分配和扩容（每次翻倍），造成内存碎片，不应该使用append，setrange等。而是直接用set，替换原来的。

方案缺点：

hash结构不支持对单个field的超时设置。但可以通过代码来控制删除，对于那些不需要超时的长期存放的数据，则没有这种顾虑。

存在较小的hash冲突概率，对于对数据要求极其精确的场合，不适合用这种压缩方式。

基于上述方案，我改写了springboot源码的redisTemplate，提供了一个CompressRedisTemplate类，可以直接当成redisTemplate使用，它会自动将key-value转为hash进行存储，以达到上述目的。

后续，我们会基于更极端一些的场景，如统计独立访客等，来看一下redis的不常见的数据结构，是如何将内存占用由20G降低到5M。

最后编辑于：2024.10.28 17:49:19

人面猴
序言：七十年代末，一起剥皮案震惊了整个滨河市，随后出现的几起案子，更是在滨河造成了极大的恐慌，老刑警刘岩，带你破解...
沈念sama阅读 205,033评论 6赞 478
死咒
序言：滨河连续发生了三起死亡事件，死亡现场离奇诡异，居然都是意外死亡，警方通过查阅死者的电脑和手机，发现死者居然都...
沈念sama阅读 87,725评论 2赞 381
救了他两次的神仙让他今天三更去死
文/潘晓璐我一进店门，熙熙楼的掌柜王于贵愁眉苦脸地迎上来，“玉大人，你说我怎么就摊上这事。” “怎么了？”我有些...
开封第一讲书人阅读 151,473评论 0赞 338
道士缉凶录：失踪的卖姜人
文/不坏的土叔我叫张陵，是天一观的道长。经常有香客问我，道长，这世上最难降的妖魔是什么？我笑而不...
开封第一讲书人阅读 54,846评论 1赞 277
港岛之恋（遗憾婚礼）
正文为了忘掉前任，我火速办了婚礼，结果婚礼上，老公的妹妹穿的比我还像新娘。我一直安慰自己，他们只是感情好，可当我...
茶点故事阅读 63,848评论 5赞 368
恶毒庶女顶嫁案：这布局不是一般人想出来的
文/花漫我一把揭开白布。她就那样静静地躺着，像睡着了一般。火红的嫁衣衬着肌肤如雪。梳的纹丝不乱的头发上，一...
开封第一讲书人阅读 48,691评论 1赞 282
城市分裂传说
那天，我揣着相机与录音，去河边找鬼。笑死，一个胖子当着我的面吹牛，可吹牛的内容都是我干的。我是一名探鬼主播，决...
沈念sama阅读 38,053评论 3赞 399
双鸳鸯连环套：你想象不到人心有多黑
文/苍兰香墨我猛地睁开眼，长吁一口气：“原来是场噩梦啊……” “哼！你这毒妇竟也来了？” 一声冷哼从身侧响起，我...
开封第一讲书人阅读 36,700评论 0赞 258
万荣杀人案实录
序言：老挝万荣一对情侣失踪，失踪者是张志新（化名）和其女友刘颖，没想到半个月后，有当地人在树林里发现了一具尸体，经...
沈念sama阅读 42,856评论 1赞 300
护林员之死
正文独居荒郊野岭守林人离奇死亡，尸身上长有42处带血的脓包…… 初始之章·张勋以下内容为张勋视角年9月15日...
茶点故事阅读 35,676评论 2赞 323
白月光启示录
正文我和宋清朗相恋三年，在试婚纱的时候发现自己被绿了。大学时的朋友给我发了我未婚夫和他白月光在一起吃饭的照片。...
茶点故事阅读 37,787评论 1赞 333
活死人
序言：一个原本活蹦乱跳的男人离奇死亡，死状恐怖，灵堂内的尸体忽然破棺而出，到底是诈尸还是另有隐情，我是刑警宁泽，带...
沈念sama阅读 33,430评论 4赞 321
日本核电站爆炸内幕
正文年R本政府宣布，位于F岛的核电站，受9级特大地震影响，放射性物质发生泄漏。R本人自食恶果不足惜，却给世界环境...
茶点故事阅读 39,034评论 3赞 307
男人毒药：我在死后第九天来索命
文/蒙蒙一、第九天我趴在偏房一处隐蔽的房顶上张望。院中可真热闹，春花似锦、人声如沸。这庄子的主人今日做“春日...
开封第一讲书人阅读 29,990评论 0赞 19
一桩弑父案，背后竟有这般阴谋
文/苍兰香墨我抬头看了看天上的太阳。三九已至，却和暖如春，着一层夹袄步出监牢的瞬间，已是汗流浃背。一阵脚步声响...
开封第一讲书人阅读 31,218评论 1赞 260
情欲美人皮
我被黑心中介骗来泰国打工，没想到刚下飞机就差点儿被人妖公主榨干…… 1. 我叫王不留，地道东北人。一个月前我还...
沈念sama阅读 45,174评论 2赞 352
代替公主和亲
正文我出身青楼，却偏偏与公主长得像，于是被迫代替她去往敌国和亲。传闻我的和亲对象是个残疾皇子，可洞房花烛夜当晚...
茶点故事阅读 42,526评论 2赞 343

Redis使用zipList 节省大量的空间

一、利用zipList来替代大量的Key-Value

二、总结

推荐阅读更多精彩内容