数据结构与算法之字符串匹配

我们应该都使用过String.indexOf("xxx")方法来查找某个字符或字符串在String中的位置，这就是一个字符串的匹配问题。字符串匹配在很多场景中都有应用，下面介绍的几种算法，就是在不同场景下的解决方法。

字符串的存储

数据存储只有顺序或链式两种方式，首先字符串并不适合使用链式存储，因为字符串是由字符组成的，如果每个结点仅存储一个字符，会浪费大量的空间，而如果每个结点存储多个字符，那这个数量的选择就十分关键，不同的情况下可能需要不同的数量，这样一来变数太大，不够灵活。

而使用顺序存储的话，就不会有以上问题，但数组也有一定的缺陷，数组是定长的，有可能字符串比数组小，也可能数组放不下字符串，比如最初短信只能发70个汉字，超过的部分就会被丢弃，后来则是自动拆分成两条短信。所以存储字符串使用的数组一般会通过动态分配来处理。

“暴力”匹配算法

我们要做的，就是从一个字符串中，寻找到目标子串出现的位置，比如在“helloworld”中找到“low”出现的位置。“暴力”匹配算法就是我们最容易想到的方案，那就是用目标子串和该字符串的每一位一一对比，第一个字符一致再比第二个，直到找到为止。这里我们以char数组来模拟String，找到第一个匹配目标即可。示例代码如下：

private  int indexOf(char[] origin, char[] target){
    int originLen = origin.length;
    int targetLen = target.length;

    if(originLen==0 || targetLen == 0 || originLen<targetLen){
        return -1;
    }

    if(origin == target) return 0;

    int i=0,j=0;
    while (i<originLen && j<targetLen) {
        if(origin[i] == target[j]){
            // 如果相同就一一比较
            i++;
            j++;
        }else{
            // 不相同，i指向上次匹配第一个字符的下一位，j清零
            i = i-j+1;
            j=0;
        }
    }

    if(j>targetLen-1) return i-targetLen;
    else return -1;
}

我们算下“暴力”匹配算法的时间复杂度，假设n是原字符串长度，m是目标字符串长度，最好的情况是上来就匹配，也就是只走if语句，需要运行m次，所以复杂度为O(1)。最坏的情况是，每次都先走if语句，到最后一位判断时发现不匹配，然后else-if交替进行，时间复杂度为O((n-m+1)*m)，这就好比是从字符串aaaaaaaaaab中查找ab，每次比对都发现第一个字符相同，但第二个字符不同。

在字符串比较短时，这个算法是可行的，但是当字符串非常长时，它的效率就十分低了。

KMP匹配算法

“暴力”匹配算法的主要问题在于执行else时 i 的回溯。我们以在字符串abcdefg...中寻找abcdh为例，来说明以上算法的问题。

暴力匹配

上图中，用灰线表示匹配成功，红线表示匹配失败。可以发现，因为abcdh没有重复字符，而abcd又在步骤①时都比较过了，它们分别对应相等，所以第一个字符a不可能与后边的bcd三个字符相等了，也就是说步骤②③④都是多余的。

当然，字符不重复是特殊情况，下面我们看看字符有重复时的情况，以在字符串abcababc...中查找abcabd为例。

重复字符

首先，步骤②和③是可以省略的，而目标串第一位的a和第四位一样，第二位的b和第五位一样，而第四位和第五位的a和b字符又已经和原串比较过了，它们是相等的，也就是说前两位的ab和原串第四位和第五位是分别相等的，因此步骤④和⑤也是可以省略的。

分析以上两种情况，可以发现，无论是否有重复字符，i 的值都不需要回溯，也就是从头到尾遍历一次原串，就能完成匹配。KMP算法就是把以上思路转为实现。

KMP算法的核心是计算出一个next数组，这个数组表示在暴力匹配算法中 j 的变化，也就是目标串首字符与原串比较的位置，比如在字符不重复例子中，从步骤①直接到步骤⑤，j 的变化就是从0到3，而在字符重复的例子中，就是从0到5。这个next的计算遵循以下规则：

统计当前字符下标 j 之前前缀和后缀最长连续重复字符数，把它的值当做next数组对应的数据值，没有字符则值为-1。前缀指从前往后，不包含原串的所有子串，后缀是从后往前不包含原串的所有子串。

首先解释一下前缀后缀，比如在字符串abcd中，a、ab、abc都是前缀，而d、cd、bcd都是后缀。同样，我们分没有重复和有重复来解释这里next数组的计算方式。还是以abcdh为例，j 表示每个字符的下标。

当j=0时，j之前没有字符，next[j]=-1;
当j=1时，j之前只有字符a，没有重复，所以next[j]=0;
当j=2时，j之前有字符a和b，但是它们不相等，所以next[j]=0;
当j=3时，j之前有a、b、c三个字符，也不重重，所以next[j]=0;
...

因为没有重复字符，所以next数组的最终值为-10000。

接下来我们看有重复字符的情况，以abcabd为例：

当j=0时，j之前没有字符，next[j]=-1;
当j=1时，j之前只有字符a，没有重复，所以next[j]=0;
当j=2时，j之前有字符a和b，但是它们不相等，所以next[j]=0;
当j=3时，j之前有a、b、c三个字符，也不重重，所以next[j]=0;
当j=4时，j之前有abca四个字符，此时最前的字符a和最后的字符a相等，所以next[j]=1;
当j=5时，j之前有abcab五个字符，此时最前的字符ab和最后的字符ab相等，所以next[j]=2;

所以next数组的最终值为-100012。

通过以上示例发现，next就是统计当前位置之前连续重复的字符数量，所以代码也就顺理成章了，如下所示：

private int[] getNext(char[] target){
    int len = target.length;
    if(len==0){
        return new int[]{-1};
    }
    
    int[] next = new int[target.length];

    // j表示当前位置，k表示子串需比较的第一位。
    int j=0,k=-1;
    next[0] = -1;
    while (j<len-1) {
        if(k==-1 || target[j]==target[k]){
            j++;
            k++;
            next[j]=k;
        }else{
            k=next[k];
        }
    }

    return next;
}

这里代码对上述比较进行了一次小的优化。我们看分析abcabd时，当j=4时，我们已经判断过前缀a和后缀a相等，那么当j=5时，只需要再判断前缀ab和后缀ab中的b是否相等就可以，因为a已经确认是相等了。假如b是相等的，可以推算出next[5]=next[4]+1，也就是代码中if语句的做法，这部分比较好理解。那假如是不同的呢，我们通过一个图来说明，如下所示：

next值确定

next的值，也就是表示从0到j-1的所有字符中，前缀和后缀连续相同的最大值，我们把这个值记为k，那么k的值如果对应到数组中的位置就恰好指向符合规则的前缀的下一位，如上图所示。在②中，我们知道k=5，j=12，现在我们要计算j=13时next的值，也就是当 j 指向e时的值，我们发现②中k和j指向的值不再相等，意味着需要从新开始比较，但是我们却不一定需要把 k 置为0，先看下图，e对应的最长子串应该是abd：

e的最长子串

可以发现，①和③是有共性的，也就是它们的符合规则的子串前两位是重合的，都是ab，而且①中k的位置，又正好是③中子串的最后一位，这意味着，我们只需要把原有的k，换成k=next[k]，就可以有效减少对比次数。当然，有可能k向前移动一次依然不符合，就可以再次向前移动，直到从新开始。

有了next数组，我们就可以实现KMP算法了，代码如下：

private int indexOfKMP(char[] origin, char[] target){
    int originLen = origin.length;
    int targetLen = target.length;

    if(originLen==0 || targetLen == 0 || originLen<targetLen){
        return -1;
    }

    if(origin == target) return 0;

    int i=0,j=0;
    int[] next = getNext(target);

    while (i<originLen && j<targetLen) {
        if(j==-1 || origin[i] == target[j]){
            // 如果相同就一一比较,j=0表示不需要比较
            i++;
            j++;
        }else{
            // j返回到合适的位置，i不再需要回溯
            j = next[j];
        }
    }

    if(j>targetLen-1) return i-targetLen;
    else return -1;
}

这段代码和暴力匹配差别不大，主要是在if语句中增加了j==0的判断，在else中减掉了 i 的回溯，从而大大提高效率。

KMP算法的最坏时间复杂度为O(n+m)，其中n表示原串长度，m表示目标串的长度，它的最大优势在于把时间复杂度降低到了线性级别。但是在使用中，它的优势并不十分明显，因为极少有需要在重复性很高的字符串中寻找重复性很高的子串，而且它还需要一个额外的数组来保存next。KMP算法的优势还在于不需要回退，所以它比较适合在长度不确定的输入流中查找。Java的String类内部indexOf方法使用的就是暴力匹配，可见KMP在一般场景下并不那么适用。

总结

除了以上算法之外，字符串匹配算法还有Boyer-Moore算法和Rabin-Karp算法等，这里就不再进行研究了。感兴趣的可以查阅《算法》一书。总之，在一般场景下我们可以使用暴力匹配算法，而在超长的输入流中则可以使用KMP算法，具体使用哪种还需要根据实际情况进行评估。

以上涉及代码均已上传至我的github。

我是飞机酱，如果您喜欢我的文章，可以关注我~

编程之路，道阻且长。唯，路漫漫其修远兮，吾将上下而求索。

最后编辑于：2020.09.18 10:49:29

人面猴
序言：七十年代末，一起剥皮案震惊了整个滨河市，随后出现的几起案子，更是在滨河造成了极大的恐慌，老刑警刘岩，带你破解...
沈念sama阅读 204,530评论 6赞 478
死咒
序言：滨河连续发生了三起死亡事件，死亡现场离奇诡异，居然都是意外死亡，警方通过查阅死者的电脑和手机，发现死者居然都...
沈念sama阅读 86,403评论 2赞 381
救了他两次的神仙让他今天三更去死
文/潘晓璐我一进店门，熙熙楼的掌柜王于贵愁眉苦脸地迎上来，“玉大人，你说我怎么就摊上这事。” “怎么了？”我有些...
开封第一讲书人阅读 151,120评论 0赞 337
道士缉凶录：失踪的卖姜人
文/不坏的土叔我叫张陵，是天一观的道长。经常有香客问我，道长，这世上最难降的妖魔是什么？我笑而不...
开封第一讲书人阅读 54,770评论 1赞 277
港岛之恋（遗憾婚礼）
正文为了忘掉前任，我火速办了婚礼，结果婚礼上，老公的妹妹穿的比我还像新娘。我一直安慰自己，他们只是感情好，可当我...
茶点故事阅读 63,758评论 5赞 367
恶毒庶女顶嫁案：这布局不是一般人想出来的
文/花漫我一把揭开白布。她就那样静静地躺着，像睡着了一般。火红的嫁衣衬着肌肤如雪。梳的纹丝不乱的头发上，一...
开封第一讲书人阅读 48,649评论 1赞 281
城市分裂传说
那天，我揣着相机与录音，去河边找鬼。笑死，一个胖子当着我的面吹牛，可吹牛的内容都是我干的。我是一名探鬼主播，决...
沈念sama阅读 38,021评论 3赞 398
双鸳鸯连环套：你想象不到人心有多黑
文/苍兰香墨我猛地睁开眼，长吁一口气：“原来是场噩梦啊……” “哼！你这毒妇竟也来了？” 一声冷哼从身侧响起，我...
开封第一讲书人阅读 36,675评论 0赞 258
万荣杀人案实录
序言：老挝万荣一对情侣失踪，失踪者是张志新（化名）和其女友刘颖，没想到半个月后，有当地人在树林里发现了一具尸体，经...
沈念sama阅读 40,931评论 1赞 299
护林员之死
正文独居荒郊野岭守林人离奇死亡，尸身上长有42处带血的脓包…… 初始之章·张勋以下内容为张勋视角年9月15日...
茶点故事阅读 35,659评论 2赞 321
白月光启示录
正文我和宋清朗相恋三年，在试婚纱的时候发现自己被绿了。大学时的朋友给我发了我未婚夫和他白月光在一起吃饭的照片。...
茶点故事阅读 37,751评论 1赞 330
活死人
序言：一个原本活蹦乱跳的男人离奇死亡，死状恐怖，灵堂内的尸体忽然破棺而出，到底是诈尸还是另有隐情，我是刑警宁泽，带...
沈念sama阅读 33,410评论 4赞 321
日本核电站爆炸内幕
正文年R本政府宣布，位于F岛的核电站，受9级特大地震影响，放射性物质发生泄漏。R本人自食恶果不足惜，却给世界环境...
茶点故事阅读 39,004评论 3赞 307
男人毒药：我在死后第九天来索命
文/蒙蒙一、第九天我趴在偏房一处隐蔽的房顶上张望。院中可真热闹，春花似锦、人声如沸。这庄子的主人今日做“春日...
开封第一讲书人阅读 29,969评论 0赞 19
一桩弑父案，背后竟有这般阴谋
文/苍兰香墨我抬头看了看天上的太阳。三九已至，却和暖如春，着一层夹袄步出监牢的瞬间，已是汗流浃背。一阵脚步声响...
开封第一讲书人阅读 31,203评论 1赞 260
情欲美人皮
我被黑心中介骗来泰国打工，没想到刚下飞机就差点儿被人妖公主榨干…… 1. 我叫王不留，地道东北人。一个月前我还...
沈念sama阅读 45,042评论 2赞 350
代替公主和亲
正文我出身青楼，却偏偏与公主长得像，于是被迫代替她去往敌国和亲。传闻我的和亲对象是个残疾皇子，可洞房花烛夜当晚...
茶点故事阅读 42,493评论 2赞 343

数据结构与算法之字符串匹配

字符串的存储

“暴力”匹配算法

KMP匹配算法

总结

推荐阅读更多精彩内容