常见正则匹配

    xiaoxiao2022-06-22  30

    一、中文

    转自:http://www.cnblogs.com/sosoft/p/3456631.html

    Unicode中文和特殊字符的编码范围

     编程中有时候需要用到匹配中文的正则,一般用 [ \u4e00-\u9fa5]+ 即可搞定。不过这正则对一般的火星文鸟语就不太适用了,甚至全角的标点符号都不包含在内。例如游戏里面的玩家名,普通青年一般都是汉字,文艺青年会加几个特殊字符,2B青年火星文鸟语都会用上;这时候你就需要更强大的正则了。

            其实,游戏内大部分的玩家名都取自:中日韩统一表意文字(CJK Unified Ideographs),外加一些特殊的字符;用 [ \u2E80-\uFE4F]+基本都涵盖了 。根据Unicode5.0整理如下:

    1)标准CJK文字

    http://www.unicode.org/Public/UNIDATA/Unihan.html

    2)全角ASCII、全角中英文标点、半宽片假名、半宽平假名、半宽韩文字母:FF00-FFEF

    http://www.unicode.org/charts/PDF/UFF00.pdf

    3)CJK部首补充:2E80-2EFF

    http://www.unicode.org/charts/PDF/U2E80.pdf

    4)CJK标点符号:3000-303F

    http://www.unicode.org/charts/PDF/U3000.pdf

    5)CJK笔划:31C0-31EF

    http://www.unicode.org/charts/PDF/U31C0.pdf

    6)康熙部首:2F00-2FDF

    http://www.unicode.org/charts/PDF/U2F00.pdf

    7)汉字结构描述字符:2FF0-2FFF

    http://www.unicode.org/charts/PDF/U2FF0.pdf

    8)注音符号:3100-312F

    http://www.unicode.org/charts/PDF/U3100.pdf

    9)注音符号(闽南语、客家语扩展):31A0-31BF

    http://www.unicode.org/charts/PDF/U31A0.pdf

    10)日文平假名:3040-309F

    http://www.unicode.org/charts/PDF/U3040.pdf

    11)日文片假名:30A0-30FF

    http://www.unicode.org/charts/PDF/U30A0.pdf

    12)日文片假名拼音扩展:31F0-31FF

    http://www.unicode.org/charts/PDF/U31F0.pdf

    13)韩文拼音:AC00-D7AF

    http://www.unicode.org/charts/PDF/UAC00.pdf

    14)韩文字母:1100-11FF

    http://www.unicode.org/charts/PDF/U1100.pdf

    15)韩文兼容字母:3130-318F

    http://www.unicode.org/charts/PDF/U3130.pdf

    16)太玄经符号:1D300-1D35F

    http://www.unicode.org/charts/PDF/U1D300.pdf

    17)易经六十四卦象:4DC0-4DFF

    http://www.unicode.org/charts/PDF/U4DC0.pdf

    18)彝文音节:A000-A48F

    http://www.unicode.org/charts/PDF/UA000.pdf

    19)彝文部首:A490-A4CF

    http://www.unicode.org/charts/PDF/UA490.pdf

    20)盲文符号:2800-28FF

    http://www.unicode.org/charts/PDF/U2800.pdf

    21)CJK字母及月份:3200-32FF

    http://www.unicode.org/charts/PDF/U3200.pdf

    22)CJK特殊符号(日期合并):3300-33FF

    http://www.unicode.org/charts/PDF/U3300.pdf

    23)装饰符号(非CJK专用):2700-27BF

    http://www.unicode.org/charts/PDF/U2700.pdf

    24)杂项符号(非CJK专用):2600-26FF

    http://www.unicode.org/charts/PDF/U2600.pdf

    25)中文竖排标点:FE10-FE1F

    http://www.unicode.org/charts/PDF/UFE10.pdf

    26)CJK兼容符号(竖排变体、下划线、顿号):FE30-FE4F

    http://www.unicode.org/charts/PDF/UFE30.pdf

    http://www.cnblogs.com/sosoft/p/3456631.html

    二、IP

    转自:http://www.jb51.net/tools/zhengze.html

    ip 地址范围:0.0.0.0 ~ 255.255.255.255

    每个数字不能超过255;

    00.00.00.00 、01.0.0.0 、001.0.0.0 这些也是正确的 ip 地址,即 ip 地址可以包含前导零。

    那么该如何匹配到正确的 ip 地址呢?

    四个数字的格式是一样的,只需匹配一个,然后使用{3}重复3次即可:

    ((2[0-4]\d|25[0-5]|[01]?\d\d?)\.){3}(2[0-4]\d|25[0-5]|[01]?\d\d?)

    三、匹配包含字母(不区分大小写)、数字,6-16位字符串

    http://www.zjmainstay.cn/regexp-lookaround

    需求:必须包含字母(不区分大小写)、数字,6-16位密码  正则:^(?=.*?[a-zA-Z])(?=.*?[0-9])[a-zA-Z0-9]{6,16}$  测试用例:

    #量词条件:1. 小于62. 6-16(关注边界值)3. 大于16#字符条件:1. 纯数字2. 纯英文3. 数字+英文4. 英文+数字5. 英文数字乱序混合注:每类字符条件都要考虑量词条件

    示例中,使用(?=.*?[a-zA-Z])限定后面的字符中至少有一个字母,使用(?=.*?[0-9])限定后面的字符中至少有一个数字,最后通过实际

    匹配正则[a-zA-Z0-9]{6,16}限定量词。此示例,同样提现了环视不占位的特性,否则的话,第一个环视消耗完字符,会导致后面匹配失败,

    而实际并没有,因为环视不消耗匹配字符。

    转载请注明原文地址: https://ju.6miu.com/read-1122875.html

    最新回复(0)