前言
社区上有个ABAPer求助,问题如下,
现在有个字符串'(240) 1007712 (10) 0001212585 (21) 10
',想取出标下划线的三个字符串,长度不固定,括号中内容也不固定,下面介绍两种方法来解决这个问题。
常规方法
DATA(text) = '(240)1007712(10)0001212585(21)10'.REPLACE ALL OCCURRENCES OF ')' IN text WITH '-'.REPLACE ALL OCCURRENCES OF '(' IN text WITH '-'.SPLIT text AT '-' INTO DATA(lv_dummy1) DATA(lv_dummy2) DATA(lv_str1) DATA(lv_dummy3) DATA(lv_str2) DATA(lv_dummy4) DATA(lv_str3).cl_demo_output=>display( |str1:{ lv_str1 } str2:{ lv_str2 } str3:{ lv_str3 }| ).结果如下
正则方法
正则基础:
表1.常用的元字符 代码 | 说明
---|---
. | 匹配除换行符以外的任意字符
\w | 匹配字母或数字或下划线或汉字
\s | 匹配任意的空白符
\d | 匹配数字
\b | 匹配单词的开始或结束
^ | 匹配字符串的开始
$ | 匹配字符串的结束
表2. 特殊字符 特殊字符 | 描述
---|---
$ | 匹配输入字符串的结尾位置。如果设置了 RegExp 对象的 Multiline 属性,则 $ 也匹配 '\n' 或 '\r'。要匹配 $ 字符本身,请使用 \$。
( ) | 标记一个子表达式的开始和结束位置。子表达式可以获取供以后使用。要匹配这些字符,请使用 \\( 和 \\)。
• | 匹配前面的子表达式零次或多次。要匹配 * 字符,请使用 \\*。
\+ | 匹配前面的子表达式一次或多次。要匹配 + 字符,请使用 \\+。
. | 匹配除换行符 \n 之外的任何单字符。要匹配 . ,请使用 \\. 。
[ | 标记一个中括号表达式的开始。要匹配 [,请使用 \\[。
? | 匹配前面的子表达式零次或一次,或指明一个非贪婪限定符。要匹配 ? 字符,请使用 \?。
\ | 将下一个字符标记为或特殊字符、或原义字符、或向后引用、或八进制转义符。例如, 'n' 匹配字符 'n'。'\n' 匹配换行符。序列 '\\\' 匹配 "\",而 '\\(' 则匹配 "("。
^ | 匹配输入字符串的开始位置,除非在方括号表达式中使用,当该符号在方括号表达式中使用时,表示不接受该方括号表达式中的字符集合。要匹配 ^ 字符本身,请使用 \^。
{ | 标记限定符表达式的开始。要匹配 {,请使用 \\{。
| | 指明两项之间的一个选择。要匹配 |,请使用 \|。
###
### 表3. 限定符
字符 | 描述
---|---
• | 匹配前面的子表达式零次或多次。例如, zo* 能匹配 **"z"** 以及 **"zoo"** 。 * 等价于 {0,} 。
\+ | 匹配前面的子表达式一次或多次。例如, zo+ 能匹配 **"zo"** 以及 " **zoo"** ,但不能匹配 **"z"** 。 \+ 等价于 {1,} 。
? | 匹配前面的子表达式零次或一次。例如, do(es)? 可以匹配 **"do"** 、 **"does"** 、 **"doxy"** 中的 **"do"** 和 **"does"** 。 ? 等价于 {0,1} 。
{n} | n 是一个非负整数。匹配确定的 **n** 次。例如, o{2} 不能匹配 **"Bob"** 中的 **o** ,但是能匹配 **"food"** 中的两个 **o** 。
{n,} | n 是一个非负整数。至少匹配n 次。例如, o{2,} 不能匹配 **"Bob"** 中的 **o** ,但能匹配 **"foooood"** 中的所有 **o** 。 o{1,} 等价于 o+ 。 o{0,} 则等价于 o* 。
{n,m} | m 和 n 均为非负整数,其中 n <= m。最少匹配 n 次且最多匹配 m 次。例如, o{1,3} 将匹配 **"fooooood"** 中的前三个 **o** 。 o{0,1} 等价于 o? 。请注意在逗号和两个数之间不能有空格。
### 分组
除了简单地判断是否匹配之外,正则表达式还有提取子串的强大功能。用()表示的就是要提取的分组Group。
有了上面的基础知识之后,可以使用正则来解决前面提到的问题,具体代码如下。
DATA(text) = '(240)1007712(10)0001212585(21)10'.DATA(regex) = '\(\w+\)(\w+)\(\w+\)(\w+)\(\w+\)(\w+)'.DATA(matcher) = cl_abap_regex=>create_pcre( pattern = regex )->create_matcher( text = text ).IF matcher->match( ). DATA(lv_str1) = matcher->get_submatch( 1 ). DATA(lv_str2) = matcher->get_submatch( 2 ). DATA(lv_str3) = matcher->get_submatch( 3 ). cl_demo_output=>display( |str1:{ lv_str1 } str2:{ lv_str2 } str3:{ lv_str3 }| ).ENDIF.正则解释:'\\(',匹配左括号'(',匹配特殊符号时,前面加上'\'
'(\w+)'匹配多个 连续的字母或数字或下划线或汉字,并添加到提取的分组中。
CL_ABAP_MATCHER ->get_submatch 用来获取第几个分组
结果同上。
另外 C L_AB AP_ MATCHER还有个比较有用的方法 find_all( ),获取所有的分组,各分组的开始位置和长度。