正则匹配 CL_ABAP_MATCHER 类使用方法

作者:ABAP三叔 约 6 分钟阅读 更新日期:2025-03-02 1 年前更新 标签:ABAP, 开发
正则匹配 CL_ABAP_MATCHER 类使用方法 - 封面图
正则匹配 CL_ABAP_MATCHER 类使用方法 - 封面图

前言

社区上有个ABAPer求助,问题如下,

现在有个字符串'(240) 1007712 (10) 0001212585 (21) 10

',想取出标下划线的三个字符串,长度不固定,括号中内容也不固定,下面介绍两种方法来解决这个问题。

常规方法

DATA(text) = '(240)1007712(10)0001212585(21)10'.REPLACE ALL OCCURRENCES OF ')' IN text WITH '-'.REPLACE ALL OCCURRENCES OF '(' IN text WITH '-'.SPLIT text AT '-' INTO DATA(lv_dummy1) DATA(lv_dummy2) DATA(lv_str1) DATA(lv_dummy3) DATA(lv_str2) DATA(lv_dummy4) DATA(lv_str3).cl_demo_output=>display( |str1:{ lv_str1 } str2:{ lv_str2 } str3:{ lv_str3 }| ).

结果如下

正则匹配 CL_ABAP_MATCHER 类使用方法 - 封面图
正则匹配 CL_ABAP_MATCHER 类使用方法 - 封面图

正则方法

正则基础:

表1.常用的元字符 代码 | 说明

---|---

. | 匹配除换行符以外的任意字符

\w | 匹配字母或数字或下划线或汉字

\s | 匹配任意的空白符

\d | 匹配数字

\b | 匹配单词的开始或结束

^ | 匹配字符串的开始

$ | 匹配字符串的结束

表2. 特殊字符 特殊字符 | 描述

---|---

$ | 匹配输入字符串的结尾位置。如果设置了 RegExp 对象的 Multiline 属性,则 $ 也匹配 '\n' 或 '\r'。要匹配 $ 字符本身,请使用 \$。

( ) | 标记一个子表达式的开始和结束位置。子表达式可以获取供以后使用。要匹配这些字符,请使用 \\( 和 \\)。

• | 匹配前面的子表达式零次或多次。要匹配 * 字符,请使用 \\*。

\+ | 匹配前面的子表达式一次或多次。要匹配 + 字符,请使用 \\+。

. | 匹配除换行符 \n 之外的任何单字符。要匹配 . ,请使用 \\. 。

[ | 标记一个中括号表达式的开始。要匹配 [,请使用 \\[。

? | 匹配前面的子表达式零次或一次,或指明一个非贪婪限定符。要匹配 ? 字符,请使用 \?。

\ | 将下一个字符标记为或特殊字符、或原义字符、或向后引用、或八进制转义符。例如, 'n' 匹配字符 'n'。'\n' 匹配换行符。序列 '\\\' 匹配 "\",而 '\\(' 则匹配 "("。

^ | 匹配输入字符串的开始位置,除非在方括号表达式中使用,当该符号在方括号表达式中使用时,表示不接受该方括号表达式中的字符集合。要匹配 ^ 字符本身,请使用 \^。

{ | 标记限定符表达式的开始。要匹配 {,请使用 \\{。

| | 指明两项之间的一个选择。要匹配 |,请使用 \|。

###

### 表3. 限定符

字符 | 描述

---|---

• | 匹配前面的子表达式零次或多次。例如, zo* 能匹配 **"z"** 以及 **"zoo"** 。 * 等价于 {0,} 。

\+ | 匹配前面的子表达式一次或多次。例如, zo+ 能匹配 **"zo"** 以及 " **zoo"** ,但不能匹配 **"z"** 。 \+ 等价于 {1,} 。

? | 匹配前面的子表达式零次或一次。例如, do(es)? 可以匹配 **"do"** 、 **"does"** 、 **"doxy"** 中的 **"do"** 和 **"does"** 。 ? 等价于 {0,1} 。

{n} | n 是一个非负整数。匹配确定的 **n** 次。例如, o{2} 不能匹配 **"Bob"** 中的 **o** ,但是能匹配 **"food"** 中的两个 **o** 。

{n,} | n 是一个非负整数。至少匹配n 次。例如, o{2,} 不能匹配 **"Bob"** 中的 **o** ,但能匹配 **"foooood"** 中的所有 **o** 。 o{1,} 等价于 o+ 。 o{0,} 则等价于 o* 。

{n,m} | m 和 n 均为非负整数,其中 n <= m。最少匹配 n 次且最多匹配 m 次。例如, o{1,3} 将匹配 **"fooooood"** 中的前三个 **o** 。 o{0,1} 等价于 o? 。请注意在逗号和两个数之间不能有空格。

### 分组

除了简单地判断是否匹配之外,正则表达式还有提取子串的强大功能。用()表示的就是要提取的分组Group。

有了上面的基础知识之后,可以使用正则来解决前面提到的问题,具体代码如下。

DATA(text) = '(240)1007712(10)0001212585(21)10'.DATA(regex) = '\(\w+\)(\w+)\(\w+\)(\w+)\(\w+\)(\w+)'.DATA(matcher) = cl_abap_regex=>create_pcre( pattern = regex )->create_matcher( text = text ).IF matcher->match( ). DATA(lv_str1) = matcher->get_submatch( 1 ). DATA(lv_str2) = matcher->get_submatch( 2 ). DATA(lv_str3) = matcher->get_submatch( 3 ). cl_demo_output=>display( |str1:{ lv_str1 } str2:{ lv_str2 } str3:{ lv_str3 }| ).ENDIF.

正则解释:'\\(',匹配左括号'(',匹配特殊符号时,前面加上'\'

'(\w+)'匹配多个 连续的字母或数字或下划线或汉字,并添加到提取的分组中。

CL_ABAP_MATCHER ->get_submatch 用来获取第几个分组

结果同上。

另外 C L_AB AP_ MATCHER还有个比较有用的方法 find_all( ),获取所有的分组,各分组的开始位置和长度。

正则匹配 CL_ABAP_MATCHER 类使用方法 - 封面图
正则匹配 CL_ABAP_MATCHER 类使用方法 - 封面图
正则匹配 CL_ABAP_MATCHER 类使用方法 - 封面图
正则匹配 CL_ABAP_MATCHER 类使用方法 - 封面图
ABAP三叔

关于作者:ABAP三叔

企业信息化与 SAP 技术顾问,长期专注 SAP ABAP、FI/CO、MM、SD 等模块的技术分享与实战经验总结。查看更多介绍

来源说明:本文内容由「正则匹配CL_ABAP_MATCHER类使用方法.md」整理生成,仅用于内部技术分享与学习交流。