hive regexp_extract

来源：互联网发布：linux安装最新wine 编辑：程序博客网时间：2024/05/16 01:35

函数描述:

regexp_extract(str, regexp[, idx]) - extracts a group that matches regexp

字符串正则表达式解析函数。

-- 这个函数有点类似于 substring(str from 'regexp') ..

参数解释:

其中：

str是被解析的字符串

regexp 是正则表达式

idx是返回结果取表达式的哪一部分默认值为1。

0表示把整个正则表达式对应的结果全部返回

1表示返回正则表达式中第一个() 对应的结果以此类推

注意点：

要注意的是idx的数字不能大于表达式中()的个数。

否则报错：

实例：

如：

select regexp_extract('x=a3&x=18abc&x=2&y=3&x=4','x=([0-9]+)([a-z]+)',0) from default.dual;

得到的结果为:

x=18abc

select regexp_extract('x=a3&x=18abc&x=2&y=3&x=4','x=([0-9]+)([a-z]+)',1) from default.dual;

得到的结果为:

select regexp_extract('x=a3&x=18abc&x=2&y=3&x=4','x=([0-9]+)([a-z]+)',2) from default.dual;

得到的结果为:

abc

我们当前的语句只有2个()表达式所以当idx>=3的时候就会报错

FAILED: SemanticException [Error 10014]: Line 1:7 Wrong arguments '2': org.apache.Hadoop.hive.ql.metadata.HiveException: Unable to execute method public Java.lang.String org.apache.hadoop.hive.ql.udf.UDFRegExpExtract.evaluate(java.lang.String,java.lang.String,java.lang.Integer) on object org.apache.hadoop.hive.ql.udf.UDFRegExpExtract@2cf5e0f0 of class org.apache.hadoop.hive.ql.udf.UDFRegExpExtract with arguments {x=a3&x=18abc&x=2&y=3&x=4:java.lang.String, x=([0-9]+)[a-z]:java.lang.String, 2:java.lang.Integer} of size 3

0 0