数据分析遇到字符串处理会有两个阶段涉及到正则表达式,一个是在数据库阶段一个是Python处理阶段。作为一个小白学习正则也遇到很多弯路和难理解的点,今天就梳理梳理学习的过程。

hive里面正则表达式可以用regexp_extract()在select里进行返回指定要求的内容,也可以用regexp在where里进行指定要求的限制条件;
python里面re.findall()或者df.str.extract()(pandas功能);

正则表达式是一个特殊的字符序列,它能帮助你方便的检查一个字符串是否与某种模式匹配。学习正则需要记住两类知识点加上实际案例的联系就能很快的理解和掌握。
正则中语法规范:

括号区别:

正则表达式中存在(),[],{}
1、():匹配小括号内的字符串,可以是一个,也可以是多个,常跟“|”(或)符号搭配使用,是多选结构的。() 是为了提取匹配的字符串。表达式中有几个()就有几个相应的匹配字符串
例:

string= ‘我正在学习python3的正则表达式,现在的日期是2019-01-22’
目的 给定指定字符串进内容进行精准匹配获取python
hive select regexp_extract(string,’(python)’,1) 返回结果为:python,1代码返回正则的第几个括号中的内容
python re.findall(’(python)’,string)返回结果为:python

2、【】:匹配字符组内的字符,比如咱们常用的[0-9a-zA-Z.*?!]等,在[]内的字符都是字符,不是元字符,比如“0-9”、“a-z”这中间的“-”就是连接符号,表示范围的元字符,如果写成[-!?*(]这样的话,就是普通字符
例:

string= ‘我正在学习python3的正则表达式,现在的日期是2019-01-22’
目的 给定字符进内容匹配获取python
hive select regexp_extract(string,’[a-z]’,0) 返回结果为:python,0代码返回符合正则的内容,如果有小括号可以写1(如'([a-z]+)')
python re.findall(’[a-z]+’,string)返回结果为:python
目的 给定字符进内容匹配获取日期2019-01-22
hive select regexp_extract(string,’([0-9]+.[0-9]+.[0-9]+)’,1) 返回结果为:2019-01-22
python re.findall(’[0-9]+.[0-9]+.[0-9]+’,string)返回结果为:2019-01-22
需求增加 如果我要只需日期22这个部分
python re.findall(’[0-9]+.[0-9]+.([0-9]+)’,string)返回结果为:22,和上面的对比发现在最后一个[0-9]+外面加了一个小括号,有小括号就返回小括号里面的内容

3、{ }一般用来表示匹配的长度,比如 \s{3} 表示匹配三个空格,\s{1,3}表示匹配一到三个空格
例:

string= ‘我正在学习python3的正则表达式,现在的日期是2019-01-22’
目的 取出日期数据部分结果为2019,01,22
python re.findall(’([0-9]{2,4})’,string) 返回结果为:[2019,01,22],python3中到3是一个数字,所以指定数据个数为2-4的就为日期部分的数字

常用正则表达式

匹配名 匹配表达式 例子
转义符 \ “n”匹配字符“n”。"\n"匹配一个换行符。串行"\\"匹配"\"而"\("则匹配"("
开始位置 ^ "abc,bac"匹配b开头的bac[^b]([a-z]{3})
结束位置 $ "abce,abcd"匹配d结尾字母[a-z]+d$
表达式0次或多次 *
表达式1次或多次 +
表达式0次或1次
除\n任意字符 .
单词边界 \b “er\b”可以匹配“never”中的“er”,但不能匹配“verb”中的“er”
非单词边界 \B “er\B”能匹配“verb”中的“er”,但不能匹配“never”中的“er”
换页符 \f
空白行 \n\s*\r
首尾空白字符 ^\s* \s*$
中文字符 [\u4e00-\u9fa5]
双字节字符(包含汉子在内) [^\x00-\xff]
数字 [0-9]或\d
非数字 \D
小写字母 [a-z]
大写字母 [A-Z]
大小写字母 [a-zA-Z]
英文加数字 a-z0-9

python正则表达式入门教程括号及字符相关推荐

  1. python基础教程是什么语言-终于懂得python中文入门教程

    Python作为一门新型的编程语言(一般常用作脚本语言)很受欢迎,毕竟相对其他的编程语言(Java ,C#等)来说比较容易入手.那么,在刚开始学习Python时有哪些疑难点需要掌握呢?以下是小编为你整 ...

  2. TZC Python编程入门教程 ————题解

    本博客原文地址:Python编程入门教程(以在线评测平台为载体) - 暴力都不会的蒟蒻 - 博客园,原文体验更佳 如果你是一名浙江2020级及以后的高中生要学习Python,抑或是一位科学工作者要学习 ...

  3. python爬虫入门教程(二):开始一个简单的爬虫

    2019/10/28更新 使用Python3,而不再是Python2 转载请注明出处:https://blog.csdn.net/aaronjny/article/details/77945329 爬 ...

  4. python新手入门教程-Python简明入门教程

    本文实例讲述了Python简明入门教程.分享给大家供大家参考.具体如下: 一.基本概念 1.数 在Python中有4种类型的数――整数.长整数.浮点数和复数. (1)2是一个整数的例子. (2)长整数 ...

  5. python免费入门手册-Python 基础入门教程

    Python是一种解释型.面向对象.动态数据类型的高级程序设计语言. Python由Guido van Rossum于1989年底发明,第一个公开发行版发行于1991年. <Python 基础入 ...

  6. python快速入门教程-终于理解python快速入门教程

    跟Java语言一样,python语言也有类的概念,直接使用class关键字定义python类.在python类,定义类的方法.然后直接使用类的初始化调用自身,获取相应的属性.以下是小编为你整理的pyt ...

  7. 简明python教程-Python简明入门教程

    本文实例讲述了Python简明入门教程.分享给大家供大家参考.具体如下: 一.基本概念 1.数 在Python中有4种类型的数――整数.长整数.浮点数和复数. (1)2是一个整数的例子. (2)长整数 ...

  8. python爬虫入门教程(三):淘女郎爬虫 ( 接口解析 | 图片下载 )

    2019/10/28更新 网站已改版,代码已失效(其实早就失效了,但我懒得改...)此博文仅供做思路上的参考 代码使用python2编写,因已失效,就未改写成python3 爬虫入门系列教程: pyt ...

  9. Python基础入门教程:Day21-30/Web前端概述

    Python基础入门教程:Web前端概述 说明:本文使用的部分插图来自 Jon Duckett 先生的*HTML and CSS: Design and Build Websites*一书,这是一本非 ...

最新文章

  1. flash build 4.6 不能debug 报错 C:\WINDOWS\system32\...
  2. Android系统默认Home应用程序(Launcher)的启动过程源代码分析(3)
  3. .NET或将引入类型类和扩展
  4. 在家办公的我,砍需求砍得更狠了
  5. 【Javascript】深入理解this作用域问题以及new/let/var/const对this作用域的影响
  6. Linux(RedHat)下Weblogic 12C静默安装
  7. php数组重置,php 重置数组索引,兼容多维数组
  8. Silverlight实用窍门系列:74.Silverlight使用Perst数据库Demo
  9. hibernate(五)之继承关系
  10. 使用监控宝监控php-fpm状态
  11. css hot loader,怎么针对依赖包的css 单独写一条loader的规则,不开启 css modules
  12. 临床基因组分析相关数据库汇总
  13. 计算机导论学后感5000字,大学计算机导论论文3000字.docx
  14. 小白学编程必备的三大网站
  15. 全民农场服务器维护上不去,全民农场签到页面空白解决方法
  16. 运动式耳机品牌排行榜,运动耳机排名前六
  17. 感知人工智能操作系统
  18. 电子计算机上面的mrc是什么意思,计算器中的M-键是什么功能?
  19. 幸运大转盘(每天一个python小项目)
  20. 字节跳动抖音ios客户端开发实习生一面面经

热门文章

  1. Android iOS Mac QQ邮箱 日历同步
  2. KPI、KPA、OKR
  3. 杭电信工计算机专业浙江省排名第几,2017杭州电子科技大学专业排名_杭州电子科技大学专业排行榜(2)...
  4. 芜湖小学计算机能力测试20111年 c语言,2011年计算机二级考试C语言十套上机题(1)...
  5. Parameters: { “silent“ } might not be used. This may not be accurate due to some parameters are
  6. STM32的IO口有幺蛾子(bug)
  7. 成人注意缺陷多动障碍在内外源冲突时的表现
  8. Premiere快速创建代理——视频压缩软件速度对比
  9. centos配置启动项_查看centos开机启动项命令 - 老牛博客
  10. JAVA的Stream