Day-22 基础模块3 正则表达式_re模块
一、正则表达式
正则表达式是对字符串操作的一种逻辑公式. 我们一般使用正则表达式对字符串进行匹配和过滤. 使用正则的优缺点:
优点: 灵活, 功能性强, 逻辑性强.
缺点: 上手难. 一旦上手, 会爱上这个东西
1.字符组
字符组很简单用[]括起来. 在[]中出现的内容会被匹配. 例如:[abc] 匹配a或b或c 如果字符组中的内容过多还可以使用- , 例如: [a-z] 匹配a到z之间的所有字母 [0-9]匹配所有阿拉伯数字
2.简单元字符
常用的元字符
. 匹配除换行符以外的任意字符 \w 匹配字母或数字或下划线 \s 匹配任意的空白符 \d 匹配数字 \n 匹配一个换行符 \t 匹配一个制表符 \b 匹配一个单词的结尾 ^ 匹配字符串的开始 $ 匹配字符串的结尾 \W 匹配非字母或数字或下划线 \D 匹配非数字 \S 匹配非空白符 a|b 匹配字符a或字符b () 匹配括号内的表达式,也表示一个组 [...] 匹配字符组中的字符 [^...] 匹配除了字符组中字符的所有字符
3.量词
我们到目前匹配的所有内容都是单一文字符号. 那如何一次性匹配很多个字符呢,我们要用到量词
* 重复零次或更多次 + 重复一次或更多次 ? 重复零次或一次 {n} 重复n次 {n,} 重复n次或更多次 {n,m} 重复n到m次
4.贪婪匹配和惰性匹配
在量词中的*, +,{} 都属于贪婪匹配. 就是尽可能多的匹配到结果.
str: 麻花藤昨天让英雄联盟关服了 reg: 麻花藤.* 此时匹配的是整句话
在使用.*后面如果加了? 则是尽可能的少匹配. 表示惰性匹配
str: 麻花藤昨天让英雄联盟关服了 reg: 麻花藤.*?此时匹配的是 麻花藤str: <div>胡辣汤</div> reg: <.*> 结果: <div>胡辣汤</div>str: <div>胡辣汤</div> reg: <.*?> 结果: <div></div>str: <div>胡辣汤</div> reg: <(div|/div*)?> 结果:<div></div>
. *?x的特殊含义 找到下一个x为止.
str: abcdefgxhijklmn reg: .*?x 结果:abcdefgx
5.分组
在正则中使用()进行分组. 比如. 我们要匹配一个相对复杂的身份证号. 身份证号分成两种. 老的身份证号有15位. 新的身份证号有18位. 并且新的身份证号结尾有可能是x.
给出以下正则: ^[1-9]\d{13,16}[0-9x]$ ^[1-9]\d{14}(\d{2}[0-9x])?$ ^([1-9]\d{16}[0-9x]|[1-9]\d{14})$
6.转义
在正则表达式中, 有很多有特殊意义的是元字符, 比如\n和\s等,如果要在正则中匹配正常的"\n"而不是"换行符"就需要对"\"进行转义, 变成'\\'.在python中, 无论是正则表达式, 还是待匹配的内容, 都是以字符串的形式出现的, 在字符串中\也有特殊的含义, 本身还需要转义. 所以如果匹配一次"\n", 字符串中要写成'\\n', 那么正则⾥就要写成"\\\\n",这样就太麻烦了.这个时候我们就用到了r'\n'这个概念, 此时的正则是r'\\n'就可以了.
二、re模块
re模块是python提供的一套关于处理正则表达式的模块. 核心功能有四个:
1.findall 查找所有. 返回list
lst = re.findall("m", "mai le fo len, mai ni mei!") print(lst) # ['m', 'm', 'm'] lst = re.findall(r"\d+", "5点之前. 你要给我5000万") print(lst) # ['5', '5000']
2. search 会进行匹配. 但是如果匹配到了第一个结果. 就会返回这个结果. 如果匹配不上search返回的则是None
ret = re.search(r'\d', '5点之前. 你要给我5000万').group() print(ret) # 5
3. match 只能从字符串的开头进行匹配
ret = re.match('a', 'abc').group() print(ret) # a
4. finditer 和findall差不多. 只不过这时返回的是迭代器
it = re.finditer("m", "mai le fo len, mai ni mei!")for el in it:print(el.group()) # 依然需要分组
5.其他操作
ret = re.split('[ab]', 'qwerafjbcd') # 先按'a'分割得到'qwer'和'fjbcd',在对'qwer'和'fjbcd'分别按'b'分割 print(ret) # ['qwer', 'fj', 'cd'] ret = re.sub(r"\d+", "_sb_", "alex250taibai250wusir250ritian38") # 把字符串中的数字换成__sb__ print(ret) # alex_sb_taibai_sb_wusir_sb_ritian_sb_ ret = re.subn(r"\d+", "_sb_", "alex250taibai250wusir250ritian38") # 将数字替换成'__sb__',返回元组(替换的结果,替换了多少次) print(ret) # ('alex_sb_taibai_sb_wusir_sb_ritian_sb_', 4) obj = re.compile(r'\d{3}') # 将正则表达式编译成为一个 正则表达式对象, 规则要匹配的是3个数字 ret = obj.search('abc123eeee') # 正则表达式对象调用search, 参数为待匹配的字符串 print(ret.group()) # 结果: 123 爬虫重点: obj = re.compile(r'(?P<id>\d+)(?P<name>e+)') # 从正则表达式匹配的内容每个组起名字 ret = obj.search('abc123eeee') # 搜索 print(ret.group()) # 结果: 123eeee print(ret.group("id")) # 结果: 123 # 获取id组的内容 print(ret.group("name")) # 结果: eeee # 获取name组的内容
6.两个坑
注意: 在re模块中和我们在线测试工具中的结果可能是不一样的.
ret = re.findall('www.(baidu|oldboy).com', 'www.oldboy.com') print(ret) # ['oldboy'] 这是因为findall会优先把匹配结果组里内容返回,如果想要匹配结果,取消权限即可 ret = re.findall('www.(?:baidu|oldboy).com', 'www.oldboy.com') print(ret) # ['www.oldboy.com']
split里也有一个坑
ret=re.split("\d+","eva3egon4yuan") print(ret) #结果 : ['eva', 'egon', 'yuan'] ret=re.split("(\d+)","eva3egon4yuan") print(ret) #结果 : ['eva', '3', 'egon', '4', 'yuan']#在匹配部分加上()之后所切出的结果是不同的, #没有()的没有保留所匹配的项,但是有()的却能够保留了匹配的项, #这个在某些需要保留匹配部分的使用过程是非常重要的。
转载于:https://www.cnblogs.com/minusone/p/9974484.html
Day-22 基础模块3 正则表达式_re模块相关推荐
- python re模块 字符串匹配_re模块实现正则表达式之match()方法
Python提供了re模块,用于实现正则表达式的操作.在实现时可以使用re模块提供的方法,(如search(),match(),findall()等)进行字符串处理也可以使用re模块compile() ...
- python:正则表达式_re模块
Python 正则表达式 简介 1.正则表达式是一个特殊的字符序列,它能帮助你方便的检查一个字符串是否与某种模式匹配.从而达到快速检索或替换符合某个模式.规则的文本. 2.Python自1.5版本起增 ...
- python正则表达式模块_Python正则表达式函数模块
今天学习了Python中有关正则表达式的知识.关于正则表达式的语法,不作过多解释,网上有许多学习的资料.这里主要介绍python中常用的正则表达式处理函数. 方法/属性 作用 match() 决定 R ...
- python中怎样使用re模块_PYTHON正则表达式 re模块使用说明
首先,运行 Python 解释器,导入 re 模块并编译一个 RE: #!python Python 2.2.2 (#1, Feb 10 2003, 12:57:01) >>> im ...
- python3 re模块_Python3 正则表达式 re 模块的使用 - 学习笔记
re 模块的引入 Python 自1.5版本起增加了re模块,它提供 Perl 风格的正则表达式模式. re模块使 Python 语言拥有全部的正则表达式功能. re 模块的使用 参数含义 patte ...
- python中的正则表达式语法_Python基础教程之正则表达式基本语法以及re模块
什么是正则: 正则表达式是可以匹配文本片段的模式. 正则表达式'Python'可以匹配'python' 正则是个很牛逼的东西,python中当然也不会缺少. 所以今天的Python就跟大家一起讨论一下 ...
- 1023day5:class类属性方法、每次执行类属性+1、内建模块、时间装饰器wrapper、面向对象__slots__方法:限制类的属性等基础知识、正则表达式基础知识、多态鸭子类型
文章目录 一.类class 1.Python类class 属性 方法 2.类的构造方法__init__() 3.每次执行一次类的属性+1 二.模块 1.内建模块 2.第三方模块 3.定义自己的模块 三 ...
- Python入门基础篇(五)字符串的正则表达式re模块,全面解析!!!
文章目录 前言 一.匹配字符串的方法 1.使用match()方法进行匹配 2.使用search()方法进行匹配 3.使用findall方法进行匹配 二.替换字符串 三.使用正则表达式分割字符串 前言 ...
- python re模块_python 正则表达式 (重点) re模块
京东的注册页面,打开页面我们就看到这些要求输入个人信息的提示. 假如我们随意的在手机号码这一栏输入一个11111111111,它会提示我们格式有误. 这个功能是怎么实现的呢? 假如现在你用python ...
- re模块与正则表达式 1
正则表达式 在学习re模块前我们得先理解使用它的原理,而re模块就是基于正则表达式工作的,正可谓磨刀不误砍柴工. 现在就让我们先来看一些实际的应用.在线测试工具 http://tool.chinaz. ...
最新文章
- 2022-2028年中国塑料网格板行业市场行情动态及发展趋向分析报告
- 如何利用python在yi'ge_【GE查找Python面试题】面试问题:使用 TVM … - 看准网
- 因改变,赢未来!三星Galaxy重磅新品年后首发!
- JUnit5 @BeforeEach注解示例
- 获取本年、本月、本周时间范围_获取本周本月本季度本年开始结束时间.html
- 【axure手机原型】Axure实现iPhone推动切换效果
- python教孩子学编程_学编程要从娃娃抓起——教孩子学Python
- 尔雅大学计算机基础知识点,超星尔雅_大学计算机基础_章节测试答案
- HTML小游戏7 —— 《罗斯魔影》魔法消除游戏(附完整源码)
- oracle exadata X8,ORACLEEXADATA数据库云服务器X8.PDF
- C# Devexpress控件详细安装攻略
- c语言输出方框□怎么回事_C语言打印数据的二进制格式-原理解析与编程实现
- c语言 乘法运算符,C 乘法运算符
- vue3+百度地图:加载百度地图去除logo
- 计算机应用基础2020年最新档案,计算机应用基础 高职计算机大类专业 刁爱军项目三 人事档案管理.pptx...
- python读取excel(读写处理xls或xlsx)
- 【龙印】用龙芯1c实现3D打印机的总体思路
- 第三章 软件需求分析
- oracle 11g ins_,Oracle 11.2.0.1 INS-32025 INS-52001 解决方法
- Markdown标记语法Typora编辑器零基础入门新手学习使用总结教程
热门文章
- mysql建帐号数据库出现反斜线_[MySQL FAQ]系列 -- 账号密码包含反斜线时怎么办-阿里云开发者社区...
- mysql 5.7.9 winx64_Windows 7 安装配置 mysql-5.7.17-winx64 方法-Fun言
- sql 整改措施 注入_改进的SQL防注入(加强抑错)-ASP教程,安全加密
- JavaScript 页面刷新方式汇总
- Tomcat启动报:The Server time zone value 'XXXXX' 乱码问题解决
- poj3263 Tallest Cow 题解报告
- 【BZOJ3294】放棋子(动态规划,容斥,组合数学)
- Ubuntu16.04上使用Anaconda3的Python3.6的pip安装UWSGI报错解决办法
- Objective-C与Swift下的自定义打印函数(Debug和Release)
- C++中析构函数的作用,