一、正则表达式

  正则表达式是对字符串操作的一种逻辑公式. 我们一般使用正则表达式对字符串进行匹配和过滤. 使用正则的优缺点:

  优点: 灵活, 功能性强, 逻辑性强.
  缺点: 上手难. 一旦上手, 会爱上这个东西

  1.字符组

    字符组很简单用[]括起来. 在[]中出现的内容会被匹配. 例如:[abc] 匹配a或b或c 如果字符组中的内容过多还可以使用- , 例如: [a-z] 匹配a到z之间的所有字母 [0-9]匹配所有阿拉伯数字

  2.简单元字符

    常用的元字符

.    匹配除换行符以外的任意字符
\w   匹配字母或数字或下划线
\s   匹配任意的空白符
\d   匹配数字
\n   匹配一个换行符
\t   匹配一个制表符
\b   匹配一个单词的结尾
^    匹配字符串的开始
$    匹配字符串的结尾
\W   匹配非字母或数字或下划线
\D   匹配非数字
\S   匹配非空白符
a|b  匹配字符a或字符b
()   匹配括号内的表达式,也表示一个组
[...] 匹配字符组中的字符
[^...] 匹配除了字符组中字符的所有字符

  3.量词  

  我们到目前匹配的所有内容都是单一文字符号. 那如何一次性匹配很多个字符呢,我们要用到量词

*   重复零次或更多次
+   重复一次或更多次
?   重复零次或一次
{n} 重复n次
{n,} 重复n次或更多次
{n,m} 重复n到m次

  4.贪婪匹配和惰性匹配

    在量词中的*, +,{} 都属于贪婪匹配. 就是尽可能多的匹配到结果.

str: 麻花藤昨天让英雄联盟关服了
reg: 麻花藤.* 此时匹配的是整句话

    在使用.*后面如果加了? 则是尽可能的少匹配. 表示惰性匹配

str: 麻花藤昨天让英雄联盟关服了
reg: 麻花藤.*?此时匹配的是 麻花藤str: <div>胡辣汤</div>
reg: <.*>
结果: <div>胡辣汤</div>str: <div>胡辣汤</div>
reg: <.*?>
结果: <div></div>str: <div>胡辣汤</div>
reg: <(div|/div*)?>
结果:<div></div>

.    *?x的特殊含义 找到下一个x为止.

str: abcdefgxhijklmn
reg: .*?x
结果:abcdefgx

  5.分组

    在正则中使用()进行分组. 比如. 我们要匹配一个相对复杂的身份证号. 身份证号分成两种. 老的身份证号有15位. 新的身份证号有18位. 并且新的身份证号结尾有可能是x.

给出以下正则:
^[1-9]\d{13,16}[0-9x]$
^[1-9]\d{14}(\d{2}[0-9x])?$
^([1-9]\d{16}[0-9x]|[1-9]\d{14})$

  6.转义

    在正则表达式中, 有很多有特殊意义的是元字符, 比如\n和\s等,如果要在正则中匹配正常的"\n"而不是"换行符"就需要对"\"进行转义, 变成'\\'.在python中, 无论是正则表达式, 还是待匹配的内容, 都是以字符串的形式出现的, 在字符串中\也有特殊的含义, 本身还需要转义. 所以如果匹配一次"\n", 字符串中要写成'\\n', 那么正则⾥就要写成"\\\\n",这样就太麻烦了.这个时候我们就用到了r'\n'这个概念, 此时的正则是r'\\n'就可以了.

二、re模块

  re模块是python提供的一套关于处理正则表达式的模块. 核心功能有四个:

    1.findall 查找所有. 返回list

lst = re.findall("m", "mai le fo len, mai ni mei!")
print(lst)   # ['m', 'm', 'm']

lst = re.findall(r"\d+", "5点之前. 你要给我5000万")
print(lst) # ['5', '5000']  

    2. search 会进行匹配. 但是如果匹配到了第一个结果. 就会返回这个结果. 如果匹配不上search返回的则是None

ret = re.search(r'\d', '5点之前. 你要给我5000万').group()
print(ret) # 5

    3. match 只能从字符串的开头进行匹配

ret = re.match('a', 'abc').group()
print(ret)   # a

    4. finditer 和findall差不多. 只不过这时返回的是迭代器

it = re.finditer("m", "mai le fo len, mai ni mei!")for el in it:print(el.group()) # 依然需要分组

    5.其他操作

ret = re.split('[ab]', 'qwerafjbcd') # 先按'a'分割得到'qwer'和'fjbcd',在对'qwer'和'fjbcd'分别按'b'分割
print(ret) # ['qwer', 'fj', 'cd']

ret = re.sub(r"\d+", "_sb_", "alex250taibai250wusir250ritian38") # 把字符串中的数字换成__sb__
print(ret) # alex_sb_taibai_sb_wusir_sb_ritian_sb_

ret = re.subn(r"\d+", "_sb_", "alex250taibai250wusir250ritian38") # 将数字替换成'__sb__',返回元组(替换的结果,替换了多少次)
print(ret) # ('alex_sb_taibai_sb_wusir_sb_ritian_sb_', 4)

obj = re.compile(r'\d{3}') # 将正则表达式编译成为一个 正则表达式对象, 规则要匹配的是3个数字
ret = obj.search('abc123eeee') # 正则表达式对象调用search, 参数为待匹配的字符串
print(ret.group()) # 结果: 123

爬虫重点:
obj = re.compile(r'(?P<id>\d+)(?P<name>e+)') # 从正则表达式匹配的内容每个组起名字
ret = obj.search('abc123eeee') # 搜索
print(ret.group()) # 结果: 123eeee
print(ret.group("id")) # 结果: 123 # 获取id组的内容
print(ret.group("name")) # 结果: eeee # 获取name组的内容

    6.两个坑

      注意: 在re模块中和我们在线测试工具中的结果可能是不一样的.

ret = re.findall('www.(baidu|oldboy).com', 'www.oldboy.com')
print(ret) # ['oldboy']  这是因为findall会优先把匹配结果组里内容返回,如果想要匹配结果,取消权限即可

ret = re.findall('www.(?:baidu|oldboy).com', 'www.oldboy.com')
print(ret) # ['www.oldboy.com']

    split里也有一个坑

ret=re.split("\d+","eva3egon4yuan")
print(ret) #结果 : ['eva', 'egon', 'yuan']

ret=re.split("(\d+)","eva3egon4yuan")
print(ret) #结果 : ['eva', '3', 'egon', '4', 'yuan']#在匹配部分加上()之后所切出的结果是不同的,
#没有()的没有保留所匹配的项,但是有()的却能够保留了匹配的项,
#这个在某些需要保留匹配部分的使用过程是非常重要的。

转载于:https://www.cnblogs.com/minusone/p/9974484.html

Day-22 基础模块3 正则表达式_re模块相关推荐

  1. python re模块 字符串匹配_re模块实现正则表达式之match()方法

    Python提供了re模块,用于实现正则表达式的操作.在实现时可以使用re模块提供的方法,(如search(),match(),findall()等)进行字符串处理也可以使用re模块compile() ...

  2. python:正则表达式_re模块

    Python 正则表达式 简介 1.正则表达式是一个特殊的字符序列,它能帮助你方便的检查一个字符串是否与某种模式匹配.从而达到快速检索或替换符合某个模式.规则的文本. 2.Python自1.5版本起增 ...

  3. python正则表达式模块_Python正则表达式函数模块

    今天学习了Python中有关正则表达式的知识.关于正则表达式的语法,不作过多解释,网上有许多学习的资料.这里主要介绍python中常用的正则表达式处理函数. 方法/属性 作用 match() 决定 R ...

  4. python中怎样使用re模块_PYTHON正则表达式 re模块使用说明

    首先,运行 Python 解释器,导入 re 模块并编译一个 RE: #!python Python 2.2.2 (#1, Feb 10 2003, 12:57:01) >>> im ...

  5. python3 re模块_Python3 正则表达式 re 模块的使用 - 学习笔记

    re 模块的引入 Python 自1.5版本起增加了re模块,它提供 Perl 风格的正则表达式模式. re模块使 Python 语言拥有全部的正则表达式功能. re 模块的使用 参数含义 patte ...

  6. python中的正则表达式语法_Python基础教程之正则表达式基本语法以及re模块

    什么是正则: 正则表达式是可以匹配文本片段的模式. 正则表达式'Python'可以匹配'python' 正则是个很牛逼的东西,python中当然也不会缺少. 所以今天的Python就跟大家一起讨论一下 ...

  7. 1023day5:class类属性方法、每次执行类属性+1、内建模块、时间装饰器wrapper、面向对象__slots__方法:限制类的属性等基础知识、正则表达式基础知识、多态鸭子类型

    文章目录 一.类class 1.Python类class 属性 方法 2.类的构造方法__init__() 3.每次执行一次类的属性+1 二.模块 1.内建模块 2.第三方模块 3.定义自己的模块 三 ...

  8. Python入门基础篇(五)字符串的正则表达式re模块,全面解析!!!

    文章目录 前言 一.匹配字符串的方法 1.使用match()方法进行匹配 2.使用search()方法进行匹配 3.使用findall方法进行匹配 二.替换字符串 三.使用正则表达式分割字符串 前言 ...

  9. python re模块_python 正则表达式 (重点) re模块

    京东的注册页面,打开页面我们就看到这些要求输入个人信息的提示. 假如我们随意的在手机号码这一栏输入一个11111111111,它会提示我们格式有误. 这个功能是怎么实现的呢? 假如现在你用python ...

  10. re模块与正则表达式 1

    正则表达式 在学习re模块前我们得先理解使用它的原理,而re模块就是基于正则表达式工作的,正可谓磨刀不误砍柴工. 现在就让我们先来看一些实际的应用.在线测试工具 http://tool.chinaz. ...

最新文章

  1. 2022-2028年中国塑料网格板行业市场行情动态及发展趋向分析报告
  2. 如何利用python在yi'ge_【GE查找Python面试题】面试问题:使用 TVM … - 看准网
  3. 因改变,赢未来!三星Galaxy重磅新品年后首发!
  4. JUnit5 @BeforeEach注解示例
  5. 获取本年、本月、本周时间范围_获取本周本月本季度本年开始结束时间.html
  6. 【axure手机原型】Axure实现iPhone推动切换效果
  7. python教孩子学编程_学编程要从娃娃抓起——教孩子学Python
  8. 尔雅大学计算机基础知识点,超星尔雅_大学计算机基础_章节测试答案
  9. HTML小游戏7 —— 《罗斯魔影》魔法消除游戏(附完整源码)
  10. oracle exadata X8,ORACLEEXADATA数据库云服务器X8.PDF
  11. C# Devexpress控件详细安装攻略
  12. c语言输出方框□怎么回事_C语言打印数据的二进制格式-原理解析与编程实现
  13. c语言 乘法运算符,C 乘法运算符
  14. vue3+百度地图:加载百度地图去除logo
  15. 计算机应用基础2020年最新档案,计算机应用基础 高职计算机大类专业 刁爱军项目三 人事档案管理.pptx...
  16. python读取excel(读写处理xls或xlsx)
  17. 【龙印】用龙芯1c实现3D打印机的总体思路
  18. 第三章 软件需求分析
  19. oracle 11g ins_,Oracle 11.2.0.1 INS-32025 INS-52001 解决方法
  20. Markdown标记语法Typora编辑器零基础入门新手学习使用总结教程

热门文章

  1. mysql建帐号数据库出现反斜线_[MySQL FAQ]系列 -- 账号密码包含反斜线时怎么办-阿里云开发者社区...
  2. mysql 5.7.9 winx64_Windows 7 安装配置 mysql-5.7.17-winx64 方法-Fun言
  3. sql 整改措施 注入_改进的SQL防注入(加强抑错)-ASP教程,安全加密
  4. JavaScript 页面刷新方式汇总
  5. Tomcat启动报:The Server time zone value 'XXXXX' 乱码问题解决
  6. poj3263 Tallest Cow 题解报告
  7. 【BZOJ3294】放棋子(动态规划,容斥,组合数学)
  8. Ubuntu16.04上使用Anaconda3的Python3.6的pip安装UWSGI报错解决办法
  9. Objective-C与Swift下的自定义打印函数(Debug和Release)
  10. C++中析构函数的作用,