c++ 模糊搜索 正则表达式_c++中正则表达式(regex)
http://www.codeceo.com/article/cpp11-regex-code.html
regex库概览
1.basic_regex:正则表达式是一个通用的模板
typedef basic_regex regex;
typedef basic_regex wregex;
2.regex_match:将一个字符序列和正则表达式匹配
3.regex_search:寻找字符序列中的子串与正则表达式匹配的
结果,在找到地一个匹配的结果后就停止匹配查找
4.regex_replace:使用格式化的替换文本,替换正则表达式匹配到
字符序列的地方
5.reegx_iterator:迭代器,用来匹配所有的子串
6.match_results:容器类,保存正则表达式的结果
7.sub_match:容器类,保存子正则表达式匹配的字符序列
ECMASCRIPT正则表达式语法
正则表达式式的语法基本大同小异,在这里就浪费篇幅细抠了。ECMASCRIPT正则表达式的语法知识可以参考W3CSCHOOL。
构造正则表达式
构造正则表达式用到一个类:basic_regex。basic_regex是一个正则表达式的通用类模板,对char和wchar_t类型都有对应的特化:typedef basic_regex regex;
typedef basic_regex wregex//默认构造函数,将匹配任何的字符序列basic_regex();
//用一个以‘\0’结束的字符串s构造一个正则表达式
explicit basic_regex( const CharT* s,flag_type f =std::regex_constants::ECMAScript );
//同上,但是制定了用于构造的字符串s的长度为
countbasic_regex( const CharT* s, std::size_t count,flag_type f = std::regex_constants::ECMAScript );
//拷贝构造,不赘述basic_regex( const basic_regex& other );
//移动构造函数basic_regex( basic_regex&& other );
//以basic_string类型的str构造正则表达式
template
explicit basic_regex( const std::basic_string& str, flag_type f = std::regex_constants::ECMAScript );
//指定范围[first,last)内的字符串构造正则表达式
template
basic_regex( ForwardIt first, ForwardIt last, flag_type f = std::regex_constants::ECMAScript );
//使用initializer_list构造
basic_regex( std::initializer_list init, flag_type f = std::regex_constants::ECMAScript );
以上除默认构造之外的构造函数,都有一个flag_type类型的参数用于指定正则表达式的语法,ECMASCRIPT、basic、extended、awk、grep和egrep均是可选的值。除此之外还有其他几种可能的的标志,用于改变正则表达式匹配时的规则和行为:
flag_typeeffects
icase在匹配过程中忽略大小写
nosubs不保存匹配的子表达式
optimize执行速度优于构造速度
有了构造函数之后,现在我们就可以先构造出一个提取http链接的正则表达式:std::string pattern("http(s)?://([\\w-]+\\.)+[\\w-]+(/[\\w- ./?%&=]*)?");
//匹配规则很简单,如果有疑惑,可以对照语法查看std::regex r(pattern);
值得一提的是在C++中’\'这个字符需要转义,因此所有ECMASCRIPT正则表达式语法中的’\'都需要写成“\\”的形式。我测试的时候,这段regex如果没有加转义,在gcc中会给出警告提示.
regex_search()只查找到第一个匹配的子序列
根据函数的字面语义,我们可能会错误的选择regex_search()这个函数来进行匹配。其函数原型也有6个重载的版本,用法也是大同小异,函数返回值是bool值,成功返回true,失败返回false。鉴于篇幅,我们只看我们下面要使用的这个:template
bool regex_search( const std::basic_string& s,
std::match_results::const_iterator, Alloc>& m,
const std::basic_regex& e,
std::regex_constants::match_flag_type flags = std::regex_constants::match_default );
第一个参数s是std::basic_string类型的,它是我们待匹配的字符序列,参数m是一个match_results的容器用于存放匹配到的结果,参数e则是用来存放我们之前构造的正则表达式对象。flags参数值得一提,它的类型是std::regex_constants::match_flag_type,语义上匹配标志的意思。正如在构造正则表达式对象时我们可以指定选项如何处理正则表达式一样,在匹配的过程中我们依然可以指定另外的标志来控制匹配的规则。这些标志的具体含义,我从cppreference.com 引用过来,用的时候查一下就可以了:ConstantExplanation
match_not_bolThe first character in [first,last) will be treated as if it is not at the beginning of a line (i.e. ^ will not match [first,first)
match_not_eolThe last character in [first,last) will be treated as if it is not at the end of a line (i.e. $ will not match[last,last)
match_not_bow"\b" will not match [first,first)
match_not_eow"\b" will not match [last,last)
match_anyIf more than one match is possible, then any match is an acceptable result
match_not_nullDo not match empty sequences
match_continuousOnly match a sub-sequence that begins at first
match_prev_avail--first is a valid iterator position. When set, causes match_not_bol and match_not_bow to be ignored
format_defaultUse ECMAScript rules to construct strings in std::regex_replace (syntax documentation)
format_sed
format_no_copyDo not copy un-matched strings to the output in std::regex_replace
根据参数类型,于是我们构造了这样的调用:std::smatch results;
regex_search(html,results,r);
不过,标准库规定regex_search()在查找到第一个匹配的子串后,就会停止查找!在本程序中,results参数只带回了第一个满足条件的http链接。这显然并不能满足我们要提取网页中所有HTTP链接需要。
使用regex_iterator匹配所有子串
严格意义上regex_iterator是一种迭代器适配器,它用来绑定要匹配的字符序列和regex对象。regex_iterator的默认构造函数比较特殊,就直接构造了一个尾后迭代器。另外一个构造函数原型:regex_iterator(BidirIt a, BidirIt b,
//分别是待匹配字符序列的首迭代器和尾后迭代器 const regex_type& re,
//regex对象 std::regex_constants::match_flag_type m =
std::regex_constants::match_default);
//标志,同上面的regex_search()中的
和上边的regex_search()一样,regex_iterator的构造函数中也有std::regex_constants::match_flag_type类型的参数,用法一样。其实regex_iterator的内部实现就是调用了regex_search(),这个参数是用来传递给regex_search()的。用gif或许可以演示的比较形象一点,具体是这样工作的(颜色加深部分,表示可以匹配的子序列):
首先在构造regex_iterator的时候,构造函数中首先就调用一次regex_search()将迭代器it指向了第一个匹配的子序列。以后的每一次迭代的过程中(++it),都会在以后剩下的子序列中继续调用regex_search(),直到迭代器走到最后。it就一直“指向”了匹配的子序列。
知道了原理,我们写起来代码就轻松多了。结合前面的部分我们,这个程序就基本写好了:#include
#include
#include
int main()
{
std::string tmp,html;
while(getline(std::cin,tmp))
{
tmp += '\n';
html += tmp;
}
std::string pattern("http(s)?://([\\w-]+\\.)+[\\w-]+(/[\\w- ./?%&=]*)?”);
pattern = “[[:alpha:]]*” + pattern + “[[:alpha:]]*”;
std::regex r(pattern);
for (std::sregex_iterator it(html.begin(), html.end(), r), end;
//end是尾后迭代器,regex_iterator是regex_iterator的string类型的版本
it != end;
++it)
{
std::cout <str() <
}
}
下载本页的html源码保存为test.html,编译这个源码测试一下,大功告成:
[regex]g++ regex.cpp -std=c++11 -omain
[regex]main
regex和异常处理
如果我们的正则表达式存在错误,则在运行的时候标准库会抛出一个regex_error异常,他有一个名为code的成员,用于标记错误的类型,具体错误值和语义如下表所示:code含义
error_collate无效的元素校对
error_ctype无效的字符类
error_escape无效的转移字符或者无效的尾置转义
error_backref无效的向后引用
error_brack方括号不匹配
error_paren小括号不匹配
error_brace大括号不匹配
error_badbrace大括号中的范围无效
error_range无效的(不合法)字符范围
error_space内存不足
error_badrepeat重复字符之前没有正则表达式(* + ?)
error_complexity太复杂了,标准库君hold不住了
error_stack栈空间不足了
c++ 模糊搜索 正则表达式_c++中正则表达式(regex)相关推荐
- java 自定义正则表达式_java中正则表达式实例详解
Java中正则表达式运用实例(参看java中正则表达式运用详解): 测试代码 package test; /** * 在String的matches()方法,split()方法中使用正则表达式. * ...
- python中正则表达式_Python中正则表达式详解
正则表达式是用来简洁表达一组字符串的表达式,本文主要和大家分享Python 中正则表达式知识详解,希望能帮助到大家.操作符说明实例.表示任何单个字符 [ ]字符集,单个字符取值范围[abc]表示a或b ...
- c++ 模糊搜索 正则表达式_c++使用正则表达式提取关键字的方法
下面看下c++通过正则表达式提取关键字,代码如下所示: string text = "岳云鹏的对象叫铁锤"; regex pattern("(.*)的对象叫(.*)&qu ...
- php 一个简单正则表达式,PHP中正则表达式回顾(3)--编写一个简单的正则表达式工具类...
跟着视频的讲解,也亲手敲了这么一个正则表达式的类,感觉很不错,真是温故而知新,本来想把注释写的逼格高一点的,今天晚了有点累,先简单的写一下,有时间了再完善完善. class regexTool{ // ...
- 正则表达式符号特殊详解_常用正则表达式_Java中正则表达式的使用
正则表达式符号详解 限定符: 指定一个组件必须出现多少次才能满足. 1.使用 "*", "+", "?" 作为限定符: "*&qu ...
- python程序中想使用正则表达式_python中正则表达式的使用方法
本文主要关于python的正则表达式的符号与方法. findall: 找寻所有匹配,返回所有组合的列表 search: 找寻第一个匹配并返回 sub: 替换符合规律的内容,并返回替换后的内容 .:匹配 ...
- vba 正则表达式_VBA中正则表达式与数组结合的应用案例!
我的目标:让中国的大学生走出校门的那一刻就已经具备这些office技能,让职场人士能高效使用office为其服务.支持我,也为自己加油! 我们来看看下面的案例: 上图中要求把A列数据中学号和姓名拆分开 ...
- 正则表达式 String中正则匹配的方法
目录 基础 常用的一些 特殊字符 非打印字符 元字符 表达式 量词 或者 创建正则表达式 实例方法 字符串中的正则方法 字符串的 match()方法 字符串的 search() 字符串的 split( ...
- C++中三种正则表达式比较(C regex,C ++regex,boost regex)
原文地址:https://www.cnblogs.com/pmars/archive/2012/10/24/2736831.html 工作需要用到C++中的正则表达式,所以就研究了以上三种正则. 1, ...
最新文章
- 掌握好这23个Linux命令常用命令,让工作效率翻倍
- O'Reilly 1500 份问卷调研:2019 年 Serverless 落地到底香不香?
- 【数据结构与算法】之深入解析“石子游戏III”的求解思路与算法示例
- 一文搞定Swing和Qt按钮和文本框的创建
- QPainter函数setClipRect
- java 循环3次_想请教下如何用for循环猜错3次就退出游戏
- java spring druid_Spring配置Druid连接池
- http://java.sun.com/jsp/jstl/core cannot be resolved(含有jstl1.2jar包网盘)
- 《精通Android 实例开发》——第1章,第1.15节向Eclipse中导入Android程
- 学数据分析究竟要懂哪些统计学?全都给你梳理好了,拿走不谢
- ds哈希查找--链地址法_Hash冲突之开放地址法
- memcpy( )函数复制二维数组 memcmp( )函数比较二维数组
- 【论文阅读】Deep Learning for Encrypted Traffic Classification: An Overview(深度学习方法进行加密流量分类综述)
- Android app本地切换logo和名称
- 计算机开机慢怎么办,电脑开机速度慢怎么办?电脑开机慢五大处理方法介绍
- PS里面的快速选区工具
- [VLDB 2021]ICS-GNN_ Lightweight Interactive Community Search via Graph Neural Network
- Bootstrap简单网页制作
- 【案例】 生成词云玩玩?
- 常见的嵌入式操作系统有哪些
热门文章
- 在不损坏硬盘数据情况下,MBR格式转GPT格式,手动创建EFI和MSR分区,安装WIN10/WIN8.1...
- Amcharts 入门教程
- 中国移动云能力中心IaaS产品部2021年招聘
- murmur3哈希算法
- adb shell读取设置手机ocd值以及ocd介绍
- Exp1 PC平台逆向破解 20164302 王一帆
- Dice Loss,balanced cross entropy,Focal Loss
- MySQL 报OperationalError: (1130, “XX‘ is not allowed to connect to this MySQL server“)的正确解决方法
- 【OI备忘录】dalao博文收藏夹
- 关于 NVIDIA 游戏内覆盖变成英文如何让其恢复中文