1 importjieba2 importjieba.analyse3

4 #第一步:分词,这里使用结巴分词全模式

5 text = '''新闻,也叫消息,是指报纸、电台、电视台、互联网经常使用的记录社会、传播信息、反映时代的一种文体,\6 具有真实性、时效性、简洁性、可读性、准确性的特点。\7 新闻概念有广义与狭义之分。\8 就其广义而言,除了发表于报刊、广播、电视上的评论与专文外的常用文本都属于新闻之列,包括消息、通讯、特写、速写(有的将速写纳入特写之列)等等。\9 狭义的新闻则专指消息,消息是用概括的叙述方式,比较简明扼要的文字,迅速及时地报道国内外新近发生的、有价值的的事实。\10 新闻也分公众新闻和小道新闻等。每则新闻在结构上,一般包括标题、导语、主体、背景和结语五部分。\11 前三者是主要部分,后二者是辅助部分。写法上主要是叙述,有时兼有议论、描写、评论等。12 '''

13 fenci_text =jieba.cut(text)14 #print("/ ".join(fenci_text))

15

16 #第二步:去停用词

17 #这里是有一个文件存放要改的文章,一个文件存放停用表,然后和停用表里的词比较,一样的就删掉,最后把结果存放在一个文件中

18 stopwords = {}.fromkeys([ line.rstrip() for line in open('stopwords.txt') ])19 final = ""

20 for word infenci_text:21 if word not instopwords:22 if (word != "。" and word != ",") :23 final = final + " " +word24 print(final)25

26 #第三步:提取关键词

27 a=jieba.analyse.extract_tags(text, topK = 5, withWeight = True, allowPOS =())28 b=jieba.analyse.extract_tags(text, topK = 6, allowPOS =())29 print(a)30 print(b)31 #text 为待提取的文本

32 #topK:返回几个 TF/IDF 权重最大的关键词,默认值为20。

33 #withWeight:是否一并返回关键词权重值,默认值为False。

34 #allowPOS:仅包括指定词性的词,默认值为空,即不进行筛选。

python文本关键词提取_python实现关键词提取相关推荐

  1. python文本特征提取实例_Python文本特征抽取与向量化算法学习

    本文为大家分享了Python文本特征抽取与向量化的具体代码,供大家参考,具体内容如下 假设我们刚看完诺兰的大片<星际穿越>,设想如何让机器来自动分析各位观众对电影的评价到底是"赞 ...

  2. python 文本相似度_python实现余弦相似度文本比较

    向量空间模型VSM: VSM的介绍: 一个文档可以由文档中的一系列关键词组成,而VSM则是用这些关键词的向量组成一篇文档,其中的每个分量代表词项在文档中的相对重要性. VSM的例子: 比如说,一个文档 ...

  3. python 文本处理模块_Python文本处理几种方法

    Python文本处理几种方法 方法一:readline函数#-*- coding: UTF-8 -*- f = open("D:\pythontest\splm_ugslmd.log&quo ...

  4. python 文本聚类可视化_Python 文本相似度和聚类

    Python 文本相似度和聚类 文本数据是非结构化的和高噪声的.在执行文本分类时,拥有标记合理的训练数据和有监督学习大有裨益.但是,文档聚类是一个无监督的学习过程,将尝试通过让机器学习各种各样的文本文 ...

  5. python nlp 句子提取_python nlp 句子提取_《用Python进行自然语言处理》第7章 从文本提取信息...

    1. 我们如何能构建一个系统,从非结构化文本中提取结构化数据? 2. 有哪些稳健的方法识别一个文本中描述的实体和关系? 3. 哪些语料库适合这项工作,我们如何使用它们来训练和评估我们的模型? 7.1 ...

  6. python读取pdf表格_Python使用Tabula提取PDF表格数据

    今天遇到一个批量读取pdf文件中表格数据的需求,样式大体是以下这样: python读取PDF无非就是三种方式(我所了解的),pdfminer.pdf2htmlEX 和 Tabula.综合考虑后,选择了 ...

  7. python tabula 使用方法_Python使用Tabula提取PDF表格数据

    今天遇到一个批量读取pdf文件中表格数据的需求,样式大体是以下这样: python读取PDF无非就是三种方式(我所了解的),pdfminer.pdf2htmlEX 和 Tabula.综合考虑后,选择了 ...

  8. python爬虫科研数据提取_python爬虫数据提取四之pyquery

    1 pyquery 简介:同样是一个强大的网页解析工具 它提供了和jQuery类似的语法来解析HTML文档,支持CSS选择器,使用非常方便 2 pyquery基本用法 2.1 安装 pip insta ...

  9. python正则匹配特殊字符_python 利用正则表达式提取特殊信息

    1.删除字符串中的 Python注释 案例: import re time = "2020-01-01 # 这是一个日期" num = re.sub(r'#.*$', " ...

最新文章

  1. 全文翻译(三) TVM An Automated End-to-End Optimizing Compiler
  2. python位运算符
  3. zoj 3327 Friend Number 模拟题
  4. [蓝桥杯][算法训练VIP]摆动序列(深搜+回溯||动态规划)
  5. 那些容易遗忘的web前端问题
  6. 前端学习(2018)vue之电商管理系统电商系统把good_cat转换为字符串
  7. oracle删除查询的数据库语句,Oracle简略的语句 查询 删除 修改(1)
  8. Chameleon Install3.0变色龙windows安装程序
  9. Servlet工作原理解析2(以Tomcat为例)
  10. 为SIT Portal切换SIT所连接的数据库
  11. java面试常考_java面试常考题
  12. name域名转出的步骤流程有哪些?
  13. 狗和猫有相同的情绪反应吗?
  14. 使用canvas画三角形,圆形,半圆,八卦
  15. 插入图片的时候,总是只是能漏出一点点其他部分都看不到,改变格式从插入型改成浮于文字上方才能完全显示,但浮于文字上方的格式最后不好排版和编辑,稍微一改,整个就乱了,求助如何让插入型的文字图片完全显示出来
  16. 微信小程序开发(六)——服务器
  17. 3ds Max随堂笔记 材质和类型贴图通道
  18. 【spark】八 自己实现 RDD中 某列 累计百分比确定阈值
  19. java基础总结笔记
  20. Java中的继承与接口

热门文章

  1. 科幻计算机类小说,五本超级火爆的科幻类小说,每一本都让你欲罢不能
  2. 从零双排java之转换流
  3. bootstrap树节点如何设置默认不展开_GraPhlAn:最美进化树或层级分类树学习笔记
  4. 全国企业信用信息 网站
  5. 软件测试学习之路-----文本编辑器和计算机基本命令笔记
  6. 设计模式之禅【原型模式】
  7. 设计模式之禅【组合模式】
  8. 7. JDK拍了拍你:字符串拼接一定记得用MessageFormat#format
  9. 展翅翱翔之时 (はばたきのとき)
  10. 香港特首到访阿里,她是来看几个年轻人的……