字符串的相似性比较应用场合很多,像拼写纠错、文本去重、上下文相似性等。

评价字符串相似度最常见的办法就是:把一个字符串通过插入、删除或替换这样的编辑操作,变成另外一个字符串,所需要的最少编辑次数,这种就是编辑距离(edit distance)度量方法,也称为Levenshtein距离。海明距离是编辑距离的一种特殊情况,只计算等长情况下替换操作的编辑次数,只能应用于两个等长字符串间的距离度量。

其他常用的度量方法还有 Jaccard distance、J-W距离(Jaro–Winkler distance)、余弦相似性(cosine similarity)、欧氏距离(Euclidean distance)等。

python-Levenshtein 使用

使用 pip install python-Levenshtein 指令安装 Levenshtein

# -*- coding: utf-8 -*-

import difflib

# import jieba

import Levenshtein

str1 = "我的骨骼雪白 也长不出青稞"

str2 = "雪的日子 我只想到雪中去si"

# 1. difflib

seq = difflib.SequenceMatcher(None, str1,str2)

ratio = seq.ratio()

print 'difflib similarity1: ', ratio

# difflib 去掉列表中不需要比较的字符

seq = difflib.SequenceMatcher(lambda x: x in ' 我的雪', str1,str2)

ratio = seq.ratio()

print 'difflib similarity2: ', ratio

# 2. hamming距离,str1和str2长度必须一致,描述两个等长字串之间对应位置上不同字符的个数

# sim = Levenshtein.hamming(str1, str2)

# print 'hamming similarity: ', sim

# 3. 编辑距离,描述由一个字串转化成另一个字串最少的操作次数,在其中的操作包括 插入、删除、替换

sim = Levenshtein.distance(str1, str2)

print 'Levenshtein similarity: ', sim

# 4.计算莱文斯坦比

sim = Levenshtein.ratio(str1, str2)

print 'Levenshtein.ratio similarity: ', sim

# 5.计算jaro距离

sim = Levenshtein.jaro(str1, str2 )

print 'Levenshtein.jaro similarity: ', sim

# 6. Jaro–Winkler距离

sim = Levenshtein.jaro_winkler(str1 , str2 )

print 'Levenshtein.jaro_winkler similarity: ', sim

输出:

difflib similarity1: 0.246575342466

difflib similarity2: 0.0821917808219

Levenshtein similarity: 33

Levenshtein.ratio similarity: 0.27397260274

Levenshtein.jaro similarity: 0.490208958959

Levenshtein.jaro_winkler similarity: 0.490208958959

python字符串相似度去重_Python 字符串相似性的几种度量方法相关推荐

  1. python比较两个字符串相似度_详解Python 字符串相似性的几种度量方法

    字符串的相似性比较应用场合很多,像拼写纠错.文本去重.上下文相似性等. 评价字符串相似度最常见的办法就是:把一个字符串通过插入.删除或替换这样的编辑操作,变成另外一个字符串,所需要的最少编辑次数,这种 ...

  2. 字符串相似性的几种度量方法

    一: 字符串相似性的几种度量方法 https://blog.csdn.net/shijing_0214/article/details/53100992 1.余弦相似性(cosine similari ...

  3. python字符串相似度去重_详解Python 字符串相似性的几种度量方法

    字符串的相似性比较应用场合很多,像拼写纠错.文本去重.上下文相似性等. 评价字符串相似度最常见的办法就是:把一个字符串通过插入.删除或替换这样的编辑操作,变成另外一个字符串,所需要的最少编辑次数,这种 ...

  4. Python字符串相似性的几种度量方法

    字符串的相似性比较应用场合很多,像拼写纠错.文本去重.上下文相似性等. 评价字符串相似度最常见的办法就是:把一个字符串通过插入.删除或替换这样的编辑操作,变成另外一个字符串,所需要的最少编辑次数,这种 ...

  5. python保留两位小数_python保留小数位的三种实现方法

    前言 保留小数位是我们经常会碰到的问题,尤其是刷题过程中.那么在python中保留小数位的方法也非常多,但是笔者的原则就是什么简单用什么,因此这里介绍几种比较简单实用的保留小数位的方法: 方法一:fo ...

  6. python数据可视化是什么_Python数据可视化的四种简易方法

    数据可视化是任何数据科学或机器学习项目的一个重要组成部分.人们常常会从探索数据分析(EDA)开始,来深入了解数据,并且创建可视化确实有助于让问题更清晰和更容易理解,尤其是对于那些较大的高维度数据集.在 ...

  7. python取三位小数_python保留小数位的三种实现方法

    更多python教程请到: 菜鸟教程www.piaodoo.com 人人影视www.sfkyty.com 16影视www.591319.com 星辰影院www.591319.com 前言 保留小数位是 ...

  8. python log函数怎么打_Python的log日志功能及设置方法

    python log函数怎么打_Python的log日志功能及设置方法_Elaine要当律师的博客-CSDN博客

  9. python下载文件到本地-Python下载网络文本数据到本地内存的四种实现方法示例

    本文实例讲述了Python下载网络文本数据到本地内存的四种实现方法.分享给大家供大家参考,具体如下: import urllib.request import requests from io imp ...

最新文章

  1. Ground Truth
  2. 23种设计模式C++实现
  3. excel删除重复数据保留一条_VBA利用字典删除重复行,保留唯一值
  4. mac上的更新node npm
  5. 计算机数值计算的相关文章,数值计算论文.doc
  6. python中none是什么类型_如何在Python中”测试”None类型?
  7. 基于java SSM校园兼职平台系统设计和实现
  8. Python sqlalchemy orm 多对多外键关联
  9. C++之指针探究(五):数组指针和二维数组
  10. 基于JavaEE的学生信息管理(选课)系统论文
  11. H5打包成app的在线工具
  12. CSS3相比CSS新增哪些功能
  13. 我的河海大学计算机考研经验之谈
  14. docker的使用及原理
  15. 卧龙图甄选 | 传统的底蕴,文化的内涵
  16. buntu18.04无线网卡无法识别问题
  17. 什么是预言机(oracle)
  18. 小米9008授权 授权救砖 教程
  19. 如何把股票数据导出excel?导出股票历史数据到Excel的方法
  20. 树莓派魔镜MagicMirror —— 4 系统安装与配置

热门文章

  1. HTML+CSS+JS入门
  2. 单招计算机网络技术面试稿,单招面试自我介绍(通用5篇)
  3. Xilinx TPG IP使用
  4. 红宝书背诵笔记 — 简单基础词语
  5. 学1个月爬虫就月赚6000?别被骗了,老师傅告诉你爬虫的真实情况.。
  6. 知识点12--在vuecli项目的基础上用npm方式使用element ui
  7. pythonwhile输出每一个余数_python基础--循环(while和for)
  8. 2019,他们将拥抱热搜
  9. APT攻击是什么?面对APT攻击,我们应该怎么做?
  10. SQL:基础概念 + 在线数据库