关注微信公众号【七步编程】,专注Python、AI、大数据,原创文章第一时间推送!

近期Github开源了一款基于Python开发、名为Textshot的截图工具,刚开源不到半个月已经500+Star。

这两天抽空看了一下Textshot的源码,的确是一个值得介绍的项目。

相对于大多数OCR工具复杂工程、差强人意的效果,Textshot具有明显的优势,

  • 项目简单
  • 技术点丰富

项目简单

Textshot整个项目只有1个Python文件、139行代码,没有复杂的第三方库应用,也不涉及过多后端算法的调用。

技术点丰富

Textshot这个项目虽然只有短短的139行代码,但是,却涉及Python中多个方面的知识应用,

  • UI开发
  • 截图工具开发
  • 后端引擎调用

通过这短短的项目,你不仅可以了解如何利用PyQt5实现一个用户界面,还可以学会如何使用pyscreenshot开发一款自己的截图工具。此外,还能够学会后端tesseract的调用。

换句话说,这短短的139行代码囊括了前端至后端的整个流程,而且涉及到截图和OCR两款工具的衔接。因此,Textshot虽然工程不大,却是一个非常完备、值得学习的项目。

本文就来剖析这个项目的源代码,教你一步一步实现自用且永久免费的截图&OCR工具!

tesseract

目前OCR工具数不胜数,但是大多数都是在相同的后端算法上面进行了不同的封装而已。而真正在OCR核心做的较好、值得大书特书的,那么一定非tesseract莫属。

tesseract早在1985就已经开始由HP实验室开始研发,而在1995年更是被评为最为准确的3款OCR工具之一。此后,tesseract被开源,经过Google对其不断的进行优化和升级,它目前已经成为OCR方面一款标杆性的工具。很多开源或者付费的OCR工具,都是直接调用tesseract或者对其进行稍许优化。

而今天介绍的Textshot就是直接调用tesseract后端引擎进行OCR识别。因此,Textshot只是实现了一款截图工具,起到前后端的串联作用,在OCR识别算法方面并没有做任何工作。

tesseract安装

由于Textshot的OCR识别需要调用tesseract后端引擎,所以,首先需要安装tesseract。

Windows版安装可以直接访问下载链接[1].

Mac下可以使用Homebrew进行安装,

brew install tesseract

Textshot

Textshot是一款截图识别文字的OCR工具,因此,它主要涉及2个环境,

  • 截图
  • OCR识别

Textshot首先通过截图获取需要进行文字识别的图像,然后对这副图像进行OCR文字识别,输出识别结果。

前面已经介绍了,Textshot的OCR识别阶段调用的是tesseract,所以只需要1行代码即可完成。

因此,Textshot的工作主要是围绕前端窗口和截图工具的实现方面。

截图工具

截图工具是我们经常会用到的一种工具,如何实现一款截图工具?

很多人会把它想的非常复杂,其实,Python中有很多可以实现截图的库或者函数,例如,pyscreenshot或者pillow中的ImageGrab函数,它的调用方式如下,

shot = ImageGrab.grab(bbox=(x1, y1, x2, y2))

也就是说,我们只需要把鼠标框选的起点和终点坐标传给grab方法就可以实现截图功能。

那么,现在问题就转化为如何获取鼠标框选的起点和终点?

Textshot通过调用PyQt5并继承QWidget来实现鼠标框选过程中的一些方法来获取框选的起点和终点。

Textshot继承和重写QWidget方法主要包括如下几个,

  • keyPressEvent(self, event):键盘响应函数
  • paintEvent(self, event):UI绘制函数
  • mousePressEvent(self, event):鼠标点击事件
  • mouseMoveEvent(self, event):鼠标移动事件
  • mouseReleaseEvent(self, event):鼠标释放事件

可以看出,上面重写的方法以及囊括了截图过程中涉及的各个动作,

  • 点击鼠标
  • 拖动、绘制截图框
  • 释放鼠标
class Snipper(QtWidgets.QWidget):def __init__(self, parent=None, flags=Qt.WindowFlags()):super().__init__(parent=parent, flags=flags)self.setWindowTitle("TextShot")self.setWindowFlags(Qt.FramelessWindowHint | Qt.WindowStaysOnTopHint | Qt.Dialog)self.is_macos = sys.platform.startswith("darwin")if self.is_macos:self.setWindowState(self.windowState() | Qt.WindowMaximized)else:self.setWindowState(self.windowState() | Qt.WindowFullScreen)self.setStyleSheet("background-color: black")self.setWindowOpacity(0.5)QtWidgets.QApplication.setOverrideCursor(QtGui.QCursor(QtCore.Qt.CrossCursor))self.start, self.end = QtCore.QPoint(), QtCore.QPoint()def keyPressEvent(self, event):if event.key() == Qt.Key_Escape:QtWidgets.QApplication.quit()return super().keyPressEvent(event)def paintEvent(self, event):if self.start == self.end:return super().paintEvent(event)painter = QtGui.QPainter(self)painter.setPen(QtGui.QPen(QtGui.QColor(255, 255, 255), 3))painter.setBrush(QtGui.QColor(255, 255, 255, 100))if self.is_macos:start, end = (self.mapFromGlobal(self.start), self.mapFromGlobal(self.end))else:start, end = self.start, self.endpainter.drawRect(QtCore.QRect(start, end))return super().paintEvent(event)def mousePressEvent(self, event):self.start = self.end = QtGui.QCursor.pos()self.update()return super().mousePressEvent(event)def mouseMoveEvent(self, event):self.end = QtGui.QCursor.pos()self.update()return super().mousePressEvent(event)def mouseReleaseEvent(self, event):if self.start == self.end:return super().mouseReleaseEvent(event)x1, x2 = sorted((self.start.x(), self.end.x()))y1, y2 = sorted((self.start.y(), self.end.y()))

然后启动截图界面,

QtCore.QCoreApplication.setAttribute(Qt.AA_DisableHighDpiScaling)
app = QtWidgets.QApplication(sys.argv)
window = QtWidgets.QMainWindow()
snipper = Snipper(window)
snipper.show()

用户拖动、框选窗口,会获取窗口的起点和终点的坐标,这时候可以调用下面语句进行截图,获取需要OCR识别的文本图像,

shot = ImageGrab.grab(bbox=(x1, y1, x2, y2))

OCR文字识别

通过ImageGrab.grab截取到文本图像shot,下一步就是要把图像内容输入给后端的tesseract引擎,让它把图像转化为字符串

result = pytesseract.image_to_string(img, timeout=2, lang=(sys.argv[1] if len(sys.argv) > 1 else None))

到这里,就实现了一款准确度高、永久免费的OCR工具。

回顾一下Textshot的项目,我们会发现截图坐标范围内的图像、OCR识别只需要2行代码,大多数都是在围绕获取窗口起点和终点坐标在开发。换句话说,Textshot这个项目对OCR核心部分并没有做任何更改,只是在产品包装方面做了一些巧妙的工作。

我们其实也可以发现思维,产生更多与众不同的产品思路,例如,

  • 通过Python的第三方PDF处理库实现一款PDF文本识别工具
  • tesseract结合web框架实现一个网页端OCR工具
  • 结合tesseract和Google、有道翻译API实现一款OCR+翻译工具

推荐阅读

  • 干货 | 2019年共享免费资源整理(上):学习资源篇
  • 干货 | 2019年共享免费资源整理(下):实用工具篇
  • 10款VS Code插件神器,第7款超级实用!

免费专属 | 100行Python代码实现一款高精度OCR工具相关推荐

  1. python必背100代码-100行Python代码实现一款高精度免费OCR工具

    近期Github开源了一款基于Python开发.名为 Textshot 的截图工具,刚开源不到半个月已经500+Star. 很多人学习python,不知道从何学起. 很多人学习python,掌握了基本 ...

  2. 100行Python代码实现一款高精度免费OCR工具

    近期Github开源了一款基于Python开发.名为 Textshot 的截图工具,刚开源不到半个月已经500+Star. 很多人学习python,不知道从何学起. 很多人学习python,掌握了基本 ...

  3. python必背100源代码-100行Python代码实现一款高精度免费OCR工具

    近期Github开源了一款基于Python开发.名为Textshot的截图工具,刚开源不到半个月已经500+Star. 这两天抽空看了一下Textshot的源码,的确是一个值得介绍的项目. 相对于大多 ...

  4. python必背100源代码下载-100行Python代码实现一款高精度免费OCR工具

    近期Github开源了一款基于Python开发.名为Textshot的截图工具,刚开源不到半个月已经500+Star. 这两天抽空看了一下Textshot的源码,的确是一个值得介绍的项目. 相对于大多 ...

  5. python免费ocr软件_Textshot:100行Python代码实现一款高精度免费OCR工具

    近期Github开源了一款基于Python开发,名为Textshot的截图工具,刚开源不不久已经800+Star. 相对于大多数OCR工具复杂工程.差强人意的效果,Textshot具有明显的优势:项目 ...

  6. html搜索框代码_解放双手 | 10行Python代码实现一款网页自动化工具

    各种各样的网站在我们日常工作和学习中占据着举足轻重的地位,学习.影音娱乐.查询资料.协同办公,越来越多的任务都被迁移到浏览器. 因此,网页也蕴含着很多有价值.我们能够用得到的资源.例如,数据.歌曲.影 ...

  7. 100个必会的python脚本-100行Python代码实现自动抢火车票(附源码)

    前言 又要过年了,今年你不妨自己写一段代码来抢回家的火车票,是不是很Cool.下面话不多说了,来一起看看详细的介绍吧. 先准备好: 12306网站用户名和密码 chrome浏览器及下载chromedr ...

  8. c语言微信挑一挑编程,100行python代码实现微信跳一跳辅助程序

    写在前面 分享一下今天下午用python写的"跳一跳"小游戏的辅助程序.之前是准备用树莓派操控一个"机械手指"来代替人的触摸操作,但该方案还在酝酿中,实现了再分 ...

  9. python pdf编辑开发_20行Python代码实现一款永久免费PDF编辑工具的实现

    PDF(Portable Document Format),中文名称便携文档格式是我们经常会接触到的一种文件格式,文献.文档...很多都是PDF格式.它以格式稳定的优势,使得我们在打印.分享.传输过程 ...

最新文章

  1. LeetCode Contains Duplicate II(hash)
  2. 科沃斯擦窗机器人擦不干净怎么办_家用自动擦玻璃机器人哪种好呢?玻妞和科沃斯擦窗机器人能干净吗...
  3. 一个视觉交互设计失败的案例
  4. 紧跟时代步伐,让我们拥抱MVC 3
  5. leetcode 111 --- 二叉树最小深度
  6. 卷积神经网络看见了什么
  7. 全局路径规划:图搜索算法介绍2(A star)
  8. 基于WebSocketSharp 的IM 简单实现
  9. Starling中文站开发教程
  10. java的Date.getTime()转换成C#的Datetime.ticks
  11. jQuery基础之核心函数,jQuery对象及伪数组 静态方法和实例方法的定义,各种静态方法(each,map,holdRedady,trim,isWindow,isArray,isFunction)
  12. lucene中文分词搜索的核心代码
  13. java的fprintf_fprintf不接受一个字符数组吗?
  14. 零基础可不可以学前端?我来告诉你
  15. 开源 android 播放器
  16. Java Web基础知识之安全:人生苦短,注意安全
  17. Task1.2 A.I. 发展史
  18. 圣斗士星矢-我至爱的动画片-Phoenix
  19. 关闭135/137/138/139/445端口防止勒索病毒
  20. Go语言圣经阅读-第三周

热门文章

  1. 头歌 MongoDB 文档的高级查询操作(全部关卡)
  2. matlab水汽通量,降水成因诊断分析水汽通量水汽通量散度可降水量.pptx
  3. 使用Swift模拟Window-LFU
  4. 怎么做三维设计模型轻量化
  5. kindle 4.1.1越狱换中文字体
  6. 遮天、斗破苍穹、凡人修仙传、雪中悍刀行争第四届橙瓜网络文学奖
  7. Xamarin iOS 切换开发者账号之后的签名标识和预配配置文件更新方法
  8. 月报总结|2月份Moonbeam最新进展
  9. 阀门定位器调试顺序详解
  10. Programming Rust Fast, Safe Systems Development(译) 表达式(第六章 完)