一、导读

OCR方向的工程师,一定需要知道这个OCR开源项目:PaddleOCR

短短半年时间,累计Star数量已超过11.5K,

频频登上Github Trending和Paperswithcode 日榜月榜第一,在《Github 2020数字洞察报告》中被评为中国Github Top20活跃项目。

称它为 OCR方向目前最火的repo绝对不为过。

最近,它又带来两项全新发布:

  • AAAI 2021 顶会论文开源:PGNet: Real-time Arbitrarily-Shaped Text Spotting with Point Gathering Network 提出了一种简单且有效的任意方向端到端文本识别模型,在精度可比的基础上,与先前的SOTA算法相比,经过飞桨预测引擎加速和后处理优化后,预测效率翻倍。

  • 多语言支持种类提升至80+种:基本覆盖国际主流语言种类,在开源测试集MLT2017评估,中文、韩文、日文、拉丁语系、阿拉伯语系,识别效果均显著优于EasyOCR,开源SOTA效果。

二、PaddleOCR历史表现回顾

先看下PaddleOCR自去年6月开源以来,短短几个月在GitHub上的表现:

  • 2020年6月,8.6M超轻量模型发布,GitHub Trending 全球趋势榜日榜第一。

  • 2020年8月,开源CVPR2020顶会算法,再上GitHub趋势榜单!

  • 2020年10月,发布PP-OCR算法,开源3.5M超超轻量模型,再下Paperswithcode 趋势榜第一

  • 2021年1月,发布Style-Text文本合成算法,PPOCRLabel数据标注工具,star数量突破10000+,截至目前已经达到11.5k,在《Github 2020数字洞察报告》中被评为中国Github Top20活跃项目。
    这个含金量,广大的GitHub开发者们自然懂

  • 超轻量模型的效果:火车票、表格、金属铭牌、翻转图片、外语都是妥妥的

  • 动静统一的开发体验

    动态图和静态图是深度学习框架常用的两种模式。在动态图模式下,代码编写运行方式符合Python程序员的习惯,易于调试,但在性能方面, Python执行开销较大,与C++有一定差距。

    相比动态图,静态图在部署方面更具有性能的优势。静态图程序在编译执行时,预先搭建好的神经网络可以脱离Python依赖,在C++端被重新解析执行,而且拥有整体网络结构也能进行一些网络结构的优化。

    飞桨动态图中新增了动态图转静态图的功能,支持用户使用动态图编写组网代码。预测部署时,飞桨会对用户代码进行分析,自动转换为静态图网络结构,兼顾了动态图易用性和静态图部署性能两方面优势。

  • 文本合成工具Style-Text效果:相比于传统的数据合成算法,Style-Text可以实现特殊背景下的图片风格迁移,只需要少许目标场景图像,就可以合成大量数据,效果展示如下:

  • 半自动标注工具PPOCRLabel:通过内置高质量的PPOCR中英文超轻量预训练模型,可以实现OCR数据的高效标注。CPU机器运行也是完全没问题的。效果演示如下:用法也是非常的简单,标注效率提升60%-80%是妥妥的。

    传送门:

    https://github.com/PaddlePaddle/PaddleOCR

    那么最近的2021年4月份更新,又给大家带来哪些惊喜呢?

三、AAAI 2021 顶会论文:端到端SOTA算法PGNet开源:

直接先看指标评测表现:PGNet算法在 Total-Text 数据集上的检测及端到端性能表现,在精度可比的基础上,与先前的SOTA算法相比,经过飞桨预测引擎加速和后处理优化后,预测效率翻倍。

图1:PGNet模型的速度与精度性能对比

详细数据指标:

表1:ICDAR2015数据集上的检测及端到端性能

PGNet提出的方法框架如下图所示,输入的图象经过Backbone网络得到1/4下采样特征图,通过多任务学习,同时回归四个任务的内容,包括文本边缘偏移量预测(TBO),文本中心线预测(TCL),文本方向偏移量预测(TDO)以及文本字符分类图预测(TCC)。其中文本行的检测结果由TBO以及TCL经过后处理得到,文本行的识别结果由TCL,TDO以及TCC的输出得到。

图2 网络流程框架

在ICDAR2015以及Total-Text数据集上可以看一下模型效果:

图3 Total-Text及ICDAR2015数据集可视化效果图

PGNet论文地址: https://www.aaai.org/AAAI21Papers/AAAI-2885.WangP.pdf

【基于顶尖算法,开放拿来即用的成熟印章识别能力】同时,基于PGNet研发的印章识别能力已经在百度AI开放平台开放,可以有效检测并识别合同文件或常用票据中的印章,输出文字内容、印章位置信息以及相关置信度,已支持圆形章、椭圆形章、方形章等常见印章。提供标准化API接口,快速集成,同时支持私有化部署至本地,保障业务数据私密性。开放能力地址:https://ai.baidu.com/tech/ocr/seal

注:此处非模型直接开源,但可以申请免费试用。

四、丰富的多语言种类支持,目前已经支持全球80+ 语言模型

简单对比一下目前主流OCR方向开源repo的核心能力:

中英文模型性能及功能对比

其中,部分多语言模型性能及功能(F1-Score)对比(仅EasyOCR提供)模型效果
值得一提的是,目前已经有全球开发者通过PR或者issue的方式为PaddleOCR提供多语言的字典和语料,在PaddleOCR上已经完成了全球80+ 主流语言的广泛覆盖:包括中文简体、中文繁体、英文、法文、德文、韩文、日文、意大利文、西班牙文、葡萄牙文、俄罗斯文、阿拉伯文、印地文、维吾尔文、波斯文、乌尔都文、塞尔维亚文(latin)、欧西坦文、马拉地文、尼泊尔文、塞尔维亚文、保加利亚文、乌克兰文、白俄罗斯文、泰卢固文、卡纳达文、泰米尔文,也欢迎更多开发者可以参与共建。

五、良心出品的中英文文档教程

别的不需要多说了,大家访问GitHub点过star之后自己体验吧:https://github.com/PaddlePaddle/PaddleOCR

六、相关直播预告

4月13日晚19:00-20:00,百度飞桨高级研发工程师将为我们带来PaddleOCR最新进展,快来报名吧!

扫描下方二维码,加入技术交流群

直播课精彩内容抢先看????

相关链接:

1. 官网地址:https://www.paddlepaddle.org.cn

2. PaddleOCR项目地址:

GitHub: https://github.com/PaddlePaddle/PaddleOCR

Gitee: https://gitee.com/paddlepaddle/PaddleOCR

3. PGNet论文地址: https://www.aaai.org/AAAI21Papers/AAAI-2885.WangP.pdf

4. 印章识别开发能力:https://ai.baidu.com/tech/ocr/seal

“开源框架,三连

AAAI 2021 顶会论文开源,OCR方向最火开源项目已超1万 star!相关推荐

  1. Github Star 11.5K项目再发版:AAAI 2021 顶会论文开源,80+多语言模型全新升级

    一.导读 OCR方向的工程师,一定需要知道这个OCR开源项目:PaddleOCR 短短半年时间,累计Star数量已超过11.5K, 频频登上Github Trending和Paperswithcode ...

  2. AAAI 2021 目标检测论文大盘点(YOLObile/R3Det/StarNet等)

    点击上方"CVer",选择加"星标"置顶 重磅干货,第一时间送达 前言 距离AAAI 2021 开奖放榜结束有段时间了(近期将开始线上会议),其中的论文大多是目 ...

  3. AAAI 2021线下论文预讲会讲者征集

    厌倦了线上开会?期待一场面对面的线下学术交流? 想和业界技术大咖.学界专家学者面对面交流前沿热点? 这样的机会来了! 中国中文信息学会青工委拟于12月19日在北京举行AAAI 2021线下论文预讲会( ...

  4. AAAI 2021 | 时间序列相关论文汇总

    会议介绍 AAAI的英文全称是 The Association for the Advance of Artificial Intelligence,中文意思是美国人工智能协会. 美国人工智能协会(A ...

  5. 双目立体视觉或成主流?这家厂商2021年出货量已超20万套

    不管是特斯拉"弃用"毫米波雷达,还是小鹏.蔚来等抢装激光雷达,这背后核心的原因在于传统传感器的瓶颈已经出现. 在面对复杂多变的高速.城市道路等现实场景当中,L2级以上的ADAS感知 ...

  6. 编辑器 Typora 开始收费,开源免费的 MarkText 火了:一周剧增 2k+star

    点击上方"Java精选",选择"设为星标" 别问别人为什么,多问自己凭什么! 下方有惊喜留言必回,有问必答! 每天 08:15 更新文章,每天进步一点点... ...

  7. 把ACL论文「几乎一字不落」抄到AAAI 2021上,作者回应:属借鉴

    视学算法报道 编辑:蛋酱 AI 领域学术不端又来,一篇 AAAI 2021 论文涉嫌抄袭 ACL 2020 论文,有人还贴了查重结果. 几个月以来,学术圈不端行为屡被爆出,先是港科大硕士 ICCV 论 ...

  8. 16篇论文入选AAAI 2021,京东数科AI都在关注什么?(附论文下载)

    近日,国际人工智能领域顶级学术会议AAAI2021(第35届AAAI)论文收录结果出炉.在国内AI阵营前列的京东数科以高达16篇论文的入选量成为本届AAAI的一大黑马.其研究方向包含了联邦学习.对抗学 ...

  9. 重磅!京东21篇论文入选AI顶会AAAI 2021

    点击上方"CVer",选择加"星标"置顶 重磅干货,第一时间送达 本文转载自:AI科技评论 近日,国际人工智能领域顶级学术会议AAAI 2021(第35届AAA ...

最新文章

  1. 聚焦3D地形编程第五章GeomipMapping for the CLOD
  2. 信息系统项目管理师-项目立项管理考点笔记
  3. win7蓝屏_Win7大面积蓝屏?急!解决办法在这儿~
  4. n阶自相关matlab代码,随机信号及其自相关函数和功率谱密度的MATLAB实现.doc
  5. python函数返回值_Python中函数的返回值示例浅析
  6. 一个全栈式的应用集成平台,打破“信息孤岛”
  7. android 如何动态设置margin,Android 动态设置margin
  8. 链接聚合是将一组物理接口_如何增加带宽,提升网络可靠性?
  9. jmap查询JVM堆内存
  10. 工业大数据的发展面临哪四大挑战
  11. linux 7- - watch,free,mpstat,vmstat,iostat,pidstat,df,du
  12. 【车间调度】基于matlab模拟退火算法求解车间调度(jobshop-3)问题【含Matlab源码 1082期】
  13. 程序员基础(自学)适合入门,大一
  14. Foxit Quick PDF Library License Key
  15. IT民工系列 —— 前言
  16. 谷歌地图-Google Map
  17. 关于程序员网站,这七家超级实用!(来自36氪推荐)
  18. python好用的编程工具
  19. 测试篇二:关于测试(mocha+karma)
  20. 如何快速的学习ssh框架

热门文章

  1. Behave step matcher
  2. jQuery的文档操作方法
  3. 在一个数组中查找两个重复出现的数字
  4. C语言之数组中你所不在意的重要知识
  5. SHAREPOINT爬网设置
  6. 如何用Asp判断你的网站的虚拟物理路径
  7. 如何通过 Scratch 教小朋友编程思维?
  8. 【怎样写代码】实现对象的复用 -- 享元模式(三):享元模式
  9. Matlab与线性代数--矩阵的Cholesky分解
  10. Matlab与线性代数 -- 寻找矩阵的非零元素