0
  • 聊天消息
  • 系统消息
  • 评论与回复
登录后你可以
  • 下载海量资料
  • 学习在线课程
  • 观看技术视频
  • 写文章/发帖/加入社区
会员中心
创作中心

完善资料让更多小伙伴认识你,还能领取20积分哦,立即完善>

3天内不再提示

PaddleOCR历史表现回顾

新机器视觉 来源:CSDN 作者:CSDN 2021-04-15 14:55 次阅读
加入交流群
微信小助手二维码

扫码添加小助手

加入工程师交流群

一、导读

OCR方向的工程师,一定需要知道这个OCR开源项目:PaddleOCR

短短半年时间,累计Star数量已超过11.5K,

频频登上Github Trending和Paperswithcode 日榜月榜第一,

在《Github 2020数字洞察报告》中被评为中国Github Top20活跃项目。

称它为 OCR方向目前最火的repo绝对不为过。

最近,它又带来两项全新发布:

AAAI 2021 顶会论文开源:PGNet: Real-time Arbitrarily-Shaped Text Spotting with Point Gathering Network 提出了一种简单且有效的任意方向端到端文本识别模型,在精度可比的基础上,与之前大火的ABCNet相比,预测速度快了三倍,达到SOTA效果。

多语言支持种类提升至80+种:基本覆盖国际主流语言种类,在开源测试集MLT2017评估,中文、韩文、日文、拉丁语系、阿拉伯语系,识别效果均显著优于EasyOCR,开源SOTA效果。

二、PaddleOCR历史表现回顾

先看下PaddleOCR自去年6月开源以来,短短几个月在GitHub上的表现:

2020年6月,8.6M超轻量模型发布,GitHub Trending 全球趋势榜日榜第一。

2020年8月,开源CVPR2020顶会算法,再上GitHub趋势榜单!

2020年10月,发布PP-OCR算法,开源3.5M超超轻量模型,再下Paperswithcode 趋势榜第一

2021年1月,发布Style-Text文本合成算法,PPOCRLabel数据标注工具,star数量突破10000+,截至目前已经达到11.5k,在《Github 2020数字洞察报告》中被评为中国Github Top20活跃项目。

e7b9998a-9cdd-11eb-8b86-12bb97331649.gif


这个含金量,广大的GitHub开发者们自然懂

超轻量模型的效果:火车票、表格、金属铭牌、翻转图片、外语都是妥妥的,

e7c6ba70-9cdd-11eb-8b86-12bb97331649.gif

动静统一的开发体验

动态图和静态图是深度学习框架常用的两种模式。在动态图模式下,代码编写运行方式符合Python程序员的习惯,易于调试,但在性能方面, Python执行开销较大,与C++有一定差距。

相比动态图,静态图在部署方面更具有性能的优势。静态图程序在编译执行时,预先搭建好的神经网络可以脱离Python依赖,在C++端被重新解析执行,而且拥有整体网络结构也能进行一些网络结构的优化。

飞桨动态图中新增了动态图转静态图的功能,支持用户使用动态图编写组网代码。预测部署时,飞桨会对用户代码进行分析,自动转换为静态图网络结构,兼顾了动态图易用性和静态图部署性能两方面优势。

文本合成工具Style-Text效果:相比于传统的数据合成算法,Style-Text可以实现特殊背景下的图片风格迁移,只需要少许目标场景图像,就可以合成大量数据,效果展示如下:

e83d58e2-9cdd-11eb-8b86-12bb97331649.png

半自动标注工具PPOCRLabel:通过内置高质量的PPOCR中英文超轻量预训练模型,可以实现OCR数据的高效标注。CPU机器运行也是完全没问题的。效果演示如下:

e85051ea-9cdd-11eb-8b86-12bb97331649.gif

用法也是非常的简单,标注效率提升60%-80%是妥妥的。

传送门:

Github:https://github.com/PaddlePaddle/PaddleOCR

那么最近的2021年4月份更新,又给大家带来哪些惊喜呢?

三、AAAI 2021 顶会论文:端到端SOTA算法PGNet开源:

直接先看指标评测表现:PGNet算法在ICDAR2015数据集上的检测及端到端性能表现,在精度接近的条件下,速度上与之前大火的ABCNet相比翻了三倍,达到了SOTA的效果。

e92bad3a-9cdd-11eb-8b86-12bb97331649.png

图1:PGNet模型的速度与精度性能对比

详细数据指标:

e936e65a-9cdd-11eb-8b86-12bb97331649.png

表1:ICDAR2015数据集上的检测及端到端性能

PGNet提出的方法框架如下图所示,输入的图象经过Backbone网络得到1/4下采样特征图,通过多任务学习,同时回归四个任务的内容,包括文本边缘偏移量预测(TBO),文本中心线预测(TCL),文本方向偏移量预测(TDO)以及文本字符分类图预测(TCC)。其中文本行的检测结果由TBO以及TCL经过后处理得到,文本行的识别结果由TCL,TDO以及TCC的输出得到。

e94c2998-9cdd-11eb-8b86-12bb97331649.png

图2 网络流程框架

在ICDAR2015以及Total-Text数据集上可以看一下模型效果:

e9572848-9cdd-11eb-8b86-12bb97331649.png

图3Total-Text及ICDAR2015数据集可视化效果图

PGNet论文地址:https://www.aaai.org/AAAI21Papers/AAAI-2885.WangP.pdf

【基于顶尖算法,开放拿来即用的成熟印章识别能力】同时,基于PGNet研发的印章识别能力已经在百度AI开放平台开放,可以有效检测并识别合同文件或常用票据中的印章,输出文字内容、印章位置信息以及相关置信度,已支持圆形章、椭圆形章、方形章等常见印章。提供标准化API接口,快速集成,同时支持私有化部署至本地,保障业务数据私密性。

ea1bdd82-9cdd-11eb-8b86-12bb97331649.gif

开放能力地址:https://ai.baidu.com/tech/ocr/seal

注:此处非模型直接开源,但可以申请免费试用。

四、丰富的多语言种类支持,目前已经支持全球80+ 语言模型

简单对比一下目前主流OCR方向开源repo的核心能力:

中英文模型性能及功能对比

ea4c7a82-9cdd-11eb-8b86-12bb97331649.jpg

其中,部分多语言模型性能及功能(F1-Score)对比(仅EasyOCR提供)

ea5daa0a-9cdd-11eb-8b86-12bb97331649.png

模型效果

ea671720-9cdd-11eb-8b86-12bb97331649.gif


值得一提的是,目前已经有全球开发者通过PR或者issue的方式为PaddleOCR提供多语言的字典和语料,在PaddleOCR上已经完成了全球80+ 主流语言的广泛覆盖:包括中文简体、中文繁体、英文、法文、德文、韩文、日文、意大利文、西班牙文、葡萄牙文、俄罗斯文、阿拉伯文、印地文、维吾尔文、波斯文、乌尔都文、塞尔维亚文(latin)、欧西坦文、马拉地文、尼泊尔文、塞尔维亚文、保加利亚文、乌克兰文、白俄罗斯文、泰卢固文、卡纳达文、泰米尔文,也欢迎更多开发者可以参与共建。

五、良心出品的中英文文档教程

ea9e056e-9cdd-11eb-8b86-12bb97331649.png


别的不需要多说了,大家访问GitHub点过star之后自己体验吧:https://github.com/PaddlePaddle/PaddleOCR

责任编辑:lq

声明:本文内容及配图由入驻作者撰写或者入驻合作网站授权转载。文章观点仅代表作者本人,不代表电子发烧友网立场。文章及其配图仅供工程师学习之用,如有内容侵权或者其他违规问题,请联系本站处理。 举报投诉
  • 语言模型
    +关注

    关注

    0

    文章

    575

    浏览量

    11343
  • python
    +关注

    关注

    58

    文章

    4885

    浏览量

    90307
  • 开源项目
    +关注

    关注

    0

    文章

    38

    浏览量

    7641

原文标题:Github Star 11.5K项目再发版:AAAI 2021 顶会论文开源,80+多语言模型全新升级

文章出处:【微信号:vision263com,微信公众号:新机器视觉】欢迎添加关注!文章转载请注明出处。

收藏 人收藏
加入交流群
微信小助手二维码

扫码添加小助手

加入工程师交流群

    评论

    相关推荐
    热点推荐

    百度文心衍生模型PaddleOCR登顶GitHub Star OCR全球第一

    3月30日,百度文心衍生模型PaddleOCR在GitHub上的Star数突破73.3K,超越谷歌Tesseract OCR,成为全球Star数最高的OCR项目。
    的头像 发表于 03-31 11:40 446次阅读

    沐曦曦云C500/C550 GPU产品适配PaddleOCR-VL-1.5模型

    PaddleOCR-VL 系列的全新迭代版本PaddleOCR-VL-1.5今天正式上线,沐曦曦云C500/C550 Day 0 适配PaddleOCR-VL-1.5模型,助力PaddleOC
    的头像 发表于 01-30 10:19 1319次阅读
    沐曦曦云C500/C550 GPU产品适配<b class='flag-5'>PaddleOCR</b>-VL-1.5模型

    百度正式发布并开源新一代文档解析模型PaddleOCR-VL-1.5

    1 月 29 日,百度正式发布并开源新一代文档解析模型 PaddleOCR-VL-1.5。该模型以仅 0.9B 参数的轻量架构,在全球权威文档解析评测榜单 OmniDocBench V1.5 中取得
    的头像 发表于 01-30 10:03 813次阅读
    百度正式发布并开源新一代文档解析模型<b class='flag-5'>PaddleOCR</b>-VL-1.5

    常见光纤损伤类型和表现是什么

    光纤损伤类型多样,根据损伤机制和表现形式,可分为物理性损伤、光学性能劣化、连接相关损伤及环境/化学诱导损伤四大类。以下是具体分类及典型表现: 一、物理性损伤 光纤断裂 成因:过度拉伸、弯曲半径过小
    的头像 发表于 01-23 14:26 562次阅读

    北汽集团2025年度高光时刻回顾

    1月9日,北汽集团公布2025年成绩单。过去一年,北汽集团实现整车销量175.2万辆,同比增长5.6%,自主品牌销量达107万辆,新能源及国际业务表现亮眼,增速均大幅跑赢行业,创历史新高。“三年跃升行动”开局之年,北汽集团已初步实现结构重塑与质的跨越,站上了全新的发展台阶
    的头像 发表于 01-12 16:06 442次阅读

    使用 Docker 一键部署 PaddleOCR-VL: 新手保姆级教程

    作者:飞桨开发者技术专家 刘力 | 适合人群:刚接触 PaddleOCR-VL + Docker部署的同学 | 学习目标:从一台刚装好的 Ubuntu 24.04 开始,完成 Docker 环境准备
    的头像 发表于 12-18 18:26 6794次阅读
    使用 Docker 一键部署 <b class='flag-5'>PaddleOCR</b>-VL: 新手保姆级教程

    Shell历史命令history用法

    1. 显示历史命令列表 「介绍」:history 命令用于显示当前会话中执行过的命令的列表,以及每个命令对应的编号。「示例代码」:history 2. 使用历史命令重复执行命令 「介绍」:通过
    发表于 12-02 06:10

    国芯微Pegasus芯片荣膺2025“中国芯”优秀市场表现产品奖

    杭州国芯微电子股份有限公司(以下简称“国芯微”)自主研发的“卫星广播与流媒体智能终端SoC芯片Pegasus”荣膺第二十届“中国芯”优秀市场表现产品奖!这是国芯微历史上第11次问鼎中国芯片行业最受瞩目的“中国芯”奖项,标志着公司在技术创新与市场开拓上的持续领先地位。
    的头像 发表于 11-19 09:32 1044次阅读
    国芯微Pegasus芯片荣膺2025“中国芯”优秀市场<b class='flag-5'>表现</b>产品奖

    基于全局预测历史的gshare分支预测器的实现细节

    GShare预测机制简介 GShare预测机制作为一种常用的分支预测机制,通过基于分支历史和分支地址来预测分支指令的执行路径。分支历史是指处理器在执行程序时遇到的所有分支指令的执行情况,包括它们
    发表于 10-22 06:50

    横河示波器DLM3000历史存储与统计功能

    工程师除了需要测量常规单周期开关损耗,还需要关注多周期开启损耗和关闭损耗。这需要用到示波器的历史存储与统计功能。DLM3000可以在高速波形捕获基础上对数据进行历史存储。
    的头像 发表于 09-17 17:28 859次阅读
    横河示波器DLM3000<b class='flag-5'>历史</b>存储与统计功能

    精准定位性能瓶颈:深入解析 PaddleOCR v3.2 全新 Benchmark 功能

    飞桨技术生态伙伴 算力魔方 | 摘要:在实际落地OCR和文档解析项目时,大家常常会遇到一个棘手问题:模型跑得不够快,但到底是检测太慢、识别耗时,还是模块之间的数据流转不高效?PaddleOCR
    的头像 发表于 09-05 16:02 1432次阅读
    精准定位性能瓶颈:深入解析 <b class='flag-5'>PaddleOCR</b> v3.2 全新 Benchmark 功能

    长城汽车2025年8月大事记回顾

    长城汽车2025年第二季度营收523.16亿元,同比增长7.72%,环比增长30.73%,为历史最佳第二季度营收表现;二季度净利润45.86亿元,同比增长19.42%,环比增长161.87%,为历史
    的头像 发表于 09-01 09:30 1089次阅读

    小语种OCR标注效率提升10+倍:PaddleOCR+ERNIE 4.5自动标注实战解析

    摘要 :小语种OCR研发的核心瓶颈在于高质量标注数据的稀缺与高昂成本。本文介绍一种创新的自动化标注方案,利用 PaddleOCR 进行文本检测与裁剪,并调用 ERNIE 4.5 大模型进行双重预测
    的头像 发表于 08-29 11:26 3879次阅读
    小语种OCR标注效率提升10+倍:<b class='flag-5'>PaddleOCR</b>+ERNIE 4.5自动标注实战解析

    【EASY EAI Orin Nano开发板试用体验】PP-OCRV5文字识别实例搭建与移植

    用PP-OCRV5,首先就是要安装PaddlePaddle 3.0(飞桨)和PaddleOCR 3.0(飞桨OCR大模型),这两个软件要通过Python进行安装,这里为了省事,我直接在别的ARM64开发板(野火
    发表于 08-18 16:57

    基于Nanopaint压感油墨系统的柔性传感系统在体育表现监测中的应用

    运动员和教练越来越依赖数据分析来优化表现并降低受伤风险。传统的传感器技术往往缺乏适用于动态运动的柔韧性和精确性。Nanopaint YT0901-Y-YZ03压感油墨系统解决了这些限制,为体育
    发表于 05-14 13:18