近日,中国图象图形大会(CCIG 2023)(简称“大会”)在苏州圆满落幕。本届大会以“图象图形·向未来”为主题,由中国科学技术协会指导,中国图象图形学学会主办,苏州科技大学承办,特邀谭铁牛院士、赵沁平院士、吴一戎院士等百余位国内外知名学者,来自代表企业的技术专家,共话图像图形学术研究与技术创新趋势,共谋行业新发展。

(金连文主持 《文档图像智能分析与处理》 论坛)

技术论坛《文档图像智能分析与处理》是本次大会的亮点之一,由华南理工大学二级教授、中国图象图形学学会常务理事金连文担任主持,合合信息智能技术平台事业部副总经理、高级工程师丁凯博士出席该论坛,并与来自中科院自动化所、北大、中科大的学术专家,华为等知名企业的研究者们,围绕文档图像处理的前沿技术展开“头脑风暴”,寻找文档图像处理领域的未来进阶方向。

大模型技术提升文字识别效率,智能文档处理难题突破

近期,ChatGPT的爆火让“大模型”技术进入了公众的视野。随着人工智能技术的飞速发展,作为图像图形技术的重要应用场景之一,文档图像智能处理逐步应用到医疗、教育等诸多领域,为各行各业提供更加高效、智能的文档管理和数据分析解决方案,大模型技术的崛起也为文档处理带来了新的机遇。

中国科学院自动化研究所副所长刘成林认为,大模型与光学字符识别(OCR)技术的结合,能够对海量数据进行理解、处理。具体到实践层面,大模型技术还有可观的提升空间。从识别性能来说,大模型技术在场景文本、逻辑版面、文档问答等方面还有很多工作可以做;此外,大模型的可解释性、安全度十分重要,还需要研究者们进行更为深入的探讨。

刘成林就《人工智能大模型时代的文档识别与理解》研究课题进行分享

北京大学邹月娴教授认为,在与文档图像处理技术密切相关的OCR领域中,专业化大规模的预训练模型是可行的。“大模型是一个大的趋势,对于小团队来说做工具是一个非常好的方法,做工具对大家都是有好处的。”邹月娴说。

邹月娴就《视觉-语言预训练模型及迁移学习方法》研究课题进行分享

华为AI研究员廖明辉提到,企业作为文档图像处理的应用方,普遍面临一个挑战:当有众多API时,维护难度较高,急需一个垂直领域的通用的OCR大模型,能够覆盖所有的使用场景。廖明辉认为,OCR垂直领域的大模型在数据量方面,数据的数量不是最关键的,最关键的是数据的多样性。

除了引入大模型等新技术外,如何实现文档图像的智能分析与处理还面临着诸多来自现实的挑战。丁凯博士认为,文档的多样性和复杂性是文档图像处理中的难点:文档类型和格式繁多,包括报告、合同、发票、证明、证件等。不同类型的文档有不同的格式和布局,例如文档中常常包含图片、表格、图形等各种图像,难以用统一的方法处理。

丁凯就《智能文档处理技术在工业界的应用与挑战》研究课题进行分享

丁凯提到,文档图像中的弯曲、阴影、摩尔纹,字迹不清晰等问题对文档图像的识别与处理产生了影响,刘成林也表示,“过去我们只关注文字,现在文档中的图像也十分重要。但是,现有文档图像识别技术在识别精度和可靠性、可解释性、自适应性等方面还有明显不足,还有很多技术问题有待解决。”

值得关注的是,人工智能大模型的快速发展为文档分析与识别带来了一些机遇,除了解决识别层次的遗留问题,在性能提升、应用拓展上大有可为。合合信息通过ROI提取、干扰去除、形变矫正、图像恢复以及图像增强这一整体架构对文档进行智能扫描与识别分析,将文档图像的弯曲矫正、摩尔纹去除,图像质量大幅提升。

除文档图像的通用场景外,合合信息对特定垂直场景下的图像也能进行预处理,针对手写板图片中出现的反光问题,通过算法模型对反光进行“擦除”。

由于版面复杂多变、文本内容多样化等原因,文档被拍照、扫描成电子文档过程中时常出现漏字、错位,合合信息持续突破版面分析技术在版面分割、区域间的逻辑关系处理等方面的难题,通过智能文字识别、智能图像处理等核心技术,确定文档中的文字位置、字体、大小和排版方式等信息,实现版面的分析和还原。

文档篡改检测技术为视觉内容安全提供保障

目前,人工智能的合成技术导致伪造的多媒体信息在网络上泛滥成灾,文本图像显然是重灾区之一。针对资质证书、文案、聊天截图等文本图像的伪造被用于散播谣言、经济诈骗、编造虚假新闻,给个人、社会造成恶劣的负面影响。图像内容安全是AI安全的重点领域,如可对文本篡改痕迹进行精准检测,将为图像内容安全提供保障。

中科大教授谢洪涛指出,随着基于深度学习的伪造与取证技术的出现,目前文本图像的真伪鉴定问题进入了攻防博弈阶段。“文本图像的篡改生成视觉质量高、字体风格统一、背景纹理协调、篡改字迹清晰,文本图像的篡改检测可以说是‘道高一尺、魔高一丈’,适应多种篡改方法、多域空间感知、区域文理区分、时间复杂度适中。”谢洪涛表示。

(谢洪涛就《篡改文本图像的生成与检测》研究课题进行分享)

谢洪涛所在的课题组正在探索基于文本笔迹的文本图像生成,以及基于频域关系的局部纹理差异性建模,最终实现高质量的场景文本图像篡改生成、准确的场景文本图像篡改检测。相关研究可应用于文本图像的多个领域,例如文档图像、自然场景图像、票据图像等。

合合信息在文档图像内容安全领域也进行了深入的部署。据丁凯介绍,合合信息研发了基于深度学习的图像篡改检测技术及相关系统,通过学习图像被篡改后统计特征的变化,该系统智能捕捉图像在篡改过程中留下的细微痕迹,可检测出复制粘贴、拼接、擦除等多种篡改形式,让人工智能准确识别出图片篡改的不同类型,并进行针对性的处理,提升识别精度和场景通用性。据悉,合合信息图像篡改检测技术已被银行、保险、制造业等多个行业引入。

作为一家人工智能企业,合合信息依托智能文档处理技术,对复杂场景下的多版式、多语种文字内容进行精准提取,打造的合同机器人、财报机器人及行业解决方案,已在金融、政务、制造、物流等30个行业落地,服务的世界500强公司超过80家。未来,合合信息将持续为全球C端用户和多元行业B端客户提供数字化、智能化的产品及服务,促进AI技术在文档处理领域的应用落地与信息安全保障。

合合信息亮相CCIG2023:多位大咖共话智能文档未来,文档图像内容安全还面临哪些技术难题?相关推荐

  1. 开工了!三位大咖给你指路:未来 3~5 年内,哪个方向的机器学习人才最紧缺?

    十一长假结束,收心归来,重新投入工作.如何能克服假期综合症呢?如何快速收心?今天营长就携三位大咖来为你打打鸡血,指引指引未来的路.他们将从自身的工作经历和学习经历的角度,告诉你未来3到5年,你的努力应 ...

  2. 2020 OpenInfra Days China 圆满落幕,100+ 全球大咖共话开源基础设施智未来

    8 月 16-17 日,2020 OpenInfra Days China 在线上隆重召开.本次大会以"智能开源基础设施"为主题,秉持"无边界协作(Collaborati ...

  3. 2020 OpenInfra Days China :100+ 全球大咖共话开源基础设施智未来

    8 月 16-17 日,2020 OpenInfra Days China 在线上隆重召开.本次大会以"智能开源基础设施"为主题,秉持"无边界协作(Collaborati ...

  4. 圣诞节,我们集齐了十二位大咖,一起聊聊无人驾驶的愿望何时实现

    关注网易智能,聚焦AI大事件,读懂下一个大时代! 编者按:融资.烧钱.明争暗斗,2018年的无人驾驶(自动驾驶)行业好不热闹.在这个市场,既有BAT的深度布局,也有传统车厂的深谋远虑,还有诸多无人驾驶 ...

  5. 11位大咖带你玩转WebRTC开发(内附PPT资料下载)

    迎着上海舒爽的小雨,LiveVideoStack携手英特尔.阿里巴巴.爱奇艺等11位大咖讲师共同带来了WebRTC开发及实践专题,与参会嘉宾一同分享了基于WebRTC技术的英特尔协同通信开发套件的功能 ...

  6. 【2018开年知识盛会】15位大咖直播分享,全方位解析NoSQL数据库

    摘要: 2018年开年伊始,阿里云数据库团队将为大家带来一场别开生面的知识盛会,15位大咖汇聚云栖社区,带来18小时数据库干货分享! 点此查看原文 2018年开年伊始,阿里云数据库团队将为大家带来一场 ...

  7. 民生银行京东三位大咖,手把手教你构建用户画像

    说个真事儿,有次我在淘宝搜"汽车贴膜",隔段时间我无意间打开淘宝,多出了个"我的爱车"模块,点进去一看,车的品牌型号款式全部展示在你面前,我开始一度以为4S店或 ...

  8. 20余位大咖与你相约CCF CED中国工程师文化日,详细日程来袭

    2021年10月24日,CCF将举办中国工程师文化日(China Engineers' culture Day),简称CCF CED,由CCF TF.麦思博(msup)有限公司承办,也希望从这一天起, ...

  9. Showmebug Moka 3位大咖助阵半导体行业专场直播

    半导体行业人才现状及趋势如何? 如何做好招聘决策,打赢「抢人」战? 行业增速与人才缺口如何和解? 本周四晚上19:00 半导体专场直播 3位大咖助阵,探索行业最佳实践 扫码 ·立即报名↓

最新文章

  1. vue源码构建代码分析
  2. android应用植入广告SDK,获取广告收入
  3. 基于运维网V8环境安装ntop
  4. python实例编程_python 编程实例 5
  5. HDU4911 Inversion 解题报告
  6. 华为服务器怎么查看系统日志,华为日志服务器
  7. 城市大轰炸++(洛谷P1847题题解,Java语言描述)
  8. Storm sql 简单测试
  9. STM32CUBEF4 实现USB 虚拟串口
  10. linux grep的信息不全,Linux下grep显示前后几行信息方法介绍
  11. Spring源码之创建代理
  12. Ceph添加、删除osd及故障硬盘更换
  13. RHEL常用 Linux命令操作
  14. 算法设计与分析(第二版)上机实验题——Java实现
  15. 通过socks5代理下载webrtc源码错误:curl: (7) Can't complete SOCKS5 connection xx.xx.xx.xx
  16. 微型计算机原理与接口技术第三版答案
  17. 经典文章:一位营销总监的辞职信及回复
  18. SPIKE创新科技套装做探路机器人(上)
  19. IBM技术论坛:使用 Cobertura 和反射机制提高单元测试中的代码覆盖率
  20. 死神来了~~~~~~~~

热门文章

  1. 潍坊学院第四届程序设计竞赛题解
  2. 一文理清楚:熵,条件熵,KL散度(相对熵),交叉熵,联合熵,信息增益,信息增益比,GINI系数
  3. win10台式电脑 有线连接 显示Internet无连接但是能正常上网无法开启移动热点
  4. 利用自己的数据包实现点云地图的NDT定位
  5. 体验H5+plus开发移动端
  6. 重磅! 感恩回馈,程序员的专属年礼来啦!
  7. 低成本电容式触摸按钮方案
  8. 跟狼叔聊了一夜,终于搞明白了 Serverless 是什么
  9. “城市女蛙人”她是全国第一个!水下科技工作者讲述潜水员的故事
  10. Laya 微信小游戏开发技巧