• 各种格式文件ocr成word文件的方法


你还在为不同格式的文件怎么变成word文件发愁吗?各种识别软件各有缺陷,识别效率低,让你痛苦不堪,有的只能识别字,对表格和图形无能为力,识别完了,版面乱七八糟,无法使用。现在好了,本文针对各种情况下文字识别进行总结,帮助大家掌握正确方法,节省时间,本文给出了所有情况下全文件表格、图形、文字识别的完美解决方案:

1、PDF文件的识别:

1)文件可以直接识别的(以文本形式保存的PDF文件):安装acrobat 7专业版,注意不是acrobat reader(下载 http://www.xdowns.com/soft/4/136/2006/Soft_29430.html),直接另存为rtf文件(识别整个文件),或者选择工具栏上的文字选择按钮,然后选择文字区域,然后复制到word等中。

2)文件不能直接识别的(以图片形式保存的PDF文件):安装office2003(下载http://www.xdowns.com/soft/188/215/2006/Soft_28356.html ),并装上office工具Microsoft Office Document Imaging(完全安装此工具),然后在打印机里面会增加Microsoft Office Document Image Writer打印机,然后将PDF文件打印到此打印机,选择打印形成的文件的保存位置,然后会自动形成一个MDI文件,并且自动用Microsoft Office Document Image打开此文件,然后选择“工具”菜单下的“使用ocr识别文本”,识别完成后,在选择“工具”下的,“将文本发送到word”,最后将把整个PDF文件识别输出到word文件中。

注意:Microsoft Office Document Image可以非常准确的全文件识别转化中文、英文、表格,但是无法将图形输出到word,而是把文件中的所有图形单独形成一个个独立的图片文件,放在相同位置的一个相同名称的文件夹中,因此可用snagit软件将图形打开,然后复制到word中。(所有的识别软件都不能很好的处理图形的识别问题,Microsoft Office Document Image的这种处理方法已经是非常好的解决这个问题了。)

3)加密的Pdf文件:先下载解密软件(下载http://www.xdowns.com/soft/4/85/2006/Soft_29750.html ),解密后在参看1),2)
4)繁体pdf文件:用2)的方法识别到word后,用word中的“工具”--“语言”---“中文繁简转换”

2、caj文件的识别:

1)局部文字识别:直接使用caj浏览器(下载地址 http://www.xdowns.com/soft/4/136/2006/Soft_29737.html )的ocr
2)全文件识别:打印到Microsoft Office Document Image Writer打印机,后面和上面的2)操作一样
3)博硕论文全文下载:在线阅读博硕论文,待可以看到最后一页后,不要关闭caj浏览器,到caj安装目录下cache中找到一个较大的文件,拷贝到其他位置即可。然后使用2)全部转化为word。

3、超星文件的识别:

1)局部文字识别:直接使用超星浏览器(下载地址 http://www.xdowns.com/soft/31/91/2006/Soft_27810.html )的ocr
2)全文件识别:打印到Microsoft Office Document Image Writer打印机,后面和上面的2)操作一样,要注意的是,超星打印功能有点区别,因为超星是目录和全文分开的,所以打印时,需要分别把目录和正文识别到word中,在合并到一起。打印时要填入打印页码从1到最后一页,不要选择打印全部。此外在打印选项中,还要将页面比例设成真实大小,而不是整宽。注意:识别速度比其他格式要慢很多,请保持耐心,但是最后当你看到轻松的生成全本书的word版本时,你会欣喜若狂的,呵呵。我的试验结果是一本280页的书,识别需要几分钟的时间。

3)超星相对比较麻烦一些,如果还有问题,可以先把超星打印成完整的pdf文件,然后在用1、的方法转成word

4、其他情况下的识别:

使用snagit软件(下载 http://www.xdowns.com/soft/31/46/2006/Soft_29690.html )将任何形式的文字可以变成图片,例如使用snagit将屏幕拷贝成图片,然后右键点击图片文件,用microsoft Office Document Image打开图形,其他和2)一样。

注意:其他的各种识别软件请不要在用,因为要么只能识别中文,要么只能识别英文,要么不能识别整个文件,要么不能识别屏幕拷贝图像,要么识别误差很大,要么不能识别表格,要么需要注册,要么识别速度很慢,要么使用不便(和word结合不紧),这些软件包括:紫光ocr,万方pdfocr,尚书,汉王,ScanSoft PDF Converter,pdf2word,以及各种被推荐的软件等等,我都装过,现在都像LJ一样删除了。只要安装了acrobat 专业版,snagit,office2003,现在你可以完美的做任何事,最重要的是这几个软件很好得到。

针对一些问题的补充:
经过一些试验,发现microsoft Office Document Image 存在一些不稳定的问题,例如在用caj打印到Microsoft Office Document Image Writer打印机时,发现用caj5.5版本比较快,(caj5.5不能加升级补丁),而caj5.0有时出现假死机。
另外页面显示大时,转化的识别率较高。
如果页数多的文件,包括超星,如果有问题,可以分多次转化。

再次补充:
1、由于虚拟打印到Microsoft Office Document Image Writer 比较慢,并且形成的虚拟文件很大,1本200多页的书大约是60M,因此会严重影响机器的运行速度和C盘空间以及内存空间,建议配置好的机器一次转化不要超过200页,配置差的不要超过100页,同时打印时在右下角系统栏中会出现打印机图,你可以双击,看到打印任务的进度,以免以为死机了。另外转化完成后请删除c:/windows/temp目录下的虚拟打印文件,否则你的c盘很快会被用光。

2、建议如果发生打印到Microsoft Office Document Image Writer很慢或者假死的情况,可以先打印到snagit虚拟打印机,会自动生成tiff文件,速度比Microsoft Office Document Image Writer快,然后在snagit中,选择打印机为Microsoft Office Document Image Writer打印机,(相当于再打印到Microsoft Office Document Image Writer打印机),然后选择snagit---outputs下的printer,然后选择snagit----file----finish output,即可生成msi文件,其他一样。转化完成后请删除c:/windows/systems32/snagit临时文件。

各种格式文件ocr成word文件的方法相关推荐

  1. 各种格式文件转换成word文件的方法

    本文针对各种情况下文字识别进行总结,电脑技巧帮助大家掌握正确方法,节省时间,本文给出了所有情况下全文件表格.图形.文字识别的完美解决方案: 1.PDF文件的识别: 1)文件可以直接识别的(以文本形式保 ...

  2. 如何将一个PDF文件转成Word 原理和方法

    PDF转Word是否可行(原理) PDF转Word从技术上说是可行的,他的原理是首先将PDF文档中的每一个元素提取出来(有兴趣可以先了解下PDF的格式), 然后再将这些文元素一个一个重新在Word文档 ...

  3. 扫描版PDF文件转成word文件

    你可以使用 Adobe Acrobat Pro 或者 ABBYY FineReader 这样的软件将扫描版PDF文件转换为Word文件.也有一些在线工具可以实现PDF到Word的转换,例如 Small ...

  4. 怎样快速将PPT文件转换成Word

    Microsoft Office Word是一款强大的文档编辑软件,它可以帮助我们将PPT文件转换成Word文档. 利用Microsoft Office Word,将PPT文件转换成word操作过程如 ...

  5. 在线将PDF文件转换成Word新方法

    随着PDF格式文档的盛行,使用它办公的人也越来越多,PDF如何转换成Word文档,如果在Word文档中进行编辑.修改已经成为大家的需要.当你的手头上有少数PDF文档,无需借助PDFF转换工具,在线PD ...

  6. 如何将有打开密码的PDF转换成Word文件

    想要把PDF转换成word文档但是发现PDF文件有打开口令密码该怎么办? 想要将有打开口令密码的PDF文件转换成Word文件,在我认为需要两个步骤,首先将PDF的口令密码找回或者破解,然后再将PDF文 ...

  7. word转pdf图片模糊怎么办_嗨格式PDF转换器如何将PDF文件转换成Word?PDF转Word方法...

    日常办公,我们有时候需要将PDF文件格式进行转换,鉴于PDF文件的特殊性,这就需要借助专业软件,例如嗨格式PDF转换器.嗨格式PDF转换器支持PDF.Word.Excel.PPT.图片等多种文件格式互 ...

  8. 如何将caj格式文件转换成word文档

    我们在知网下载文件的时候,就有很多文件都是caj格式的,我们想用它里面的素材写一篇文章,就需要将caj文件转成word文档了,如何将caj格式文件转换成word文档呢? 下面小编教大家caj文件转换成 ...

  9. 如何使用ABBYY FineReader 12将JPEG文件转换成Word文档

    日常工作中处理JPEG格式的图像文件时,有时需要转换成Word文档进行编辑,市场上应用而生了很多转换工具,相信不少人听说过OCR(光学字符识别)软件,可以用来转换图像文件,而在OCR软件中, ABBY ...

最新文章

  1. python - 线程
  2. Ibatis学习总结1--ibatis简介和SQL Maps
  3. 浙江科技学院c语言考试试卷,浙江科技学院c语言C试卷A.doc
  4. 汇编语言:实验10 根据材料编程—1.显示字符串
  5. android peopleactivity.java,Android面试基础篇---Activity(上)
  6. length与length()
  7. Python开发语音聊天机器人
  8. python与工程造价的联系_终于知道工程造价专业面试技巧
  9. 2021Java面试题及答案整理(最新汇总版)
  10. PayPal开发前台生成订单和后台生成订单
  11. 工控行业学什么编程语言比较好_中国工控|想学PLC编程?先弄清5种PLC专用语言 !...
  12. 第一章 由内而外全面造就自己
  13. wow Warlock shushia PVP DZ
  14. 漂亮特殊字体可复制_特殊字体生成器 漂亮特殊字体可复制
  15. 编译原理——证明文法的二义性(1)
  16. L1-068 调和平均 (10分)
  17. 启动两个80线的速腾雷达
  18. CooCox工具简介——免费和开源的ARM嵌入式开发工具
  19. 游戏贪吃蛇(c语言)
  20. 永远的Beatles

热门文章

  1. C语言Windows下实现音乐播放器
  2. 360分卷压缩,zip.001等多个分卷文件合并
  3. html gif无限循环播放,【GIF】无限循环GIF太神奇,有人知道这是怎么做的吗?
  4. js/input/输入框 只能输入汉字/数字/英文
  5. JavaScript 启用全屏显示/退出全屏模式
  6. MySQL创建用户授权表权限
  7. (转)无法打开C盘,提示本次操作由于这台计算机的限制被取消,请与你的管理员联系”...
  8. 速看常用工控通讯接口协议大全
  9. 【大牛疯狂教学】2020最全的BAT大厂面试题整理改版
  10. 分布式医疗云平台(项目功能简介截图)【系统管理(科室管理、用户管理、角色管理、菜单管理 、字典管理、通知公告管理 、检查费用设置、挂号费用设置 )】】(四)-全面详解(学习总结---从入门到深化)