SEO培训咨询电话:0551-3221973 13966780114
初级SEO培训班课程 中级SEO培训班课程 高级SEO培训班课程 企业SEO培训班课程 速成SEO培训班课程

如何将PDF转换成TXT文档,如何提取PDF里的文字

作者:德曼SEO团队   时间:2010-1-9 17:45:51   浏览:

 


1、 重点推荐 使用汉王OCR转换

汉王OCR破解版  完美的文字识别软件——汉王 OCR 6.0 特别版 [迅雷下载]

可以先打开迅雷,然后新建一个下载任务,然后把地址输入进去,就OK了 ~!~

地址一:http://soft.cnzz.cc/ShowSoftDown.asp?UrlID=9&SoftID=914

地址二:http://soft.cnzz.cc/ShowSoftDown.asp?UrlID=16&SoftID=914


汉王OCR的介绍我就给删了,因为介绍不是主题.


使用方法:

  第一步:首先使用Adobe Reader打开待转换的PDF文件,接下来选择“文件→打印”菜单,在打开的“打印”设置窗口中将“打印机”栏中的“名称”设置为“Microsoft Office Document Image Writer”,确认后将该PDF文件输出为TIF格式的虚拟打印文件。

  编辑提示:如果你在“名称”设置的下拉列表中没有找到“Microsoft Office Document Image Writer”项,那证明你在安装Office 2003的时候没有安装该组件,如果你有Office 2003安装光盘,那你就使用Office 2003安装光盘中的“添加/删除组件”更新安装该组件。要不就到网上去下一个完整版的.

     第二步: 安装已下载过的汉王,然后打开刚才保存的TIF文件,然后点击"开始识别",识别结束之后,点击菜单栏上的"输出",选择"到指定格式文件"
,选择好存储路径,这样OK了.终于解决问题了,呵呵.

这个只适合只要文字的情况,图片是要不了,因为这是一份虚拟的黑白打印文档,另外在输出的过程中,就算是选择了其他的格式,最终出来的图片还是跟原来的图片无法比拟,所以大家就将就点吧,毕竟都是免费的,连材料都是人家的,呵呵...


在这个转换过程中,有三个软件要使用,分别是:

1  Microsoft Office Document Imaging组件
2  PDF阅读器
3  汉王OCR


--------------------------------------------

以下是网上的其他方法.大家有兴趣的可以自己试试!


1、实现工具:Office 2003中自带的Microsoft Office Document Imaging

应用情景:目前国外很多软件的支持信息都使用PDF方式进行发布,如果没有Adobe Reader,无法查看其内容,如果没有相关的编辑软件又无法编辑PDF文件。转换为DOC格式则可以实现编辑功能。尽管有些软件也可以完成PDF转换为DOC的工作,但很多都不支持中文,我们利用Office 2003中的Microsoft Office Document Imaging组件来实现这一要求最为方便。

  使用方法:

  第一步:首先使用Adobe Reader打开待转换的PDF文件,接下来选择“文件→打印”菜单,在打开的“打印”设置窗口中将“打印机”栏中的“名称”设置为“Microsoft Office Document Image Writer”,确认后将该PDF文件输出为MDI格式的虚拟打印文件。

  编辑提示:如果你在“名称”设置的下拉列表中没有找到“Microsoft Office Document Image Writer”项,那证明你在安装Office 2003的时候没有安装该组件,请使用Office 2003安装光盘中的“添加/删除组件”更新安装该组件。

  第二步:运行Microsoft Office Document Imaging,并利用它来打开刚才保存的MDI文件,选择“工具→将文本发送到Word”菜单,并在弹出的窗口中勾选“在输出时保持图片版式不变”,确认后系统提示“必须在执行此操作前重新运行OCR。这可能需要一些时间”,不管它,确认即可。

  编辑提示:目前,包括此工具在内的所有软件对PDF转DOC的识别率都不是特别完美,而且转换后会丢失原来的排版格式,所以大家在转换后还需要手工对其进行后期排版和校对工作。


2、实现工具:Solid Converter PDF

具网上说还有这个软件,不过我没有找到,也没有用.

应用情景:利用Office 2003中的Microsoft Office Document Imaging组件来实现PDF转Word文档在一定程度上的确可以实现PDF文档到Word文档的转换,但是对于很多“不规则”的PDF文档来说,利用上面的方法转换出来的Word文档中常常是乱码一片。为了恢复PDF的原貌,推荐的这种软件可以很好地实现版式的完全保留,无需调整,而且可以调整成需要的样板形式。

 

声明:以上方法均来网络,由德曼SEO团队整理,本文仅为提供学习交流的方法,不承担任何责任与纠纷,请大家使用正版软件!

 


你浏览的文章是 - 《如何将PDF转换成TXT文档,如何提取PDF里的文字》!
文章出处:http://www.seo-peixun.com/SEOziliao/339.html
版权声明:合肥德曼SEO培训中心是专业的SEO培训机构,中国SEO优化技术人才的摇篮!
【声明】以上文章或资料除注明为自创或编辑整理外,均为各方收集或网友推荐所得。其中摘录的内容以共享、研究为目的,不存在任何商业考虑。目前网站上有些文章未注明作者或出处,甚至标注错误,此类情况出现并非不尊重作者及出处网站,而是因为有些资料来源的不规范。如果有了解作者或出处的原作者或网友,请告知,本网站将立即更正注明,并向作者或出处单位道歉。被摘录的对象如有任何异议,请与本站联系,联系邮箱:dm35@vip.qq.com,本站确认后将立即撤下。谢谢您的支持与理解!
随时与我们联系任何问题或疑虑。如果我们不在线,我们承诺在你留言后24小时内做出回应!
在线QQ咨询:513816851   41784965
德曼SEO培训群:48812488   27175177
电话:0551-3221973  13909691973
传真:0551-3444757
邮箱:dm35@vip.qq.com
地址:合肥市马鞍山南路88号金地国际城2号公寓0418室