ExcelTip.Net留存知识帖 ---【注:附件之前被网盘供应商清空后,现已修复-现已修复-现已修复为本地下载!】
现在位置:首页 > 我的酷贴 > 非Office软件 > 如何将PDF、CAJ、超星文件转化为word格式?

如何将PDF、CAJ、超星文件转化为word格式?

作者:绿色风 分类: 时间:2022-08-18 浏览:196
楼主
herelazy
现在网上的许多资料都是以CAJ、PDF、超星等文件格式提供的,其中的文本不能被直接编辑,造成使用上的极大不便,利用微软提供的OCR识别技术从CAJ、PDF、超星等文件中提取全部文本,通过操作转化为word文件,方便使用。

1、前期准备:
     安装CAJViewer 阅读器(5.5以上版本)、Acrobat Reader 专业版阅读器(5.0以上版本) 和 Office(2003以上版本),并完全安装Office工具Microsoft Office Document Imaging,然后在打印机里面增加 Microsoft Office Document Image Writer 打印机。 Microsoft Office Document Image可以非常准确的全文件识别转化中文、英文、表格。

2、CAJ文件的识别
  (一)首先,从网上下载CAJ格式的资料文件保存到 本地硬盘 上;
  (二)然后,启动CAJViewer阅读器程序,并在该程序中打开刚才保存的CAJ格式的文件。浏览文件到最后一页后,不要关闭CAJ浏览器程序;
  (三)在CAJ浏览器程序窗口中,选择“文件”→“打印”,并选择打印机为Microsoft Office Document Image Writer打印机,勾选打印到文件选项和确定打印页数;
  (四)保存打印文件(*.prn)到适当位置。等待打印完成后,Microsoft Office Document Image 自动打开刚才保存的打印文件;
  (五)在Microsoft Office Document Image窗口中,选择“页面”菜单中的“选择所有页面”菜单项,然后选择“工具”菜单中的“使用OCR识别文本”提取文本。
  (六)选择“工具”下的“将文本发送到word”,最后将把整个CAJ文件识别输出到word文件中。

3、PDF文件的识别
  (一)以“文本”形式保存的PDF文件,用Reader专业版,识别整个文件。直接打开从网上下载的PDF格式文件另存为RTF文件,或者选择工具栏上的文字选择按钮,然后选择文字区域,复制到Word中即可。
  (二)以“图片”形式保存的PDF文件,将PDF文件打印到Microsoft Office Document Image Writer打印机,选择打印形成的文件的保存位置,然后会自动形成一个MDI文件,并且自动用Microsoft Office Document Image打开此文件,然后在Microsoft Office Document Image中选择“工具”菜单中的“使用OCR识别文本”,识别完成后,在选择“工具”下的,“将文本发送到word”,最后将把整个PDF文件识别输出到word文件中。
  (三)加密的PDF文件先下载解密软件,解密后在参照上述步骤1),2) 进行。
  (四)繁体PDF文件用上述步骤2)的方法识别到word后,用word中的“工具”→“语言”→“中文繁简转换”

4、超星文件的识别
  (一)全文件识别打印到Microsoft Office Document Image Writer打印机,然后按上述PDF文件的识别步骤中第二点操作,要注意的是,超星打印功能有点区别,因为超星是目录和全文分开的,所以打印时,需要分别把目录和正文识别到Word中,再合并到一起。打印时要填入打印页码从1到最后一页,不要选择打印全部。在打印选项中,要将页面比例设成真实大小,而不是整宽。注意识别速度比其他格式要慢很多,请保持耐心。一般一本200多页的书,识别需要几分钟的时间。
  (二)超星文件识别相对比较麻烦一些,如果还有问题,可以先把超星打印成完整的PDF文件,然后再用上述识别PDF文件的方法转成Word。

5、注意事项
    经过试验,发现Microsoft Office Document Image 存在一些不稳定的问题,如在用CAJ打印到Microsoft Office Document Image Writer时,发现用CAJ5.5版本比较快,而CAJ5.0有时出现假死机。页面显示大时,转化的识别率较高。如果页数多的文件,包括超星,可以分多次转化。
    由于虚拟打印到Microsoft Office Document Image Writer 比较慢,并且形成的虚拟文件很大,1本200多页的书大约是60M,因此会严重影响机器的运行速度、C盘和内存空间。建议配置好的机器一次转化不要超过200页,配置差的不要超过100页,同时打印时在任务栏中会出现打印机图标,可以双击,看到打印任务的进度,避免误以为死机。转化完成后请删除c:\windows\temp目录下的虚拟打印文件,否则C盘很快会被用光。

2楼
0Mouse
楼主总结得很全面,讲的也很详细,学习了!

补充:对于图片型英文PDF,采用ABBYY PDF Transformer 2.0转换效果非常好,准确率可高达98%,至少我以前转的时候是这样的!

 

我以前下载的地方现在没找到这个软件的下载信息了,不过这里应该可以下载。

免责声明

有感于原ExcelTip.Net留存知识的价值及部分知识具有的时间限定性因素, 经与ExcelTip.Net站长Apolloh商议并征得其同意, 现将原属ExcelTip.Net的知识帖采集资料于本站点进行展示, 供有需要的人士查询使用,也慰缅曾经的论坛时代。 所示各个帖子的原作者如对版权有异议, 可与本人沟通提出,或于本站点留言,我们会尽快处理。 在此,感谢ExcelTip.Net站长Apolloh的支持,感谢本站点所有人**绿色风(QQ:79664738)**的支持与奉献,特此鸣谢!
------本人网名**KevinChengCW(QQ:1210618015)**原ExcelTip.Net总版主之一

评论列表
sitemap