Linux 下 将PDF文件中的文本,图片导出的方法。
来源:互联网 发布:网络校园广播 编辑:程序博客网 时间:2024/06/05 21:32
PDF格式文件中的文本是可以导出来再修改的。
同样,PDF里面的插图也是可以提取出来的。
PDF转纯文本:
pdftotext -enc GBK godson2e-data.Sheet.pdf text.GBK.txt
-enc (encoding)
要参照/etc/xpdf/xpdfrc 里面提到的编码格式。对于中文,用GBK
就可以了。
提取插图:
pdfimages godson2e-data.Sheet.pdf img
该命令就生成N个PPM文件,(一种BMP格式)
文件名为img-00?.ppm
? = (1 ~ N)
可以用ImageMagick里面的convert工具将其转换成相要的格式:
convert img-001.ppm img-001.jpg
或
convert img-001.ppm img-001.eps
上述方法在ubuntu下测试通过。
其中,pdfimages, pdftotext来自xpdf-utils包,xpdf的中文编码
支持来自xpdf-chinese-simplified包。换句话说,要实现上述功能
得安装:
xpdf-utils
xpdf-chinese-simplified
安装方法:
aptitude install xpdf-utils xpdf-chinese-simplified
如果没有aptitude,可以用apt-get
apt-get install xpdf-utils xpdf-chinese-simplified
同样,PDF里面的插图也是可以提取出来的。
PDF转纯文本:
pdftotext -enc GBK godson2e-data.Sheet.pdf text.GBK.txt
-enc (encoding)
要参照/etc/xpdf/xpdfrc 里面提到的编码格式。对于中文,用GBK
就可以了。
提取插图:
pdfimages godson2e-data.Sheet.pdf img
该命令就生成N个PPM文件,(一种BMP格式)
文件名为img-00?.ppm
? = (1 ~ N)
可以用ImageMagick里面的convert工具将其转换成相要的格式:
convert img-001.ppm img-001.jpg
或
convert img-001.ppm img-001.eps
上述方法在ubuntu下测试通过。
其中,pdfimages, pdftotext来自xpdf-utils包,xpdf的中文编码
支持来自xpdf-chinese-simplified包。换句话说,要实现上述功能
得安装:
xpdf-utils
xpdf-chinese-simplified
安装方法:
aptitude install xpdf-utils xpdf-chinese-simplified
如果没有aptitude,可以用apt-get
apt-get install xpdf-utils xpdf-chinese-simplified
- Linux 下 将PDF文件中的文本,图片导出的方法。
- 怎样将PDF中的文本导出
- 将PDF文件转换成为JPG图片的方法
- 怎样将PDF文件转换成jpg图片的方法
- LINUX下纯文本文档转换为PDF的方法
- .net 下如何将文档文件(Word, Pdf等) 中的文本提取出来
- 文本导出到pdf文件
- JavaScript将页面中的文本和图片导出到excel
- atom下将markdown文件导出成pdf文档
- 将图片转为PDF文档的方法
- 如何在Groovy下导出PDF的文本内容
- 将txt文本中的图片路径的图片读到某文件夹下
- Java解析PDF文件(PDFBOX、itext解析PDF)导出PDF中的子图片,去除PDF中的水印
- Java解析PDF文件(PDFBOX、itext解析PDF)导出PDF中的子图片,去除PDF中的水印
- 怎样将PDF文件中的图片进行修改
- 将网页另存为PDF文件的方法
- 借鉴EBookDroid源码,将一个pdf文件按页生成一系列的图片的实现方法
- 借鉴EBookDroid源码,将一个pdf文件按页生成一系列的图片的实现方法
- SEO 学习笔记1——域名和主机对SEO的影响
- 一次向SQL Server Insert 多条记录
- 转:测试工程师如何规划自己的职业生涯
- 博客开张
- find命令详解
- Linux 下 将PDF文件中的文本,图片导出的方法。
- ASP.NET 的后台代码问题:动态向Table里添加按钮,却提示没有Text属性。
- bsd socket介绍
- User Experience Coding How-To's
- SEO 学习笔记2——搜索引擎优化的核心
- 剖析自我
- SEO 学习笔记3——动态网页优化
- Windows消息大全
- valgrind for AIX