文档转换
Word 转 PDF、PDF 转 Word、PDF 提取文字、PDF 转图片——这几件常做的事全在这一页。转换在你自己的浏览器里跑完,文件既不上传也不留存,合同、简历、内部材料都可以放心处理。
点击选择 .docx 文件,或直接拖进来
只支持 .docx(2007 之后的格式);老的 .doc 二进制格式请先用 Word 另存为 .docx
只支持 .docx(2007 之后的格式);老的 .doc 二进制格式请先用 Word 另存为 .docx
说明
- Word 转 PDF 是怎么转的
- 先把 .docx 解析成 HTML(标题、段落、列表、表格、加粗斜体、超链接和内嵌图片都会保留),再按纸张宽度排版、整页栅格化后写进 PDF。分页时会自动避开文字:从理论切点往上找一条几乎全是空白的像素行再切,所以不会把一行字劈成两半。代价是生成的 PDF 里文字是图像,不能被复制和检索——需要可选中文字的 PDF,请用 Word 自带的「另存为 PDF」。这个取舍是为了中文:在浏览器里生成矢量文字的 PDF 必须内嵌中文字体,动辄好几兆,得不偿失。
- 为什么只支持 .docx,不支持 .doc
- .docx 本质是个 zip 包,里面是 XML,浏览器能直接解开;而 .doc 是 1990 年代的二进制复合文档格式,解析它需要一整套 OLE 实现,浏览器里做这件事既笨重又不可靠。遇到 .doc 请先用 Word、WPS 或 LibreOffice 另存为 .docx,再回来转。另外,Word 里的文本框、艺术字、公式、批注和页眉页脚不会出现在结果里——这些在 .docx 里存放的位置比较特殊,主流的前端解析库都不处理。
- PDF 转 Word 能还原排版吗
- 不能,也不该指望。PDF 内部只记录「哪个字符画在页面的哪个坐标上」,并没有「这是一个段落」「这是一张表格」这样的结构信息,所谓的转 Word 都是靠猜。本工具的做法是按文字的纵坐标聚行、按横向间距判断是否断句,输出成段落清楚的 Word 文档,能保证文字都在、顺序正确、可以继续编辑,但表格会变成普通文字,多栏排版会按阅读顺序拉平。如果你要的是高保真还原,那需要商业排版引擎,不是浏览器能做的。
- 扫描件为什么提不出文字
- 扫描出来的 PDF 每一页其实是一整张图片,里面根本没有文字对象。想从中拿到文字需要 OCR(光学字符识别),那是模型的活,本站不做。可以先用「转成图片」把每页导出来,再用带 OCR 的工具处理。判断办法很简单:点「提取文字」,如果结果是空的或只有零星几个字符,基本就是扫描件。
- 页码范围怎么写
- 支持单页、区间和它们的组合,例如
1-3,5,8-10表示第 1 到 3 页、第 5 页、第 8 到 10 页。留空就是全部页。转图片时如果只选了一页,会直接下载那张图;选了多页则打成一个 zip 一起下载。 - 切到别的标签页,转换会停吗
- 不会。浏览器会冻结后台标签页的动画回调,而 pdf.js 默认正是靠动画回调逐页推进的,所以很多同类工具一切走标签页进度就卡住不动。本页在渲染时显式用了「打印」意图,走的是另一条不依赖动画回调的路径,你切到别的标签页去做别的事,它照样在后台一页页转完。
- 大文件会不会卡
- 会,而且卡在你自己电脑上。几百页的 PDF 转图片要逐页栅格化,清晰度选「印刷」时单页就可能超过 2000 万像素,浏览器内存很容易吃紧。建议分批处理:先用页码范围转前 20 页,看看效果和体积再决定。转换过程中页面会显示进度条,中途可以直接刷新页面终止。
- 相关工具
- 图片转 PDF、HTML 转 Markdown、Markdown 预览、图片压缩、图片拼接。
- 开源致谢
- Word 解析用 mammoth.js(BSD-2-Clause),PDF 解析与渲染用 pdf.js(Apache-2.0),PDF 生成用 jsPDF(MIT),页面栅格化用 html2canvas(MIT)。这些组件按需加载,不点对应功能就不会下载。