拿到一份 PDF 之后的加工需求,绝大多数落在四类:标记来源(加水印)、表示签署(加签名或印章)、取出内容(提取文字)、改变载体(转成网页)。这四件事各有一条明确的能力边界,越过边界就会得到「工具好像没生效」的错觉。下面逐个说清原理和边界。
一、加水印:它是叠加层,不是防复制
PDF加水印 做的事是在页面内容之上画一层文字:位置、大小、透明度、旋转角度、颜色都可配置,可以整页平铺,也可以在九宫格里指定单个位置,支持中文水印并提供实时预览。
必须先纠正一个普遍误解:水印不是加密,也不防复制。 它只是页面里多出来的一层绘制指令。加了水印之后,原来的文字层一个字都没少,对方照样可以选中、复制、提取;也照样可以用工具把这层水印内容抹掉或者裁掉。水印真正起作用的地方是归属声明和传播追踪:让每一页都印着「XX 公司内部资料」「仅供 张三 阅读」,一旦文件流出去,来源和责任是明确的。这种「让人不敢转」的心理约束,在实际工作里比技术手段有效得多。
如果目标是「对方看不到、拷不走」,水印是错误的工具,应该走的是权限密码、加密分发或者不给文件只给受控查看链接这类路线。
参数上有几条实用经验:
- 平铺还是指定位置:需要防截图外传、需要每页都醒目,用平铺;只是标记版本、不想影响阅读,用指定位置放在页脚或右上角。
- 透明度是最需要反复调的一项。太实会盖住正文影响阅读甚至打印,太虚在截图压缩后就看不见了,等于没加。平铺模式下建议偏虚,单点模式下可以偏实。
- 旋转 45 度在多数版式上遮挡感和识别度平衡得最好,横排水印容易和正文行混在一起看不清。
- 字号和页面尺寸相关。同一个字号在 A4 和在幻灯片尺寸的 PDF 上视觉大小差很多,换文件就要重新看一眼预览。
- 页码范围可以只给部分页加,比如只给正文加、封面留白。
如果你要的是「加了之后完全去不掉」,比 PDF 水印更彻底的做法是先把页面栅格化成位图再叠水印,那时水印和内容已经烤成同一层像素——代价是文字层随之消失,后面第三节要讲的提取文字就再也用不了了。这是个取舍,不是两全。
二、签名盖章:视觉签署,以及去白底为什么必要
PDF签名盖章 面向的是签合同、签回执、盖公司章这类只需要视觉签署的场景。签名有两种来源:直接在页面上的手写板里用鼠标或手指签(笔色和粗细可调,支持撤销单笔),或者上传已有的签名、印章图片。
上传白底图片时,「去掉白色背景」这个勾选项几乎是必选的。 原因很直接:你在纸上签好名再用手机拍下来,得到的是一张白底照片;直接盖到 PDF 上,就是在正文中间贴了一块生硬的白色方块,把底下的表格线、正文、下划线全都遮住,一眼就能看出是贴图。工具的处理是把接近白色的像素转为透明,并对边缘做半透明过渡——后半句是关键,只做硬阈值二值化会让笔画边缘出现锯齿和白边,加了过渡才像原本就写在纸上。
阈值需要微调的情况:拍照光线不均、纸张偏黄或者带阴影时,阈值太严会留下一圈灰底,太松会把笔画里较浅的部分一起抹掉导致笔迹断开。拍照时找均匀光线、避免手机阴影,比后期调阈值有效得多。
定位的做法是在页面预览图上直接拖动签名框,宽度用滑块调整。位置以页面比例记录而不是绝对像素,所以换到另一页也会落在同样的相对位置——批量在每页右下角盖章时,这个设计省掉了逐页对齐的功夫。盖章范围可选只盖当前页、全部页或指定页码范围。手写笔迹按矢量点存储、导出时做三倍超采样,放大后依然清晰,不会像截图那样一放大就成马赛克。
一条必须说明的限制:这属于视觉签署,不是基于 CA 数字证书的电子签名。 它在文件上留下的是一张图,不携带证书、不做内容哈希、无法证明签署后文件未被篡改、也无法认证签署人身份。日常的回执、内部审批、需要留个签字样子的表单,够用;正式合同、有法律效力要求的文件,请使用具备 CA 证书的签署服务。 把这两者搞混是真的会出事的。
三、提取文字:扫描件为什么一个字都提不出
PDF提取文本 取出 PDF 里的全部文字,并按文字的实际位置还原行与段落。它做了几件在中文场景下很必要的处理:自动合并被排版打断的同一段落、去掉行尾连字符(英文换行连字符会让单词被拆成两半)、中文之间不插入多余空格。也可以选择保留原始换行、按页码范围提取、为每页添加分隔标记,结果一键复制或导出 TXT。
「智能合并」和「保留原始换行」怎么选:
- 智能合并适合正文类内容。PDF 里每一行都是独立的文本片段,不合并就得到一堆断行短句,粘到任何地方都要手工接。
- 保留原始换行适合代码、诗歌、地址清单、分行的条款编号——这些内容里换行本身携带信息,合并了反而破坏结构。
最重要的边界:扫描件和图片型 PDF 提取不到任何文字。 这类 PDF 内部只有一张位图,没有文本层,从数据层面就没有字符可取。判断方法很简单——在 PDF 阅读器里用鼠标试着选中一段文字,能选中说明有文本层,选不中就是图片。后者需要 OCR(光学字符识别),本站不提供 OCR 功能,需要用专门的 OCR 软件或服务把图片识别成文字。所以遇到「提取结果是空的」,先做这个选中测试,而不是反复换参数重试。
还有一类容易误判的情况:有的 PDF 只有一部分页面是扫描的。比如合同正文是电子排版、最后签字页是扫描件,或者报告里插了几页拍照的附件。这种文件提取会得到「大部分正常、中间缺几页」的结果,看着像工具漏页,其实是那几页本来就没有文字。用页码分隔标记功能可以快速定位到底是哪几页缺了。
另外,提取拿到的是文字内容而不是版式。分栏 PDF 是最典型的麻烦:双栏论文里左右两栏在坐标上交错,按位置还原容易把左栏一行接上右栏一行。遇到分栏文档,按页提取后人工核对一下段落衔接,比事后从一团乱麻里整理要快。
四、转 HTML:排版为什么会变
PDF转HTML 把 PDF 中的文本、矢量图形和图片转换成网页元素,目标是在不同浏览器和设备上呈现一致的效果。提供两种输出模式,选择依据很清楚:
- 图文模式:完整还原排版,文字仍然可选中、可搜索。适合要把 PDF 挂到网页上给人在线看、要保留原始版面观感的场合。代价是体积大,因为背景图形部分需要位图承载。
- 纯文本模式:只保留文字,体积小、加载快。适合做内容归档、给搜索引擎抓取、或者只关心读内容不关心版面。
为什么排版一定会有变化? 因为这是两套完全不同的排版模型在做转换。PDF 是固定版式:每个字符都记录着自己在页面上的精确坐标,页面尺寸是死的。HTML 是流式布局:内容按容器宽度自动折行重排,窗口一变宽窄就跟着变。要把固定坐标搬进流式模型,只有两条路——用绝对定位把每个元素钉死(版式保住了,但窗口一窄就横向溢出,手机上没法看),或者转成流式段落(能自适应,但原始版面的对齐关系就散了)。任何 PDF 转 HTML 工具都在这两者之间做折中,所以看到行距、字间距、图文位置有偏移是正常的,尤其是分栏、表格、文本框、页眉页脚这些依赖精确坐标的元素。
图文模式下有两个参数值得调:背景清晰度决定矢量与图形部分的渲染精细度,图片质量决定内嵌图片的压缩程度。两者都直接影响文件体积,网页要给手机用户看的话不宜拉太高,先中档试一次、在浏览器里预览确认后再决定是否加码。工具支持先在浏览器里预览再下载,这一步别跳过——排版能不能接受,只有你自己看了才知道。输出是单个 HTML 文件,图片和样式都内联在里面,拷贝分发不会丢资源。
五、四个工具怎么串起来用
「内部资料要发给几个人,各自留痕」:给每个人生成一份带其姓名的水印文件。用指定位置模式放页脚,透明度偏实,保证截图后仍可辨认。
「回执要签字后回传」:先提取文字确认内容无误(避免签在改过的版本上),再手写签名盖到指定页,导出后自己也留一份。
「把一份 PDF 报告挂到官网」:图文模式转 HTML,预览确认排版能接受,再检查一遍文字是否可选中——这决定了搜索引擎能不能读到内容。若版式偏移太大而内容比版式重要,改用纯文本模式。
「要引用别人 PDF 里的一段话」:直接提取文字,选智能合并,比手工敲和截图强得多。选不中文字的先做 OCR。
顺序上有一条硬规则:要提取文字,就先提取,再做水印和签名。反过来虽然通常也能提,但如果中途走了「栅格化后加水印」的路线,文字层就没了,回不去。
这几个工具都在你的浏览器本地完成解析与生成,合同、回执、内部报告这类文件不会离开你的电脑,也就不存在「上传后被留存」的问题。
常见问题
加了水印,对方还是能复制文字,是不是没加成功? 加成功了。水印是画在页面上的一层内容,不影响原有文字层,所以复制、提取、搜索都照旧可用。水印的作用是声明归属和便于追责,不是访问控制。需要限制打开或复制,要用密码与权限设置,或者不直接分发文件。
上传的签名图片盖上去是一块白方块怎么办? 勾选「去掉白色背景」,工具会把接近白色的像素转为透明并对边缘做半透明过渡。如果还是有一圈灰底,说明照片光线不均,调整阈值再试;最省事的办法是重新拍一张——白纸黑笔、光线均匀、避开手机的阴影。
提取文本结果是空的,或者只提到几页? 说明这份 PDF(或其中那几页)是扫描件、图片型 PDF,内部没有文本层。先在阅读器里试着用鼠标选中文字验证,选不中就需要 OCR,本站不提供该功能。混合型文档可以开启页码分隔标记,快速看出缺的是哪几页。
转 HTML 后表格和分栏全错位了,能调吗? 工具层面能调的是渲染清晰度和输出模式,错位来自固定版式到流式布局的固有落差,不是参数问题。表格和分栏是最敏感的两类元素。如果核心需求是拿到表格数据而不是网页,用「PDF转Excel」按坐标重建行列更对路;如果只要内容能被读到,纯文本模式更省事。