Web 工具

文字手术台

编辑 PDF 文字

删掉一段话,或改写它的措辞——原有字形是从页面里移除的,不是拿白块盖住的。

如何删除或改写 PDF 里的文字

  1. 1打开 PDF从设备中选择文件。解析在本地完成,文档不会被传输出去。
  2. 2选中一个段落文本块由页面几何关系识别并高亮,点击你想改的那一块即可。
  3. 3删除或改写整块删掉,或者在原位置输入新的措辞替换它。
  4. 4查看警告若某一页无法精确编辑,导出前会明确标出,让你知道那一页是被遮盖而不是被清除。
  5. 5下载导出会基于原始字节重建 PDF,并应用你的全部修改。

目前可用的能力

现在这个页面提供的是叠加工具:拉一个框把任意区域涂白或涂黑,在任意位置放文本框输入替换文字(支持中文)。这些对任何 PDF 都有效,包括扫描件——因为它们画在页面之上,而不是伸进页面内部。

把文字从文件里真正移除、让它消失而不只是被藏起来,这项能力仍在开发中。本页余下部分解释了它为什么确实很难、这个差别对你意味着什么、以及做好之后你该怎么验证。在那之前,请把每一个框都当作遮盖,而不是删除。

PDF 不是 Word 文档

PDF 页面内部根本没有段落这种东西。一页就是一段内容流:一串绘制指令,内容形如「把字体设为这个大小、移动到这个坐标、画出这些字形」。没有任何记录说明某一串字形属于一个句子、一个标题还是一个分栏。

所以 PDF 的文字编辑器必须自己把结构还原出来。本工具先按基线把字形串归成行,再在行距、左边界和字号一致时把行归成块。你点中的那一块是从几何关系推断出来的——通常推断得不错,但遇到表格或多栏排版这类复杂版式偶尔会偏。

真删除,还是一个白方块

大多数浏览器端 PDF 编辑器实现删除的方式,是在文字上画一个白色矩形。页面看起来对了,但文字仍在文件里:Ctrl+F 搜得到,框选那块区域能复制出来,一行 pdftotext 命令就能把它原样打印出来。对任何敏感内容而言,这根本不叫删除。

本工具的做法是从内容流里移除绘字指令,让字形真正消失。这要求把每条指令与渲染器报告的文字对应上。匹配可信时直接删除;匹配不可信时——有些文档把文字嵌在解析器不跟进的表单对象里——工具会退回到填充矩形,并在导出前逐页告诉你。它不会悄悄递给你一份看起来已脱敏、实则并没有的文件。

怎么自己验证

不要轻信任何工具的说法,包括本工具。打开导出的文件,搜索一句你删掉的、有辨识度的话——如果还能搜到,那就是被盖住而不是被删掉了。

想更严格,在终端里跑 pdftotext edited.pdf - 然后读输出。这一步完全绕过阅读器,直接打印文件里还剩下的全部文字。

改写后字体为什么变了

PDF 通常以子集方式嵌入字体:为了压小体积,只包含文档实际用到的那些字形。如果原文档从没用过你新输入的那个字,文件里就压根没有它的字形。

因此新文字只能用本工具自己嵌入的字体来绘制。结果依然清晰、可选中,但字形、间距和字重不会与原文完全一致。短改动通常看不太出来;替换整个标题则往往比较明显。

为什么后面的文字不会跟着挪

PDF 里每个字形都自带坐标。不存在一个段落对象去持有一整块文字并能重新排版它——而这恰恰是 PDF 在任何地方打开都长得一模一样的原因。

后果是:句子改短了会留下空白,改长了会撞上下方的内容。尽量让替换文字与原文长度接近,或者干脆把周围几行一并删掉重写。

扫描件没有文字层

扫描件就是被装进 PDF 容器里的照片。既没有字形可找,也没有指令可移除,文字编辑无从下手。这类页面会被标为扫描件并禁用文字工具,而不是让你点了却毫无反应。

你仍然可以遮盖或涂黑扫描件上的区域,页面级操作也完全正常。本工具不做 OCR。

FAQ

删掉的文字还留在文件里吗?
编辑成功时不会——绘字指令被移除,字形真的没了。若某页无法精确编辑,工具会改为遮盖,并在导出前警告你:那一页的原文字仍可被提取。
改过的文字为什么和原来不一样?
原字体通常是子集嵌入,只含文档已用过的字符。新文字需要的字形不在子集里,只能用本工具嵌入的字体绘制,字形与间距会有细微差别。
为什么后面的文字不会跟着挪?
PDF 给每个字形单独定位,没有文本流的概念。编辑时不会有任何回流——这也正是 PDF 在每台设备上都渲染得一模一样的原因。
扫描件能编辑吗?
文字不能,因为扫描件装的是图像而不是字形。你可以遮盖或涂黑区域,页面级操作全部可用。本工具没有 OCR 环节。
加密的 PDF 能用吗?
不能。加密文件在打开时就会被识别并附说明拒绝,而不是加载到一半再出问题。
这等于涂黑(redaction)吗?
它移除了文字,这是涂黑的实质部分;但合规流程通常还要求审计留痕与元数据清理,本工具并不提供。若用于受监管的脱敏场景,请自行按你的要求验证输出结果。