只讲机制 · 不下结论 · 四项你自己能查
用 ChatGPT 或 AI 把 PDF 转成 Word
ChatGPT 能读 PDF 并把里面的文字交给你,但它不会交还一份保留了标题、表格和版式的 .docx——那正是这个转换器做的事。这一页讲清中间的机制:把 PDF 变成 Word 其实是三件 互不相干的事共用了一个名字,AI 模型在其中一件里是主角,在另一件里根本不出场。看懂这三件事, 你就能预判任何工具会给你什么——然后花一分钟,在自己的文件上验证。
最后更新:2026-09-16
「用 AI 把 PDF 转成 Word」到底在做哪三件事
PDF 存的不是文档,是一页纸的绘制指令:这个字形画在这个坐标,然后画下一个。文件里没有任何 一句话说「这四十个字形是一个标题」。把它们重新认出来,是 三件各自独立成败的事。
一、把字拿到手。文字版 PDF 自带文字层,字符连同坐标直接读出来。扫描页里一个字符都没有,只能从像素里认。两件完全不同的事,从外面看一模一样。
二、判断结构。哪几行是标题、哪一块是表格、格子边界落在哪里、分栏在什么地方断开。这是从几何和文意里做推断,最吃判断力,也正是模型擅长的一段。
三、把文件写出来。.docx 不是文本,是一包对象:段落样式、表格网格、节属性、按名字引用的字体。Word 能给你大纲导航和自动重排,是因为这些对象在包里, 所以总得有东西把它们写进去——写它的那一方,决定了你的文档里到底有什么。
前两件是读,第三件是写文件,也是结果分岔的地方:同一页读得再准,出来的既 可能是真的 Word 对象,也可能是它的一张仿品,取决于谁在写这个包。所以面对任何转换器,都该问第三件事由谁来做。四条常规路线的对比在PDF 怎么转成可编辑的 Word 文档那一页。
文字层还是一张图:五秒钟就能分清
这个判断只要五秒:用鼠标去选一句话。字被选中、能 复制出来,就有文字层;什么都选不中,或者整页一起变蓝,那是一张图。
有文字层,字符本来就在文件里:不需要识别,剩下的交给几何。扫描页里一个 字符都没有,必须有东西去看那张图——这正是视觉模型做得好的事,也是扫描件这条路上 AI 该出场 的理由。识别的边界在哪里,写在扫描件 PDF 转可编辑 Word那一页。
一份文件可以两种都是:合同正文是干净的文字版,最后一页签字盖章却是扫描的。逐页判别的转换器, 只在真正需要的那几页上花模型的钱。
中文稿子在这条路上,多三个坑
字可能是被「复述」的,不是被「抄」的。语言模型按概率往下生成文字,复述和逐字誊抄,对它是两种行为。中文没有词间空格,同音近形的字又多,换掉一个字往往仍然 读得通。所以中文稿拿回来要抽查的不是通顺度,是人名、地名、金额、条款 编号这些换掉也不别扭的地方。
繁简可能被顺手统一。正文简体、引文繁体,或者港台名称夹在简体正文里,这类混排很容易被抹平成一种。原稿是什么就该是什么,这一条只能你自己核。
字体是按名字存的。.docx 里存的是字体的名字,不是字体本身。名字写对了、你的 机器上却没有这个字体,整页就是空方框。这不是转换错,是字体名的事,解法写在 中文 PDF 转 Word 为什么会变成方框和乱码那一页。
拿到 .docx 之后,自己查这四项
别听任何人描述自己的输出。把结果打开,跑下面四项。任何来源的 .docx 都适用,加起来一分钟。
- 把光标点进表格里。只有光标真的落在表格对象里,功能区才会多出表格专用的 选项卡;微软自己的文档写的是,选中表格时会出现「表设计」和「布局」这两个上下文选项卡。 它们出现,你就拿到了真表格;功能区纹丝不动,那是用制表位或一张图拼出来的样子。
- 打开标题大纲。用标题样式写的标题会排成一份可点的大纲;只是字号大、加粗的 普通段落,大纲是空的。微软的文档写明导航窗格在「视图」选项卡下,或者按 Ctrl+F;它同时写明 这个窗格在 Mac 版和网页版里行为不同;找不到就换一招:点一下标题,看样式框里 写的是「标题 1」还是「正文」。
- 点一行字,看字体框。框里是一个具体的字体名,说明原来的字体被量到并搬了 过来。框是空的,说明这一选区里字体不止一种——在标题里正常,在一个段落中间就该警觉。
- 在段落中间打字。真正的文字会把后面的内容往下顶,整页 像你自己写的稿子一样重排。如果版面当场散架、旁边一块跟着跳,或者根本推不动,那你其实是在一张图旁边打字,结构从一开始就不存在。
同一页文档在两个工具里各跑一遍,两分钟得到的信息比任何对比文章都多,因为量的是你 自己的文件。你要的如果是能排序、能求和的数据,同一套重建可以直接写成单元格,见 PDF 表格转 Excel。
标题、分栏和间距上是同一道坎: 版面不散地转出来, 靠的同样是三件事里的第三件。
如果你要的其实是「把 AI 的回答存成 Word」
两个需求用的词几乎一样,方向正好相反:一个是把你手上那份 PDF 重建成能改的 Word,另一个是把对话里的一段回答存成 .docx 发出去。
第二件事是排版,不是重建。文字本来就是文字,没有东西要识别,也没有版面要从坐标里推断,你 只是在给已经成型的内容挑样式——浏览器插件和「粘进文字处理器」就是干这个用的。这一页讲的 东西对它一条都不适用,我们也不做这件事。
自带 API key:用你已经在付钱的那个模型
如果你本来就在为某个模型付费,也更放心让它来读,这条路是开的。在首页转换控件下面展开进阶 面板,选你的服务商——Anthropic、OpenAI、Gemini,或者任何 OpenAI 兼容的端点(自建或本地部署的模型服务也算)——把 key 粘进去。它只用在这一次转换上,不保存、不记录,账单记在你自己的服务商那里。
对不方便外发的稿子,读你这几页的是谁、账记在哪,都由你定。分工也 因此很清楚——读这一半是你的,写出这份 Word 是我们的。key 的输入框就在 PDF 转可编辑 Word 首页上传面板的进阶区里。
我们怎么做:模型负责读,另一套程序负责写
我们自己就是一个 AI 产品,在这一页上装作不是就太滑稽了。每一页先做判别。带 文字层的页走一条完全不调用模型的路——字符和几何直接从文件里出来,这也是文字版在这里能免费转的原因。Basic 模式免费、无需账号:每天 10 页、每月 100 页;登录后每天 100 页、每月 1000 页。扫描页交给 AI 视觉模型,把字和它周围的结构一起读出来。
关键在下一段。模型返回的东西没有一个字被直接写进你的文档。读出来的结果先落成 一份结构化描述——这是标题、这是一张几行几列的表、这里是两栏——再由一套独立的生成程序把它变成 Word 包:段落样式、表格网格、节属性、按 Word 的规矩命名的字体。模型读,程序写。 上面那四项自查之所以能过,靠的就是这一层隔开。
同一份描述也可以写成别的格式:一次上传,可以要 Word 文档,也可以要 Excel 工作簿或者 Markdown,价钱一样。
要花多少钱
本来就带文字的 PDF 免费,不用注册、没有水印,因为这条路一分模型的钱都不花。 Basic 模式免费、无需账号:每天 10 页、每月 100 页;登录后每天 100 页、每月 1000 页。扫描页要真金白银地读:AI 模式把扫描件转写成真正可编辑的文字,需要登录并绑定付款方式,与 Basic 共用同一份账号额度;超出后按已购页数计费。自带 API key 的转换完全不计入额度。
转扫描页有两条路。粘自己的 API key,直接付给你的模型服务商;或者登录并绑定付款方式走 AI 模式——按页购买的套餐列在 价格页上,目前还没有开通。两条路一样, 转换产物大约六小时后自动删除。
从哪里开始
找一页你熟的稿子,最好带张表格,转一遍,在信任它之前先跑那四项。表格选项卡出现了、大纲有 内容了、在段落中间打字整页会重排而不是散架,那你拿到的就是一份文档,而不是一张文档的照片。 你可以在这里PDF 转可编辑 Word,不用注册、没有水印、不装软件;想让自己的 模型来读,就把 key 带上。
参考资料
菜单位置以微软自己的文档为准,2026-09-14 核对。界面会变,以链接为准。
- 微软支持 — 在 Word 中使用导航窗格(「视图」选项卡下的位置、 Ctrl+F,以及微软自己写明的 Mac 版与网页版差异)。
- 微软支持 — 在 Word 或 PowerPoint for Mac 中调整表的大小 (选中表格时出现「表设计」和「布局」上下文选项卡)。
常见问题
用 AI 转 PDF 的常见问题
用 ChatGPT 把 PDF 转成 Word,中文会不会被悄悄改掉?
这要看那段字是被抄过去的,还是被复述出来的。语言模型是按概率往下生成文字的,复述一段话和逐字誊抄一段话对它是两种行为,而中文没有词间空格、同音近形的字又多,换掉一个字往往仍然读得通。所以中文稿子拿回来,别只看通顺不通顺,去抽查人名、地名、金额、条款编号这些换掉也不别扭的地方。
AI 转出来的 Word,怎么看出它是真文档还是一张图?
在段落中间打一行字,看会发生什么。真正的文字会把后面的内容往下顶,整页像你自己写的稿子一样重排;如果版面当场散架、旁边一块跟着跳,或者根本推不动,那说明你是在一张图旁边打字。再补两项:光标点进表格,看功能区会不会多出表格专用的选项卡;打开标题大纲,看里面是不是空的。
为什么 AI 读出来的中文,肉眼很难看出哪里不对?
因为出错的方式不是乱码。乱码一眼就能发现,而一个字被换成另一个读音相近、字形相近的字,整句话仍然通顺,你顺着读下去不会停顿。英文里错一个字母通常会拼出一个不存在的词,中文没有这道天然的护栏。所以中文稿的校对重点是专名和数字,而不是整体语感。
把合同或内部稿件交给 AI 读,内容会被拿去训练模型吗?
这件事的主动权应该在你手上,所以这里留了自带 API key 这条路:额度之外,你可以填自己的服务商密钥,读你这几页的是你自己账户下的模型,条款按你和服务商之间的约定走,密钥只用在这一次转换上,不保存也不记录。另外,本来就带文字层的页根本不会被送去任何模型。转换产物大约六小时后自动删除。
为什么有的页不要钱,有的页要算钱?
差别在那一页需不需要模型。带文字层的页,字符和坐标直接从文件里读出来,全程零模型成本,所以转起来免费。Basic 模式免费、无需账号:每天 10 页、每月 100 页;登录后每天 100 页、每月 1000 页。扫描页里一个字符都没有,必须有视觉模型去看那张图,这是按页真金白银花出去的:AI 模式把扫描件转写成真正可编辑的文字,需要登录并绑定付款方式,与 Basic 共用同一份账号额度;超出后按已购页数计费。也可以填自己的 key——自带 API key 的转换完全不计入额度。
我只是想把 ChatGPT 的回答存成 Word 文件,这里能做吗?
不能,而且这是另一件事。你手上那段回答本来就是文字,没有东西需要识别,也没有版面要从坐标里推断出来,你要的是给已经成型的内容挑样式,属于排版。这一页讲的是反方向:一份 PDF 怎么被重新认成标题、段落和表格,再写成 Word 对象。两件事只是碰巧用了差不多的说法。