只講機制 · 不下結論 · 四項你自己查得到
用 ChatGPT 或 AI 把 PDF 轉成 Word
ChatGPT 讀得了 PDF,也交得出裡面的文字,但它不會交還一份保留標題、表格與版面的 .docx—— 那正是這個轉換器在做的事。所以這一頁講機制,不是排名:把 PDF 變成 Word,其實是三件互不相關的事 共用一個名字,AI 在其中一件裡是主角,在另一件裡根本不出場。看懂這三件,再花一分鐘在自己的檔案上驗證。
最後更新:2026-09-16
「用 AI 把 PDF 轉成 Word」到底在做哪三件事
PDF 裡沒有稿件,只有一頁紙的繪製指令:這個字形畫在這個座標,再畫下一個。檔案裡沒有任何 一句話說「這四十個字形是一個標題」。把它們重新認出來,是三件各自獨立成敗的事。
一、把字拿到手。文字版 PDF 自帶文字層,字元連同座標直接讀出來。掃描頁裡 一個字元都沒有,只能從像素裡認。兩件完全不同的事,從外面看一模一樣。
二、判斷結構。哪幾行是標題、哪一塊是表格、格線邊界落在哪裡、分欄在什麼 地方斷開。這是從幾何和文意裡做推斷,最吃判斷力,也正是模型擅長的一段。
三、把檔案寫出來。.docx 不是純文字,是一包物件:段落樣式、表格格線、章節 屬性、按名字引用的字型。Word 能給你大綱導覽和自動重排,是因為這些物件在包裡, 所以總得有東西把它們寫進去——寫它的那一方,決定了你的稿子裡到底有什麼。
前兩件是讀,第三件是寫檔案,也是結果分岔的地方:同一頁讀得再準,出來的既可能是真的 Word 物件,也可能是它的一張仿品,取決於誰在寫這個包。所以面對任何轉檔工具,都該問第三件事由誰 來做。四條常規路線的比較在PDF 怎麼轉成 可以編輯的 Word 檔那一頁。
文字層還是一張圖:五秒鐘就分得出來
這個判斷只要五秒:用滑鼠去選一句話。字被選起來、貼得出去,就有文字層;什麼都選不到,或者 整頁一起變藍,那是一張圖。
有文字層,字元本來就在檔案裡:不必辨識,剩下的交給幾何。掃描頁裡一個字元都沒有,必須有東西 去看那張圖——這正是視覺模型做得好的事,也是掃描件這條路上 AI 該出場的理由。辨識的邊界在 哪裡,寫在掃描的 PDF 轉成可編輯的 Word 檔那一頁。
一份檔案也可以兩種都是:合約正文是乾淨的文字版,最後一頁簽名蓋章卻是掃描的。逐頁判別的 轉檔工具,只在真正需要的那幾頁上花模型的錢。
中文稿子在這條路上,多三個坑
字可能是被「複述」的,不是被「抄」的。語言模型按機率生成文字,複述和謄寫對它 是兩種行為;中文沒有詞間空格,同音近形的字又多,換掉一個字往往還是讀得通。所以要抽查的不是 順不順,是人名、地名、金額、條號這些換掉也不彆扭的地方。
繁簡可能被順手統一。正文繁體、引文簡體,或者附件裡夾著對岸廠商的報價表, 這類混排很容易被抹平成一種。原稿是什麼就該是什麼,這一條只能你自己核。
字型是按名字存的。.docx 裡存的是字型的名字,不是字型本身。名字寫對了、你的 電腦上卻沒有這套字型,整頁就是空方框。這不是轉檔錯,是字型名的事,解法寫在 中文 PDF 轉可編輯 Word:不再是空方框和亂碼那一頁。
拿到 .docx 之後,自己查這四項
別聽任何人描述自己的輸出,包括我們。打開結果跑下面四項,任何來源的 .docx 都適用,加起來 一分鐘。
- 把游標點進表格裡。只有游標真的落在表格物件裡,功能區才會多出兩個只有表格才有的情境索引標籤(英文介面是 Table Design 與 Layout)。它們出現就是真表格;功能區紋風不動,那是用定位點或一張圖拼的。
- 打開標題大綱。用標題樣式寫的標題會排成一份點得動的大綱;只是字級大、 加粗的普通段落,大綱是空的。微軟的說明寫明導覽窗格在「檢視」索引標籤底下,或者按 Ctrl+F;它同時寫明這個窗格在 Mac 版和網頁版裡行為不同。找不到就換一招:點一下標題,看 樣式方塊裡寫的是「標題 1」還是「內文」。
- 點一行字,看字型方塊。方塊裡是一個具體的字型名,表示原來的字型被量到並 搬了過來。方塊是空的,表示這一選取範圍裡字型不只一種——在標題裡正常,在一個段落中間就 該警覺。
- 在段落中間打字。真正的文字會把後面的內容往下頂,整頁像你自己寫的稿子 一樣重排。如果版面當場散掉、旁邊一塊跟著跳,或者根本推不動,那你其實是在一張圖旁邊打 字,結構從一開始就不存在。
同一頁稿子在兩個工具裡各跑一遍,得到的資訊比任何比較文章都多,因為量的是你自己的檔案。 你要的如果是排得了序、加得了總的資料,同一套重建可以直接寫成儲存格,見 PDF 表格轉 Excel。
標題、分欄和行距上是同一道坎: 版面不散掉地轉出來, 靠的同樣是三件事裡的第三件。
如果你要的其實是「把 AI 的回答存成 Word」
兩個需求用的詞幾乎一樣,方向正好相反:一個是把你手上那份 PDF 重建成能改的 Word 檔,另一個 是把對話裡的一段回答存成 .docx 寄出去。
第二件事是排版,不是重建。文字本來就是文字,沒有東西要辨識,也沒有版面要從座標裡推斷,你 只是在給已經成形的內容挑樣式——瀏覽器擴充功能和「貼進文書處理軟體」就是做這個用的。這一 頁講的東西對它一條都不適用,我們也不做這件事。
自帶 API 金鑰:用你已經在付錢的那個模型
如果你本來就在為某個模型付費,也更放心讓它來讀,這條路是開的:在首頁轉檔控制項底下展開 進階面板,選服務商——Anthropic、OpenAI、Gemini,或者任何 OpenAI 相容的端點(自架和本機 服務都算)——把金鑰貼進去。它只用在這一次轉檔上,不保存、不記錄;讀你這幾頁的是誰、帳記 在哪,都由你自己定。入口在PDF 轉可編輯 Word首頁的上傳面板裡。
我們怎麼做:模型負責讀,另一套程序負責寫
我們自己就是 AI 產品,在這一頁上裝作不是就太滑稽了。每一頁先做判別:帶文字層的頁走一條 完全不呼叫模型的路——字元和幾何直接從檔案裡出來,這也是文字版在 Basic 模式裡免費的原因。 掃描頁交給 AI 視覺模型,把字和它周圍的結構一起讀出來。
關鍵在下一段。模型回傳的東西沒有一個字被直接寫進你的稿子:讀出來的結果先落成一份結構化 描述——哪一行是標題、哪幾格屬於同一列、表格格線與編號怎麼定義——再由一套獨立的產生程序 把它變成 Word 包。分工也因此很清楚:模型讀,程序寫;上面四項自查之所以過得了,靠的就是 這一層隔開。同一份描述也可以寫成 Excel 活頁簿或 Markdown,價錢一樣。
要花多少錢
老實的說法是:Basic 模式免費、無需帳號:每天 10 頁、每月 100 頁;登入後每天 100 頁、每月 1000 頁。這條路沒有浮水印,也一分模型的錢都不花。 掃描頁要真金白銀地讀,AI 模式把它轉寫成真正可編輯的文字,需要登入並綁定付款方式, 與 Basic 共用同一份帳號額度,超出後依已購頁數計費;也可以貼自己的金鑰,或者等依頁數購買——方案列在價格頁上,目前尚未 開放。兩條路一樣,轉出來的成品大約六小時後自動刪除。
從哪裡開始
找一頁你熟的稿子,最好帶表格,轉一遍,信任它之前先跑那四項:表格的情境索引標籤出現了、 大綱有內容了、在段落中間打字整頁會重排而不是散掉,那你拿到的就是稿件,而不是稿件的照片。 PDF 轉可編輯 Word 在這裡,不用註冊、不裝軟體;想讓自己的模型來讀, 進階面板裡貼一把金鑰就行。
參考資料
選單位置以微軟說明為準,2026-09-14 核對;介面會變,以連結為準。下面兩篇寫明了導覽窗格的 位置與 Ctrl+F,以及 Mac 版與網頁版的差異。
- Microsoft 支援 — 使用 Word 中的導覽窗格(「檢視」索引標籤底下的 位置與 Ctrl+F)。
- Microsoft 支援 — 在 Word 或 Mac 版 PowerPoint 中調整表格大小 (選起表格時會出現只屬於表格的情境索引標籤)。
常見問題
用 AI 轉 PDF 的常見問題
用 ChatGPT 把 PDF 轉成 Word,中文會不會被悄悄改掉?
要看那段字是被抄過去的,還是被複述出來的。語言模型是按機率往下生成文字,複述一段話和逐字謄寫一段話對它是兩種行為;中文沒有詞間空格,同音近形的字又多,換掉一個字往往還是讀得通。所以繁體稿子拿回來,別只看順不順,去抽查人名、地名、金額、條號這些換掉也不彆扭的地方。
AI 轉出來的 Word,怎麼看出它是真的稿件還是一張圖?
在段落中間打一行字,看會發生什麼。真正的文字會把後面的內容往下頂,整頁像你自己寫的稿子一樣重排;如果版面當場散掉、旁邊一塊跟著跳,或者根本推不動,那你是在一張圖旁邊打字。再補兩項:把游標點進表格,看功能區會不會多出只在表格裡才有的索引標籤;打開標題大綱,看裡面是不是空的。
為什麼 AI 讀出來的中文,肉眼很難看出哪裡不對?
因為出錯的方式不是亂碼。亂碼一眼就看得到,而一個字被換成讀音相近、字形相近的另一個字,整句還是通順的,你順著讀下去不會停。英文錯一個字母通常會拼出一個不存在的字,中文沒有這道天然的護欄。所以繁體稿的校對重點是專有名詞和數字,不是整體語感。
把合約或內部文書交給 AI 讀,內容會被拿去訓練模型嗎?
這件事的主導權應該在你手上,所以這裡留了自帶 API 金鑰這條路:額度之外,你可以填自己的服務商金鑰,讀你這幾頁的是你自己帳戶底下的模型,條款按你和服務商之間的約定走,金鑰只用在這一次轉檔上,不保存也不記錄。另外,本來就帶文字層的頁根本不會被送去任何模型。轉出來的成品大約六小時後自動刪除。
為什麼有的頁不用錢,有的頁要算錢?
差別在那一頁需不需要模型。帶文字層的頁,字元和座標直接從檔案裡讀出來,全程零模型成本。Basic 模式免費、無需帳號:每天 10 頁、每月 100 頁;登入後每天 100 頁、每月 1000 頁。掃描頁裡一個字元都沒有,必須有視覺模型去看那張圖,那是按頁真金白銀花出去的,所以 AI 模式需要登入並綁定付款方式。也可以填自己的金鑰,或者等依頁數購買開放。
我只是想把 ChatGPT 的回答存成 Word 檔,這裡做得到嗎?
做不到,而且那是另一件事。你手上那段回答本來就是文字,沒有東西需要辨識,也沒有版面要從座標推斷出來,你要的是給已經成形的內容挑樣式,那屬於排版。這一頁講的是反方向:一份 PDF 怎麼被重新認成標題、段落和表格,再寫成 Word 物件。兩件事只是剛好用了差不多的說法。