📄 PDF 工具箱

實用文章

← 返回工具箱

發布日期:2026 年 9 月 15 日

明明看得到字,為什麼搜不到?

你一定遇過這種情況:打開一份 PDF,畫面上的文字清清楚楚,但按 Ctrl+F 搜尋關鍵字卻毫無反應,想複製一段文字也只能選到整頁圖。原因很簡單:這份 PDF 裡根本沒有「字」,只有「字的照片」。PDF 全螢幕看起來一樣,內部結構卻分成兩種截然不同的類型——文字型與圖像型(掃描型)。搞懂這個差別,才知道一份檔案該怎麼處理、能用哪些工具、以及為什麼有些功能怎麼試都沒效。

兩種 PDF:文字型 vs 圖像型

文字型 PDF:字是「字」

從 Word、Excel、PowerPoint、Google 文件匯出的 PDF,多半是文字型。檔案裡儲存的是真正的文字編碼(每個字對應到哪個字碼、用什麼字型、座標在哪),再加上版面描述。因為電腦讀得到字碼,所以可以搜尋、複製、朗讀,檔案也通常比較小。

圖像型 PDF:字是「照片」

掃描器、事務機、手機拍照 App 產生的 PDF,做法是把每一頁拍成一張圖片,再把一張張圖片裝訂成 PDF。畫面上的「字」其實是圖片裡的深色像素,PDF 內部完全沒有文字資料,自然無法搜尋與選取。這也是掃描檔特別大的原因——每一頁都是一張高解析度照片(延伸討論請看為什麼你的 PDF 這麼大)。

  • 來源判斷:辦公軟體匯出 → 多半是文字型;掃描器、拍照 → 幾乎都是圖像型。
  • 行為判斷:能選字、能搜尋 → 文字型;完全選不起來 → 圖像型。
  • 混合型:也有檔案一半是文字頁、一半是掃描頁(例如合約正文加掃描附件),要逐頁判斷。

讓掃描 PDF 能搜字:OCR 的概念

要讓圖像型 PDF 變成可搜尋,需要經過 OCR(Optical Character Recognition,光學字元辨識):軟體分析頁面影像,把「看起來像字的圖形」辨認成真正的文字,再回寫進 PDF。辨識完成後,通常有兩種輸出形式:

  • 可搜尋 PDF(影像+隱形文字層):畫面仍顯示原掃描影像,但底下疊了一層看不見的文字,可搜尋、可複製。這是最常見的做法,能保留掃描原貌。
  • 純文字型 PDF:整份重新排成真正的文字文件,檔案小、好編輯,但版面、印章、簽名都會消失,適合內容重於外觀的場合。

OCR 的品質取決於掃描影像的清晰度:解析度太低、歪斜、光影不均都會讓辨識率下降,中文辨識難度又高於英文,辨識完務必抽檢關鍵內容(數字、金額、姓名特別容易錯)。OCR 需要專門的辨識引擎,屬於「重新產生內容」的處理,本站的瀏覽器端工具並不包含 OCR 功能。

兩種 PDF 各自適合的處理方式

文字型 PDF

  • 結構優化壓縮:用 PDF 壓縮工具重整內部結構、合併重複物件,對匯出型的文字檔常有感。
  • 抽出需要的章節:用 PDF 拆分工具依頁碼切出要傳送的範圍。
  • 彙整成一份:用 PDF 合併工具把多份相關文件依序收攏。

圖像型(掃描)PDF

  • 想壓小:體積幾乎都在圖片裡,不降畫質就縮不了多少;最有效的是重掃時改用灰階、適當 DPI。若只是要分批處理,可先用拆分工具切開。
  • 想搜字:需要先跑 OCR(本站未提供),或保留原始檔另存辨識版。
  • 想整理歸檔:拆冊、命名、分資料夾比壓縮更重要,做法請參考PDF 命名與整理術

常見問題

怎麼快速確認手上這份 PDF 是哪一型?

打開檔案按 Ctrl+A 全選:反白的是文字型;完全沒反應、或只能選到整頁圖塊的,就是圖像型。另一個線索是放大檢視——文字型放大後邊緣依然銳利,圖像型放大後會出現鋸齒或像素塊。

為什麼壓縮工具對掃描 PDF 效果有限?

本站壓縮工具做的是結構優化,不會重新壓縮影像畫質;而掃描檔的大小幾乎全由頁面圖片決定,所以省下的空間有限。這是「不上傳伺服器」前提下的技術界線,詳細說明見壓縮工具頁

把掃描 PDF 轉成圖片會更好處理嗎?

不一定。掃描頁本來就是圖片,轉成 JPG/PNG 只是換一種包裝,還會失去多頁文件的完整性。PDF 與圖片格式該怎麼選,可參考PDF 和圖片檔的差別

OCR 之後檔案會變大還是變小?

可搜尋 PDF 會多出一層文字資料,檔案略為增加(通常個位數百分比);純文字型則會大幅縮小,因為高解析度影像被文字取代了。

延伸閱讀