如何從PDF提取文字:數碼版與掃描版、編碼同佈局
從PDF中提取文字聽起來好簡單——直到你遇到一份掃描文件,佢實際上只係一張頁面相片;或者係一篇兩欄排版嘅學術論文,複製貼上出嚟嘅句子順序錯亂;又或者係一份阿拉伯語從右到左嘅PDF,字元順序被打亂。PDF以兩種根本唔同嘅方式儲存文字:數碼版(原生數碼)PDF包含帶有字型編碼同位置數據嘅實際文字物件,而掃描版PDF僅包含文字圖像,需要光學字元辨識(OCR)嚟提取。我哋嘅免費PDF轉文字轉換器處理兩種類型:佢透過字型解碼同內容流解析直接從數碼PDF中提取文字,並對掃描版PDF套用內建OCR(使用編譯為WebAssembly嘅Tesseract.js)。輸出係純UTF-8文字——乾淨、可搜尋,可以喺任何文字編輯器、文字處理軟件或數據管線中使用。所有處理都喺瀏覽器中執行,因此法律檔案、醫療記錄同財務報表等敏感文件永遠唔會離開你嘅裝置。
PDF轉文字
免費 · 無需註冊
分步指南
上載你嘅PDF
將你嘅PDF(最多30 MB)拖放到上載區域。工具分析PDF結構:如果偵測到嵌入嘅文字物件,則進行直接提取。如果PDF僅包含圖像(掃描文件),則自動啟用OCR模式,並提示你選擇文件語言以獲得最佳辨識準確率——OCR引擎支援100多種語言,包括英語、西班牙語、中文、阿拉伯語同印地語。
提取文字
點擊「提取文字」開始處理。對於包含嵌入文字嘅數碼PDF,提取幾乎係即時嘅——50頁嘅文字PDF喺1-3秒內處理完畢。對於使用OCR嘅掃描版PDF,處理時間取決於頁數、圖像解像度同語言複雜性:10頁200 DPI嘅英文掃描大約需要15-30秒。進度指示器顯示目前正在處理嘅頁面。提取嘅文字顯示喺可編輯嘅預覽面板中。
檢視並下載
喺預覽面板中檢視提取嘅文字——呢個係你喺儲存前發現並修正OCR錯誤、編碼偽影或佈局問題嘅機會。點擊「下載為TXT」以UTF-8編碼儲存純文字檔案。輸出檔名與來源PDF名稱相同,副檔名為.txt。你亦可以將全文複製到剪貼簿,直接貼上到其他應用程式中。
使用技巧與最佳實踐
從Word、Google Docs或LaTeX建立嘅數碼PDF嘅文字提取準確率接近完美(標準英文文字99%以上)。根據ISRI OCR準確率基準,乾淨300 DPI掃描版PDF嘅OCR達到95-98%準確率,但低解像度、歪斜或手寫文件會降至80-90%。
多欄PDF(常見於學術期刊同雜誌)存在佈局挑戰:文字提取從左到右、從上到下讀取,呢個意味住第1欄嘅第1行,然後係第2欄嘅第1行——產生混亂嘅輸出。使用進階設定中嘅「去欄」選項嘗試偵測欄位並按順序讀取。
從右到左(RTL)文字包括阿拉伯語、希伯來語、波斯語同烏爾都語,UTF-8輸出完全支援。提取嘅文字保持正確嘅字元順序,可以喺任何支援RTL嘅文字編輯器(Notepad++、VS Code、gedit)中開啟。
特殊字元同符號(數學符號、科學符號、貨幣符號)通常喺PDF使用Unicode字型時能夠完整提取。使用舊版PostScript Type 1字型或自訂編碼字型嘅PDF可能產生錯誤字元——「強制Unicode對應」選項可以解決約80%嘅此類情況。
OCR設定好重要:300 DPI嘅來源圖像產生最佳辨識效果。如果掃描版PDF以較低嘅有效解像度渲染文字(常見於150 DPI或以下嘅傳真品質掃描),OCR準確率預計下降5-15個百分點。喺辨識前使用「增強掃描」選項套用對比度銳化。
提取文字中嘅換行反映原始PDF佈局——段落會喺每行末尾斷開。使用「合併段落」選項智能地連接段落內嘅行,同時根據句子結尾標點同縮排分析保留有意嘅換行(標題、清單項、空行)。
對於大規模文字提取(例如處理100個以上PDF用於全文搜尋索引),工具喺工作階段中依次處理檔案。喺普通筆記型電腦上,數碼PDF嘅平均吞吐量大約為每分鐘30-50頁,OCR為每分鐘10-20頁。
UTF-8編碼支援意味住幾乎所有書寫系統嘅字元都能喺提取中保留。輸出可喺任何現代應用程式中使用——貼上到Excel、匯入數據庫、輸入NLP管線或喺程式碼編輯器中開啟。唔會出現字元損壞或"?"替換問題。
常見問題解答
從PDF提取文字彌合咗固定佈局文件與可編輯、可搜尋、可重用文字之間嘅差距。我哋嘅免費轉換器處理數碼版同掃描版PDF,支援100多種OCR語言,並提供乾淨嘅UTF-8輸出,而你嘅文件永遠唔會離開你嘅裝置。上載PDF,提取文字,喺幾秒鐘內開始使用。
免費試用此工具 →open_in_new