PDFからテキストを抽出する方法:デジタルvsスキャン、エンコーディング、レイアウト
PDFからテキストを抽出するのは簡単に聞こえます——しかし実際にはページの写真に過ぎないスキャン文書や、コピーペーストすると文章が乱れる2段組の学術論文、文字順序が乱れる右から左へのアラビア語PDFに遭遇するまでは。PDFはテキストを根本的に異なる2つの方法で保存します:デジタル(ネイティブデジタル)PDFはフォントエンコーディングと位置データを持つ実際のテキストオブジェクトを含み、スキャンPDFはテキストの画像のみを含み、抽出には光学文字認識(OCR)が必要です。当社の無料PDFテキスト変換ツールは両方のタイプを処理します:フォントデコードとコンテンツストリーム解析を使用してデジタルPDFから直接テキストを抽出し、スキャンPDFにはWebAssemblyにコンパイルされたTesseract.jsを使用した組み込みOCRを適用します。出力はプレーンUTF-8テキスト——クリーンで検索可能、あらゆるテキストエディタ、ワードプロセッサ、データパイプラインで使用可能です。すべての処理はブラウザ内で実行されるため、法的文書、医療記録、財務諸表などの機密文書がデバイスから離れることは決してありません。
PDFからテキスト抽出
無料 · 登録不要
ステップバイステップガイド
PDFをアップロード
PDF(最大30 MB)をアップロードエリアにドラッグ&ドロップします。ツールはPDF構造を分析します:埋め込みテキストオブジェクトを検出した場合は直接抽出を進めます。PDFが画像のみを含む場合(スキャン文書)、自動的にOCRモードを有効にし、最適な認識精度のために文書言語の選択を促します——OCRエンジンは英語、スペイン語、中国語、アラビア語、ヒンディー語を含む100以上の言語をサポートしています。
テキストを抽出
「テキストを抽出」をクリックして処理を開始します。埋め込みテキストを含むデジタルPDFの場合、抽出はほぼ瞬時です——50ページのテキストPDFは1〜3秒で処理されます。OCRを使用するスキャンPDFの場合、処理時間はページ数、画像解像度、言語の複雑さに応じて変わります:200 DPIの10ページの英語スキャンは約15〜30秒かかります。進行状況インジケーターが現在処理中のページを表示します。抽出されたテキストは編集可能なプレビューパネルに表示されます。
確認してダウンロード
プレビューパネルで抽出されたテキストを確認します——これは保存前にOCRエラー、エンコーディングアーティファクト、レイアウトの問題を見つけて修正する機会です。「TXTとしてダウンロード」をクリックして、UTF-8エンコーディングのプレーンテキストファイルを保存します。出力ファイル名はソースPDF名に.txt拡張子が付きます。全文をクリップボードにコピーして、別のアプリケーションに直接貼り付けることもできます。
ヒントとベストプラクティス
Word、Google Docs、LaTeXから作成されたデジタルPDFは、ほぼ完璧なテキスト抽出精度を生成します(標準英語テキストで99%以上)。スキャンPDFのOCRは、クリーンな300 DPIスキャンで95〜98%の精度を達成しますが、ISRI OCR精度ベンチマークによると、低解像度、傾き、手書き文書では80〜90%に低下します。
複数カラムPDF(学術雑誌や雑誌で一般的)はレイアウトの課題があります:テキスト抽出は左から右、上から下に読み取るため、カラムAの1行目、次にカラムBの1行目——混乱した出力を生成します。詳細設定の「カラム解除」オプションを使用して、カラム検出と順次読み取り順序を試みます。
アラビア語、ヘブライ語、ペルシア語、ウルドゥー語を含む右から左(RTL)スクリプトは、UTF-8出力で完全にサポートされています。抽出されたテキストは正しい文字順序を保持し、任意のRTL対応テキストエディタ(Notepad++、VS Code、gedit)で開くことができます。
特殊文字と記号(数学記法、科学記号、通貨記号)は、PDFがUnicodeフォントを使用している場合、通常そのまま抽出されます。レガシーPostScript Type 1フォントやカスタムエンコードフォントを使用するPDFは誤った文字を生成する可能性があります——「Unicodeマッピングを強制」オプションでこれらのケースの約80%が解決されます。
OCR設定は重要です:300 DPIのソース画像が最高の認識を生み出します。スキャンPDFが低い実効解像度でテキストをレンダリングする場合(150 DPI以下のFAX品質スキャンで一般的)、OCR精度が5〜15パーセントポイント低下することが予想されます。認識前に「スキャン強調」オプションでコントラスト鮮明化を適用します。
抽出されたテキストの改行は元のPDFレイアウトを反映します——段落は各行末で区切られます。「段落を結合」オプションを使用して、末尾句読点とインデント分析に基づいて意図的な区切り(見出し、リスト項目、空白行)を保持しながら、段落内の行をインテリジェントに結合します。
大規模なテキスト抽出(例:全文検索インデックス用に100以上のPDFを処理)の場合、ツールはセッション内でファイルを順次処理します。最新のラップトップでの平均スループットは、デジタルPDFで毎分約30〜50ページ、OCRで毎分10〜20ページです。
UTF-8エンコーディングサポートにより、実質的にすべての書記体系の文字が抽出で保持されます。出力はあらゆる最新アプリケーションで使用可能です——Excelに貼り付け、データベースにインポート、NLPパイプラインに投入、コードエディタで開く。文字化けや「?」置換の問題はありません。
よくある質問
PDFからのテキスト抽出は、固定レイアウト文書と編集可能、検索可能、再利用可能なテキストの間のギャップを埋めます。当社の無料変換ツールはデジタルPDFとスキャンPDFの両方を処理し、100以上のOCR言語をサポートし、文書がデバイスから離れることなくクリーンなUTF-8出力を提供します。PDFをアップロードし、テキストを抽出して、数秒で作業を開始できます。
このツールを無料で試す →open_in_new