PDF からテキスト

スキャンしたまたはデジタルのPDFをプレーンテキストに変換します。

📄

スクリーンショットをドラッグ&ドロップまたは貼り付け

画像、PDF、Word (DOCX) またはテキスト - ドラッグ、ブラウズ、貼り付け、URLを使用

🔒 ファイルは 個人的に処理され 自動的に削除されます

OCR.chat は PDF からテキストを抽出します。デジタルエクスポートかスキャンしたページの積み重ねかに関わらず。複数ページの PDF をアップロードすると、すべてのページが処理され、コピー可能な結果に結合されます。既に実際のテキストレイヤーを含むページは、即座に損失なしに読み込まれ、スキャンしたページは自動的に OCR を実行します。それによって、ファイルが提供する最も正確なテキストを常に得ることができます。

このPDFからテキストへの変換は、長い文書を扱う人々のために作られました。研究者は古い論文を掘り出し、法律相談者は事件ファイルを検索可能なテキストに変換し、分析者はスキャンしたレポートから数字を引出します。100 以上の言語を読み込み、抽出されたテキストを原稿のページの隣に表示して、検討を行います。外国語の単語を無音で翻訳しません。多言語のPDFは入力したとおりに出力されます。

登録は必要ありません。高速なエンジンは標準的な印刷された PDF を無料で扱います。文書に濃い表、列、手書きが含まれている場合、プレミアム AI エンジンはより高い精度を提供します。結果をプレーンテキスト、Markdown、Word、CSV、JSON としてダウンロードしてください。ファイルは OCR のために処理され、その後自動的に削除されます。

どうやって pdf からテキスト

1
PDF をアップロード
単一のPDFをドラッグして入力したり、ブラウズして入力したりできます。多ページ文書は完全にサポートされています。
2
エンジンと言語を選択
印刷ページのためのフリーの高速エンジンを使うか、スキャン、表、手書きのためのプレミアムAIエンジンに切り替え、言語を設定したり自動検出を行う。
3
ページをソートさせる
実際のテキスト層を持つページは即座に損失なしに読み取られ,スキャンされたページは高解像度でOCRされ,すべて一つの結果に合わせる。
4
検証とエクスポート
テキストを各ページに対してチェックし、コピーしたり、TXT、Markdown、DOCX、CSV、JSONとしてダウンロードしたりします。

一般的な用途

  • 研究者はスキャンした論文や本から文章や引用を抽出する。
  • 弁護士と法律助手が スキャンした事件ファイルと契約を検索可能なテキストに変換する
  • 会計士がスキャンした財務諸表から 数字と行の項目を引く
  • 歴史記録や廃刊文書を保存のためにデジタル化する記録者。
  • 従来のPDFファイルのコンテンツを再利用するためのソフトウェアである。
  • ジャーナリストが政府や裁判所のPDFを 特定の名前や用語で探してる

よくある質問

はい。すべてのページを処理し、結果をコピーまたはダウンロードできる連続テキスト出力に統合します。

実際のテキストレイヤーを含むページは、OCR を必要としないで、即座に損失なしに抽出されます。スキャンされたページのみが OCR を実行します。これは、高品質で高速を保つためです。

無料アカウントは月々のページバケットを追加し、有料プランは$5/月から追加ページと大文書のバッチ処理を追加します。

100以上の文字をサポートします。CJK、アラビア文字、キリル文字、インド文字を含みます。外国語の単語は書かれた通りに転写され、自動翻訳はありません。

はい。スキャンしたページは自動的にラスター化され、OCRされます。薄いスキャン、表、手書きにはプレミアム AI エンジンを推奨します。

ファイルは OCR のみ処理され、その後自動的に削除されます。文書を販売したり共有したりはしません。

はい。PDFを /api/v1/ocr/に POST して、 言語、エンジン階層、出力フォーマットを選択的に指定して、 合成テキストを受け取ります。

まずデバイス上の PDF をパスワードを取り除いたりロック解除した後にアップロードします。ファイルが開いたら、読み込めますが、ロックされた文書の暗号化はバイパスできません。

プレミアムAIエンジンはコラムと読み順を理解し,新聞,雑誌,二列レイアウトはコラムを一緒に走らせる代わりに正しい順序で出力される。

無料プランでは、一度に一つの文書をアップロードします。

単純テキスト (TXT)、Markdown、Word (DOCX)、検索可能な PDF、CSV、JSON。検索可能な PDF は、元のページ画像を保持し、上に隠し、選択可能なテキストレイヤーを追加します。

アップロードしたファイルは変更されません。抽出されたテキストは別の結果として提供されます。ソースファイルは変更されません。

API を通してこれを使う

このツールをプログラム的に実行します。一つの POST で実行します。アカウントページから API トークンで認証します。

curl -X POST https://ocr.chat/api/v1/ocr/ \
  -H "Authorization: Bearer YOUR_API_TOKEN" \
  -F "file=@your-file.pdf" \
  -F "tool=pdf-to-text"

5 ページ以下のファイルはインラインで結果を返します。それ以外の場合はジョブをポールし、次にダウンロードします。 txt:

curl -L "https://ocr.chat/api/v1/ocr/JOB_UUID/download/?format=txt" \
  -H "Authorization: Bearer YOUR_API_TOKEN" -o result.txt
API ドキュメントを読む →
このページを評価
5.0/5 (0)

改善できることは何ですか?フィードバックは問題を解決するのに役立ちます。