テーブル抽出

画像やPDFからCSV/Excelにテーブルを引き出す。

✨ プレミアムAIエンジン
🔒 これはプレミアム AI ツールです。使用するには無料アカウントを作成してください。 無料で登録 ログイン
📊

スクリーンショットをドラッグ&ドロップまたは貼り付け

画像、PDF、Word (DOCX) またはテキスト - ドラッグ、ブラウズ、貼り付け、URLを使用

🔒 ファイルは 個人的に処理され 自動的に削除されます

PDFや画像ファイルから表を抽出し、テキストの配列が間違っている壁の代わりに、実際の構造化されたデータを取り戻します。OCR.chatは、プレミアムAIエンジンでページ上の各表を検出し、それを正しいCSVまたはMarkdown表としてエクスポートします。列と行は、元のように配列されています。

これは、会計士が報告書を再構築する、アナリストがレポートから数字を引出す、研究者が論文からデータを収集する、オペレーションチームが印刷されたフォームをデジタル化するなど、文書から数字をスプレッドシートに入れる必要がある人に向けたツールです。手で行を再入力する代わりに、ファイルをアップロードして、Excel、Numbers、Google Sheetsで開くことができるCSVファイルをダウンロードします。

表抽出はプレミアムAIの階層で実行されるため、OCR.chatは境界付きと境界なしの表、多列レイアウト、マージヘッダを扱い、セルを無音で落とすことはありません。検出された表を原稿の隣に見て、低信頼度値をフラグで示します。ダウンロードしたスプレッドシートは、実際に信頼できるものです。

どうやって テーブル抽出

1
テーブルを含むファイルをアップロード
PDF ファイルや画像をドラッグして入力するか、キャプチャしたい表のスクリーンショットを貼り付けます。
2
テーブルを検出
プレミアムAIエンジンはページ上の各表を見つけ,その行,列,ヘッダを再構築する。
3
構造化された結果をチェック
再構築した表を元の表と並べて見てみてください。不確実なセルはすぐに見るためにフラグを付けてください。
4
CSV または Markdown にエクスポート
Excel、Numbers、Google Spreadsheets で開くための CSV ファイルをダウンロードし、または文書やメモのために Markdown テーブルをコピーします。

一般的な用途

  • 財務諸表とレポートから会計と簿記のためのスプレッドシートに数字を引き出す。
  • 印刷されたフォーム、ログ、および資産シートをすべての行を再タイプすることなくCSVにデジタル化します。
  • 研究論文やPDFからデータテーブルを収集し、Excel、Sheets、pandasで分析する。
  • 価格表,カタログ,料金カードを構造化データに変換し,他のシステムにインポートする。
  • スキャンした請求書とオーダー表を合計し調整できる行に変換します。
  • 画像から測量結果と実験データをCSVに収集し,処理する。

よくある質問

プレミアム AI エンジンは表に構築され、ヘッダを含む列と行を信頼性の高い順序で並べます。検出された各表は、エクスポートする前に修正できるように、低信頼性セルをフラグで表示して、元の表の隣に表示されます。

実際のCSVをスプレッドシートに、または文書やメモのためのMarkdownテーブルにエクスポートできます。CSVはExcel、Numbers、Google Sheetsで直接開きます。プログラミング用のJSONも利用できます。

列は並べられています。このツールは単純テキストの間隔を変更する代わりに、本物の表構造をエクスポートします。セルは正しい行と列に落ちます。何も無音で落ちません。

はい。複数ページの PDF はページごとに処理され、各ページからの表は抽出されます。長い表はページごとに分割され、スプレッドシートに積み重ねる連続行として表示されます。

両方とも AIエンジンは構造によって表を検出します。 完全に境界を持つ表、境界を持たない表、間隔で一緒に保たれている表、合併したヘッダまたは多行ヘッダを持つ表を捕捉します。

PDFやPNG、JPG、WEBP、GIF、BMP、TIFF画像を100以上の言語でアップロードします。数字、記号、外国語テキストは書かれたとおりに正確に転写され、自動翻訳はありません。

AI エンジンはマージされたセルを認識し、関係のないセルにスミレーションする代わりに、スパンする行や列に値を結びつけて保持します。検出されたレイアウトは元のレイアウトの隣に表示され、スパンヘッダやグループ化された行が予想した場所に着いたことを確認できます。

数値は小数点、千分割符号、通貨記号、負の数を含めて、表示される通りに正確に転写されます。CSV はこれらを忠実に保存しますので、スプレッドシートは数値として読み取ります。ツールは数値を再形式化または丸めません。

ページ上の各表はそれぞれ独立して検出される。 2つまたは3つの異なる表を含むシートは、1つのグリッドにマッシュされる代わりに、個々にエクスポートできる別々の構造化結果として返されます。

はい、大きく、多数のファイルを扱う作業はバックグラウンドで実行され、月額5ドルからの有料プランは、PDFや画像のスタックをキューに並べて、CSVを一つずつ集める代わりに、バッチ処理を含む。

REST API は有料プランで利用できます。ファイルを POST して、自分のスクリプトやパイプラインから構造化された CSV または JSON を返すことができます。クレジットは、Web アプリケーションと同様にページで計算されます。

テーブル抽出はAIのプレミアムレベルで、無料で試用できます。有料プランは月額5ドルからで、ページ数、バッチ処理、APIアクセスを追加します。ファイルはOCRのみ処理され、その後自動的に削除され、販売や共有はしません。

API を通してこれを使う

このツールをプログラム的に実行します。一つの POST で実行します。アカウントページから API トークンで認証します。

curl -X POST https://ocr.chat/api/v1/ocr/ \
  -H "Authorization: Bearer YOUR_API_TOKEN" \
  -F "file=@your-file.png" \
  -F "tool=extract-tables"

5 ページ以下のファイルはインラインで結果を返します。それ以外の場合はジョブをポールし、次にダウンロードします。 csv:

curl -L "https://ocr.chat/api/v1/ocr/JOB_UUID/download/?format=csv" \
  -H "Authorization: Bearer YOUR_API_TOKEN" -o result.csv
API ドキュメントを読む →
このページを評価
5.0/5 (0)

改善できることは何ですか?フィードバックは問題を解決するのに役立ちます。