テーブル抽出
画像やPDFからCSV/Excelにテーブルを引き出す。
PDFや画像ファイルから表を抽出し、テキストの配列が間違っている壁の代わりに、実際の構造化されたデータを取り戻します。OCR.chatは、プレミアムAIエンジンでページ上の各表を検出し、それを正しいCSVまたはMarkdown表としてエクスポートします。列と行は、元のように配列されています。
これは、会計士が報告書を再構築する、アナリストがレポートから数字を引出す、研究者が論文からデータを収集する、オペレーションチームが印刷されたフォームをデジタル化するなど、文書から数字をスプレッドシートに入れる必要がある人に向けたツールです。手で行を再入力する代わりに、ファイルをアップロードして、Excel、Numbers、Google Sheetsで開くことができるCSVファイルをダウンロードします。
表抽出はプレミアムAIの階層で実行されるため、OCR.chatは境界付きと境界なしの表、多列レイアウト、マージヘッダを扱い、セルを無音で落とすことはありません。検出された表を原稿の隣に見て、低信頼度値をフラグで示します。ダウンロードしたスプレッドシートは、実際に信頼できるものです。
どうやって テーブル抽出
1
テーブルを含むファイルをアップロード
PDF ファイルや画像をドラッグして入力するか、キャプチャしたい表のスクリーンショットを貼り付けます。
2
テーブルを検出
プレミアムAIエンジンはページ上の各表を見つけ,その行,列,ヘッダを再構築する。
3
構造化された結果をチェック
再構築した表を元の表と並べて見てみてください。不確実なセルはすぐに見るためにフラグを付けてください。
4
CSV または Markdown にエクスポート
Excel、Numbers、Google Spreadsheets で開くための CSV ファイルをダウンロードし、または文書やメモのために Markdown テーブルをコピーします。
一般的な用途
- 財務諸表とレポートから会計と簿記のためのスプレッドシートに数字を引き出す。
- 印刷されたフォーム、ログ、および資産シートをすべての行を再タイプすることなくCSVにデジタル化します。
- 研究論文やPDFからデータテーブルを収集し、Excel、Sheets、pandasで分析する。
- 価格表,カタログ,料金カードを構造化データに変換し,他のシステムにインポートする。
- スキャンした請求書とオーダー表を合計し調整できる行に変換します。
- 画像から測量結果と実験データをCSVに収集し,処理する。
よくある質問
プレミアム AI エンジンは表に構築され、ヘッダを含む列と行を信頼性の高い順序で並べます。検出された各表は、エクスポートする前に修正できるように、低信頼性セルをフラグで表示して、元の表の隣に表示されます。
実際のCSVをスプレッドシートに、または文書やメモのためのMarkdownテーブルにエクスポートできます。CSVはExcel、Numbers、Google Sheetsで直接開きます。プログラミング用のJSONも利用できます。
列は並べられています。このツールは単純テキストの間隔を変更する代わりに、本物の表構造をエクスポートします。セルは正しい行と列に落ちます。何も無音で落ちません。
はい。複数ページの PDF はページごとに処理され、各ページからの表は抽出されます。長い表はページごとに分割され、スプレッドシートに積み重ねる連続行として表示されます。
両方とも AIエンジンは構造によって表を検出します。 完全に境界を持つ表、境界を持たない表、間隔で一緒に保たれている表、合併したヘッダまたは多行ヘッダを持つ表を捕捉します。
PDFやPNG、JPG、WEBP、GIF、BMP、TIFF画像を100以上の言語でアップロードします。数字、記号、外国語テキストは書かれたとおりに正確に転写され、自動翻訳はありません。
AI エンジンはマージされたセルを認識し、関係のないセルにスミレーションする代わりに、スパンする行や列に値を結びつけて保持します。検出されたレイアウトは元のレイアウトの隣に表示され、スパンヘッダやグループ化された行が予想した場所に着いたことを確認できます。
数値は小数点、千分割符号、通貨記号、負の数を含めて、表示される通りに正確に転写されます。CSV はこれらを忠実に保存しますので、スプレッドシートは数値として読み取ります。ツールは数値を再形式化または丸めません。
ページ上の各表はそれぞれ独立して検出される。 2つまたは3つの異なる表を含むシートは、1つのグリッドにマッシュされる代わりに、個々にエクスポートできる別々の構造化結果として返されます。
はい、大きく、多数のファイルを扱う作業はバックグラウンドで実行され、月額5ドルからの有料プランは、PDFや画像のスタックをキューに並べて、CSVを一つずつ集める代わりに、バッチ処理を含む。
REST API は有料プランで利用できます。ファイルを POST して、自分のスクリプトやパイプラインから構造化された CSV または JSON を返すことができます。クレジットは、Web アプリケーションと同様にページで計算されます。
テーブル抽出はAIのプレミアムレベルで、無料で試用できます。有料プランは月額5ドルからで、ページ数、バッチ処理、APIアクセスを追加します。ファイルはOCRのみ処理され、その後自動的に削除され、販売や共有はしません。
API を通してこれを使う
このツールをプログラム的に実行します。一つの POST で実行します。アカウントページから API トークンで認証します。
curl -X POST https://ocr.chat/api/v1/ocr/ \
-H "Authorization: Bearer YOUR_API_TOKEN" \
-F "file=@your-file.png" \
-F "tool=extract-tables"
5 ページ以下のファイルはインラインで結果を返します。それ以外の場合はジョブをポールし、次にダウンロードします。 csv:
curl -L "https://ocr.chat/api/v1/ocr/JOB_UUID/download/?format=csv" \
-H "Authorization: Bearer YOUR_API_TOKEN" -o result.csv
API ドキュメントを読む →