PDFからMarkdownへ
文書をRAGやLLMのためのクリーンなMarkdownに変換します。
PDFをMarkdownに変換します。PDFを長いテキスト文字列に平らにするのではなく、文書の構造を保つことができます。OCR.chatは、プレミアムAIエンジンで各ページを読み、ヘッダ、ブースター、番号付きリスト、表、読み順をMarkdownがサポートされている場所で使用できる清潔でレイアウトに注意したMarkdownとして再構築します。
このツールは、LLMやRAGパイプラインに文書を送信する人に向けて作られたもので、モデルが実際に推論するのは構造です。レポート、マニュアル、契約、研究論文を Obsidian、Notion、静的サイトリポジトリのようなノートアプリケーションに移動するのにも、スキャンしたハンドアウトを編集可能な Markdown に変換するのにも、同様に役立ちます。
OCR.chatは登録なしで無料で試用できます。PDF to MarkdownはプレミアムAI層で動作しますので、複雑なレイアウト、多列ページ、埋め込みテーブルはスクラムされる代わりに無傷で通過します。認識されたMarkdownは、低信頼度のスポットがフラグ付きで、オリジナルページの隣に表示されます。コピーしたものがモデルやノートに到達する前に信頼できるようになります。
どうやって pdfからmarkdownへ
一般的な用途
- RAGとLLMの文書作成において,ヘッダとリストがモデルに必要な構造を与え,正確に検索と推論を行う。
- 概要を失わずにレポート、マニュアル、PDFを Obsidian や Notion のようなノートアプリに移行します。
- スキャンした研究論文や記事を引用、注釈、再書き込みのためのクリーンな Markdown に変換します。
- 静的サイト生成器やドキュメントリポジトリのために製品ドキュメントと内部ウィキを Markdown に変換します。
- 契約書やポリシーから構造化テキストを抽出し,法律およびコンプライアンスチームが検索して引用できるようにする。
- 印刷されたハンドアウトやワークシートを編集可能なMarkdownにデジタル化し,授業資料や勉強ノートとして使用する。
よくある質問
API を通してこれを使う
このツールをプログラム的に実行します。一つの POST で実行します。アカウントページから API トークンで認証します。
curl -X POST https://ocr.chat/api/v1/ocr/ \
-H "Authorization: Bearer YOUR_API_TOKEN" \
-F "file=@your-file.png" \
-F "tool=pdf-to-markdown"
5 ページ以下のファイルはインラインで結果を返します。それ以外の場合はジョブをポールし、次にダウンロードします。 md:
curl -L "https://ocr.chat/api/v1/ocr/JOB_UUID/download/?format=md" \
-H "Authorization: Bearer YOUR_API_TOKEN" -o result.md
API ドキュメントを読む →