PDF sang văn bản

Đổi PDF quét hoặc kỹ thuật số thành văn bản đơn giản.

📄

Kéo và thả, hoặc dán một bức ảnh màn hình

Hình ảnh, PDF, Word (DOCX) hoặc văn bản - thả, lướt, dán, hoặc sử dụng URL

🔒 Tập tin của anh được xử lý riêng tư và tự động xóa.

OCR.chat trích xuất văn bản từ bất kỳ PDF nào, dù nó là xuất kỹ thuật số hay một đống trang quét. Tải lên một PDF nhiều trang và mỗi trang sẽ được xử lý và kết hợp thành một kết quả sạch, sẵn sàng sao chép. Các trang đã chứa một lớp văn bản thực sẽ được đọc ngay lập tức và không bị mất, trong khi các trang quét được chạy qua OCR tự động, vì vậy bạn luôn luôn có được văn bản chính xác nhất mà tập tin có thể cung cấp.

Bộ chuyển đổi PDF sang văn bản này được tạo ra cho những người làm việc với tài liệu dài: nhà nghiên cứu khai thác các tài liệu cũ, trợ lý luật sư chuyển tập tin trường hợp thành văn bản có thể tìm kiếm, và nhà phân tích lấy số liệu từ báo cáo quét. Nó đọc hơn 100 ngôn ngữ, hiển thị văn bản trích xuất bên cạnh trang gốc để xem xét, và không bao giờ dịch tiếng nước ngoài một cách im lặng, vì vậy một PDF đa ngôn ngữ xuất ra chính xác như nó đã đi vào.

Không cần đăng ký để thử nó, và bộ máy nhanh xử lý PDF in chuẩn miễn phí. Khi tài liệu có bảng, cột, hoặc chữ viết tay dày, bộ máy AI cao cấp cung cấp độ chính xác cao hơn. Tải xuống kết quả như văn bản đơn giản, Markdown, Word, CSV, hoặc JSON, và đảm bảo tập tin của bạn được xử lý cho OCR và sau đó tự động xóa.

Làm thế nào pdf sang văn bản

1
Tải lên PDF của bạn
Kéo vào một PDF đơn hoặc duyệt đến nó; tài liệu nhiều trang được hỗ trợ đầy đủ.
2
Chọn ngôn ngữ và bộ nhớ
Đặt với động cơ nhanh miễn phí cho các trang in, hoặc chuyển sang động cơ AI cao cấp cho quét, bảng và chữ viết tay; đặt một ngôn ngữ hoặc tự động phát hiện.
3
Để nó xếp trang
Các trang với một lớp văn bản thực sự được đọc ngay lập tức và không bị mất; các trang được quét được OCR ở độ phân giải cao, tất cả được sáp nhập vào một kết quả.
4
Xem lại và xuất
Kiểm tra văn bản đối với mỗi trang, sau đó sao chép hoặc tải về dạng TXT, Markdown, DOCX, CSV, hoặc JSON.

Dùng chung

  • Các nhà nghiên cứu trích xuất các đoạn và trích dẫn từ các bài báo và sách được quét.
  • Luật sư và trợ lý luật sư chuyển đổi các hồ sơ và hợp đồng scan thành văn bản có thể tìm kiếm.
  • Kế toán viên lấy số liệu và các mục từ báo cáo tài chính đã được quét.
  • Archivers digitizing historical records and out-of-print documents for preservation.
  • Người lao động văn phòng tái sử dụng nội dung từ PDF cũ mà không cần gõ lại trang sau trang.
  • Nhà báo tìm kiếm PDF chính phủ và tòa án dài cho tên và thuật ngữ cụ thể.

Câu hỏi thường gặp

Có. Mỗi trang đều được xử lý và kết quả được kết hợp thành một kết quả văn bản liên tục mà bạn có thể sao chép hoặc tải xuống.

Các trang chứa một lớp văn bản thực sẽ được trích xuất ngay lập tức và không mất gì, không cần OCR. Chỉ các trang đã quét mới được chạy qua OCR, điều này giữ chất lượng cao và tốc độ nhanh.

Bạn có thể thử miễn phí, với đo lường mỗi trang nơi mà tín dụng bằng với trang. Một tài khoản miễn phí thêm một thùng trang hàng tháng, và các kế hoạch trả tiền từ $5/ tháng thêm nhiều trang và xử lý hàng loạt cho các tài liệu lớn.

Hơn 100, bao gồm CJK, Ả Rập, Cyrillic, và chữ Ấn Độ. Từ ngoại ngữ được chuyển tự như được viết và không bao giờ tự động dịch.

Có. Các trang quét được raster hóa và OCR tự động; bộ máy AI cao cấp được khuyến nghị cho các bản quét mờ, bảng, hoặc chữ viết tay.

Tập tin của bạn chỉ được xử lý cho OCR và sau đó tự động xoá. Chúng tôi không bao giờ bán hay chia sẻ tài liệu của bạn.

Đúng. POST PDF của bạn vào /api/v1/ocr/ và nhận được văn bản kết hợp, tùy chọn xác định ngôn ngữ, cấp máy và định dạng xuất.

Đầu tiên gỡ mật khẩu hoặc mở khóa PDF trên thiết bị của bạn, sau đó tải lên. Khi tập tin được mở, chúng ta có thể đọc nó, nhưng không thể bỏ qua mã hóa trên tài liệu bị khóa.

Động cơ AI cao cấp hiểu cột và thứ tự đọc, vì vậy báo, tạp chí và bố cục hai cột xuất hiện trong trình tự đúng thay vì có các cột chạy cùng nhau.

Quá trình xử lý hàng loạt có sẵn trên các kế hoạch trả tiền, vì vậy bạn có thể xếp hàng nhiều PDF cùng một lúc. Ở cấp độ miễn phí, bạn tải lên một tài liệu mỗi lần.

Văn bản đơn giản (TXT), Markdown, Word (DOCX), PDF tìm kiếm, CSV, và JSON. Một PDF tìm kiếm giữ hình ảnh trang gốc với một lớp văn bản ẩn, có thể chọn được thêm vào trên.

Không. Tải lên của bạn sẽ không bị ảnh hưởng và văn bản được trích xuất sẽ được gửi như một kết quả riêng biệt, vì vậy tập tin nguồn sẽ không bao giờ được sửa đổi.

Dùng nó qua API

Chạy công cụ này theo lập trình với một POST duy nhất. Xác thực với token API từ trang tài khoản của bạn.

curl -X POST https://ocr.chat/api/v1/ocr/ \
  -H "Authorization: Bearer YOUR_API_TOKEN" \
  -F "file=@your-file.pdf" \
  -F "tool=pdf-to-text"

Tập tin có 5 trang hoặc ít hơn trả về kết quả trong dòng; nếu không thì hỏi công việc, sau đó tải về nó như txt:

curl -L "https://ocr.chat/api/v1/ocr/JOB_UUID/download/?format=txt" \
  -H "Authorization: Bearer YOUR_API_TOKEN" -o result.txt
Đọc tài liệu API →
Đánh giá trang này
5.0/5 (0)

Chúng tôi có thể cải thiện gì? phản hồi của bạn giúp chúng tôi khắc phục vấn đề.