PDF 到文本的 PDF
将扫描或数字PDF转换成纯文本。
拖放,或粘贴一个截图
图像、 PDF、 Word (DOCX) 或文本 - 投放、浏览、粘贴或使用 URL
🔒 您的文档是私下处理并自动删除的。
OCR.chat 从任何 PDF 中提取文本, 无论是数字导出还是一堆扫描页。 上传多页 PDF 和每页都经过处理并合并成一个干净的、 副本备好的结果。 已经包含真实文本层的页面会立即和无损地阅读, 而扫描页会自动通过 OCR 运行, 这样您总是能得到文件所能提供的最准确的文本 。
用于长文件工作的人可以使用这种PDF转换器:研究人员挖掘旧文件,律师助理将案件文件转换成可搜索文本,分析员从扫描报告中提取数字。 它读了100多种语言,在原始页面旁展示了供审查的摘录文本,从不默默翻译外语,因此多语言PDF的出场完全如其行进。
不需要注册来尝试它, 快速引擎可以免费处理标准打印的 PDF 。 当文档有密桌、 列或笔迹时, 高级 AI 引擎会提供更高的准确性 。 下载结果时用纯文本、 马克唐、 Word、 CSV 或 JSON, 并且您可以放心您的文件会被处理为 OCR, 然后自动删除 。
如何 pdf 到文本的 pdf
1
上传您的 PDF
拖动单个 PDF 中或浏览到它; 完全支持多页文档。
2
选择引擎和语言
打印页面使用免费快速引擎, 或切换到用于扫描、 表格和笔迹的高级 AI 引擎; 设置语言或自动检测 。
3
让它整理页面
具有真实文字层的页面立即和无损阅读;扫描页面为OCR'd高分辨率,全部合并成一个结果。
4
审查和出口
检查每页的文本,然后复制或下载为TXT、Markdown、DOCX、CSV或JSON。
通用用途
- 研究人员从扫描日记文章和书籍中提取段落和引文。
- 律师和律师助理将扫描案卷和合同转换成可搜索文本。
- 会计师从扫描财务报表中提取数字和细列项目。
- 将历史记录和印刷外文件数字化保存。
- 办公室工作人员在不按页重排页面时重复使用旧PDF内容。
- 记者长期在政府和法院寻找具体姓名和术语。
经常问到的问题
是的。每页都经过处理,结果被合并成一个连续的文本输出,您可以复制或下载。
包含真实文本层的页面会立即和无损地被提取,不需要OCR。只有扫描页会通过OCR运行,这样质量会保持高速度。
您可以免费尝试, 以每页的计算方式计算, 信用额等于页面。 自由账户会增加每月一页的纸桶, 每月5美元就可以支付计划, 并增加更多页数和批量处理大文件。
包括 CJK 、 阿拉伯语、 西里尔语和印度语脚本在内的100多部文字。 外国文字被抄写成书面文字, 从未自动翻译过 。
是的,扫描的页面被清空,并自动进行OCR'd;推荐用于微弱扫描、表格或笔迹的加价AI引擎。
您的文件仅被处理为 OCR, 然后自动删除。 我们从不出售或共享您的文件 。
是。 POST 您的 PDF 到 /api/ v1/ocr/ 并接收合并文本, 并可以选择指定语言、 引擎级别和输出格式 。
删除密码或先打开设备上的 PDF 密码,然后上传。打开文件后,我们可以读取,但我们不能绕过锁定文档上的加密。
高价AI引擎能理解列和阅读顺序, 因此报纸、日记和两栏布局 以正确的顺序出现, 而不是让列一起运行。
批处理可在付费计划中进行, 这样您就可以将多个 PDF 排队一次。 在免费级别上, 您一次上传一个文档 。
普通文本( TXT)、 标记、 Word( DOCX)、 可搜索的 PDF、 CSV 和 JSON 。 可搜索的 PDF 将原始页面图像保留在上方, 并添加一个隐藏的可选择文本层 。
否。您的上传未被移动,提取的文本作为单独的结果交付,因此源文件从未修改。
通过 API 使用此功能
程序运行此工具时使用一个 POST 。 验证时使用账户页面上的 API 符号 。
curl -X POST https://ocr.chat/api/v1/ocr/ \
-H "Authorization: Bearer YOUR_API_TOKEN" \
-F "file=@your-file.pdf" \
-F "tool=pdf-to-text"
5页以下的文件, 5页以下的文件返回结果内线; 否则对任务进行民意调查, 然后按 txt:
curl -L "https://ocr.chat/api/v1/ocr/JOB_UUID/download/?format=txt" \
-H "Authorization: Bearer YOUR_API_TOKEN" -o result.txt
读取 API 文档 →