OCR 指南
PDF 转 MarkdownPDF OCROCR教程

如何把扫描 PDF 转成 Markdown

介绍如何从图片型 PDF 中提取结构化文字、表格和公式,并在继续编辑前检查结果。

OmniOCR Team

扫描 PDF 看起来像普通文档,实际内容通常是一张张图片。你可以阅读,却很难选择、搜索或编辑其中的文字。OCR 可以把这些内容整理成结构化 Markdown 草稿。

使用图片型 PDF

先准备包含清晰扫描页或页面图片的 PDF。当前 OmniOCR 单个文件上限是 10 MB。低分辨率页面、特殊字体和密集表格在识别后可能需要额外检查。

从 PDF 提取 Markdown

  1. 打开 PDF 转 Markdown 工作区
  2. 上传扫描 PDF。
  3. 对照原文件检查文字、表格、公式和 Markdown 视图。

Markdown 视图适合把文档内容放进笔记、草稿和知识库。它是可编辑文字结果,当前不会生成新的可搜索 PDF 文件。

发布前检查文档结构

重点检查标题、段落顺序、分页、数字和公式。表格需要单独核对,因为窄列和合并单元格可能影响阅读顺序。修改 Markdown 时保留原始 PDF 作为对照。

OmniOCR 应用数据库不会保存源 PDF 或识别文本,文件会发送给 OCR 供应商完成处理。最近结果文字会保存在当前浏览器,方便继续对照。

通用限制可以查看 PDF OCR 方案页,输出流程可以查看 PDF 转 Markdown 页面