提取PDF文本保留标题、列表、表格结构,输出可编辑 Markdown
这是浏览器端的 PDF 转 Markdown 工具。能提取PDF文本,自动识别标题、列表、表格结构,不丢失排版,直接得到可编辑的 Markdown 文本。
基于 PDF.js 提取文本内容,通过规则匹配识别排版层级,还原文档结构。所有处理都在浏览器本地完成,不会上传 PDF 文件内容。
单文件不超过 30 MB,页数不超过 100 页。文件过大会导致浏览器运行卡顿,转换失败。
不能识别扫描版PDF。本工具只支持文字可复制的原生电子PDF,扫描图需要先做OCR识别。
多数简单表格格式可以正确还原。复杂合并单元格表格,可能会出现格式错乱,需要手动调整。
本工具不提取PDF内的图片,只提取和转换文本内容。