对整份扫描版 PDF 逐页做 OCR,提取可编辑文字,支持中英文混合识别
这是浏览器端运行的 PDF 全文 OCR 工具,专门提取扫描版 PDF 里的不可选文字,转换成可直接复制编辑的文本。
它调用浏览器端本地 OCR 识别模型,逐页处理扫描页内容,支持中英文混合内容自动识别,所有处理都在本地完成。
不建议处理文字版 PDF。本工具针对扫描版 PDF 设计,文字版 PDF 可直接复制文本,不需要 OCR。
建议处理 100 页以内的文件。页数过多会占用过多浏览器内存,容易出现识别卡顿问题。
准确率和原扫描件清晰度正相关。清晰平整的扫描件识别准确率可达 95%以上,模糊倾斜的稿件准确率会下降。
当前仅支持中英文识别。模型默认只加载中英文训练数据,暂不支持日语、韩语等其他语言内容识别。