给扫描版 PDF 做 OCR 识别,支持全文搜索定位关键词
扫描版 PDF 无法检索文字,你没法快速定位内容。这个工具先做 OCR 识别提取文字,再支持全文搜索关键词,直接定位到对应页面。
使用 Tesseract.js 开源 OCR 引擎,支持多语言文字识别,所有处理都在浏览器本地完成,识别后搜索结果直接在原 PDF 高亮标注。
最大支持 100 页的扫描 PDF。页数太多会导致浏览器本地处理卡顿,建议拆分后分次使用。
支持识别简体中文、英文等 20 余种语言。默认自动识别语言,也可以手动指定识别语言提升准确率。
清晰扫描件准确率在 95% 以上。模糊、倾斜、手写的扫描件识别准确率会明显下降,不建议使用。
暂不支持导出可检索 PDF,仅支持在工具内搜索定位。后续会添加导出功能。