资讯中心

20ms把PDF变Markdown:开源OCR It

最近由Y Combinator支持的团队推出了一款名为OCR It的开源OCR工具,号称能在约20ms内将不可复制的PDF文字提取并转换为清晰的Markdown,方便后续交给AI进行阅读与处理。该工具内置Tesseract,标称可100%离线运行,而且在速度上声称比Docling快近300倍,因此在GitHub上迅速引发关注。

OCR It以Chrome和Firefox插件形式提供,使用方式分为手动档和自动档两种。手动档的基本流程是:先按Option+Shift+R框选需要识别的区域(Windows/Linux上将Option替换为Alt),按Enter保存,然后按Option+Shift+S开始识别并自动翻到下一页;重复此操作直至整本文档完成。也可以在翻页的同时每页按一次识别键,插件会即时截图并在后台排队处理。识别完后可在插件面板中检查或修改文本,支持“复制全部”或“下载.txt”导出。

自动档只需按Option+Shift+A或点击Start auto-run,插件会循环执行“截图—OCR—翻页”直至结束,按ESC可中途取消。为避免无限抓取,OCR It在连续检测到两张相同页面、无法翻页、OCR失败或达到300页上限时会自动停止。目前浏览器自带的PDF阅读器尚不支持自动翻页,遇此类文档建议使用手动档。 球友会

关于权限与隐私,OCR It无需API Key或联网,安装时也不要求广泛的网站权限;仅在启用自动运行或处理跨域iframe时按需申请当前站点权限。由于它是开源项目,用户可在本地离线使用并审查代码。

不过目前工具也有局限:对版式简单、文字清晰的PDF效果很好,但在处理标题与正文混排、脚注、表格、数学公式等复杂页面时仍不稳定,需要进一步优化。总体来看这是一个在速度和易用性上都很有吸引力的开端,期待后续改进并鼓励用户实际测试并反馈体验。