Firecrawl团队开源OCR It:20ms极速转换PDF为Markdown,速度超越Docling近300倍
2026/08/29 20:26阅读量 5
Y Combinator孵化的Firecrawl团队发布开源OCR工具OCR It,可在20ms内将不可复制的PDF转换为Markdown格式,处理速度比同类工具Docling快近300倍。该工具作为Chrome/Firefox插件运行,支持离线使用,无需联网或API Key。目前主要适用于版式简单的文档,对复杂排版(如表格、公式)的处理能力仍有提升空间。
事件概述
Y Combinator孵化的明星项目Firecrawl团队近期发布了名为OCR It的开源OCR工具。该工具旨在解决PDF文字提取困难、乱码及LLM无法直接读取的问题,能够以极高的速度将不可复制的PDF文件转化为清晰的Markdown格式。
核心性能与特性
- 极致速度:单份PDF文件的文字提炼与转换仅需20ms。官方数据显示,在处理质量与知名工具Docling旗鼓相当的前提下,OCR It的处理速度提升了近300倍。
- 完全离线:基于捆绑的Tesseract引擎,支持100%离线运行(Offline via Bundled Tesseract),无需网络连接。
- 隐私安全:不需要API Key,安装时不索取网站权限,仅在自动运行或操作跨域iframe时按需申请当前站点权限。
- 平台支持:作为免费浏览器插件,适用于Chrome和Firefox。
使用方法
OCR It提供手动和自动两种模式,用户可通过快捷键高效完成文档识别:
- 手动模式:
- 框选识别:按下
Option+Shift+R(Windows/Linux为Alt+Shift+R)选定区域,按Enter保存。 - 执行识别:按下
Option+Shift+S开始识别当前页面,识别完成后自动翻页。用户可一边翻页一边触发后台排队任务。 - 导出:识别完成后,在插件面板检查修改,选择“Copy all”或“Download .txt”导出全文。
- 框选识别:按下
- 自动模式:
- 按下
Option+Shift+A或点击“Start auto-run”,工具将自动循环执行“截图—OCR—翻页”流程,直至文档结束。 - 中途可按
ESC停止。
- 按下
- 智能停止机制:当连续识别到两张相同页面、无法继续翻页、OCR失败或达到300页上限时,工具会自动停止,避免无效抓取。
局限性与现状
尽管速度表现优异,但社区实测反馈指出OCR It目前仍存在局限性:
- 适用场景:非常适合处理版式简单、文字清晰的PDF文档。
- 不足之处:对于包含标题、脚注、表格、数学公式以及正文段落混排的复杂页面,处理能力尚不稳定,存在较大的优化空间。
资源链接
- GitHub仓库:https://github.com/thiagotigaz/ocr-it
- Firecrawl官网:https://www.firecrawl.dev/about
