关于ZAKER Skills 合作
量子位 38分钟前

20ms 把 PDF 变成 Markdown!开源 OCR 神器快了近 300 倍

曾经只能手动摘取 PDF 文字、结果乱码一堆、LLM 还看不懂的苦逼日子——

终于要结束了!

Y Combinator 孵化的明星项目 Firecrawl 团队最近放了个大招:

其联合创始人兼 CTO Nicolas Camara 宣布,他们最新开发的OCR It可以在 20ms 内将一份不可复制的 PDF 文件内的所有文字内容提炼完,并将其转化成清晰的 Markdown 格式,AI 读完马上就能看懂。

20ms 是什么概念?

相当于你刚点完确定还没眨完眼,一份处理好的 Markdown 文件就已经清清爽爽地交到你手上了。

而且它还不需要联网,可以100%Offline via Bundled Tesseract

这个刚刚开源的 OCR 工具才刚发布,就在 GitHub 上获得了热门关注。

Nicolas Camara 骄傲地表示,在处理质量与 Docling 旗鼓相当的前提下,OCR It 的处理速度比 Docling 快了近 300 倍!

小伙伴们测完也纷纷在 X 上留言:

快,确实快得很啊!

OCR It 怎么用

首先,OCR It 是一款适用于 Chrome 和 Firefox的免费浏览器插件。

你只需框选一次区域,之后每按一次快捷键(或开启自动模式),它就能把整本书或整个文档变成完整且可编辑的纯文本,方便你直接喂给 AI 进行总结或提问。

期间,OCR It 会默认在连续识别到两张相同页面、无法继续翻页、OCR 失败或达到 300 页上限时自动停止,避免在末页无限重复抓取。

具体而言,手动和自动档可以分别按以下的几个步骤操作:

(注:用 Windows 和 Linux 的小伙伴们需将 option 键替换为 Alt)

1、手动档:

框选和识别:

首先按 Option+Shift+R选定需要识别的文字区域,确认无误后按 Enter 保存

完成第一步框选文字区域之后,按一次 Option+Shift+S,OCR It 就会开始识别当前页面,并在识别完成后会自动翻到下一页。

接下来你只需要重复这个操作直到整份文档识别完毕就好了。

如果你希望进一步节省时间的话,你也可以一边翻页一边在每一页按一次 Option+Shift+S,系统会立即截图并在后台自动排队执行识别任务。

检查:

全部识别完成后,你可以在插件面板中检查、修改文本,也可以重新识别单独某一页,最后选择"Copy all""Download .txt"导出全文,整个任务就完成啦!

2、自动档

自动挡的话就简单多了,你只需要按下Option+Shift+A 或点击 Start auto-run,OCR It 便会自动循环执行 " 截图— OCR —翻页 ",直至文档结束。

如果你想中途结束任务的话,按 ESC 就行,检查流程几乎和手动档一致。

此外,OCR It 仓库界面显示,它既不需要 API Key、联网、安装时也不需要索取任何网站权限,它只会在需要自动运行或操作跨域 iframe 时才按需申请当前站点的权限。

另外,浏览器内置 PDF 阅读器目前也还暂时不支持自动翻页,所以大家在处理这类 PDF 时,还是尽量用手动档处理吧。

处理复杂任务时还不太稳定

不过,OCR It 虽然看起来又快又方便,但还远没有到 " 以后把所有 PDF 都丢给它,就能高枕无忧 " 的程度。

网友们通过实测达成的一个共识是:

OCR It 目前可以相当顺手地处理版式简单、文字清晰的 PDF 文档,但它还不太能处理一些标题、脚注、表格、数学公式和正文段落混排的复杂页面,所以它还有不小的提升空间。

让我们期待一下团队后续的更新吧!

感兴趣的小伙伴们可以点进文末第二个链接看看,欢迎跟我们分享你的测试结果~

参考链接:

[ 1 ] https://x.com/nickscamara_/status/2083295265793212827

[ 2 ] https://github.com/thiagotigaz/ocr-it

[ 3 ] https://www.firecrawl.dev/about

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

点亮星标

科技前沿进展每日见

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容