其它·via @mubei

把文档数字化,光认字不够,还得保留结构。 光是把字抠出来没用。 遇到这三个死穴,普通工具往往直接宕机: 连医生自己都认不…

把文档数字化,光认字不够,还得保留结构。

光是把字抠出来没用。 遇到这三个死穴,普通工具往往直接宕机: 连医生自己都认不准的手写病历。 排版错综复杂的嵌套表格。 满是特殊符号的数学公式。

Datalab 新出的 Chandra OCR 2 模型,专门解这道题。 它能把这些极难辨认的图片和 PDF 啃下来。 最核心的本事就是保结构。

提取文字的同时,它完整保留了原文档的排版布局。 然后直接输出结构化的 HTML、Markdown 或者 JSON。 字认出来了,版面也没乱。

那些堪称天书的手写笔记和图表,都能被原样解析。

这个专啃硬骨头的工具,目前是免费的。

翻译视频 / X

导出 / EXPORT