{"id":"2078751823909839012","account":"mubei","brand":"@mubei","title":"把文档数字化，光认字不够，还得保留结构。 光是把字抠出来没用。 遇到这三个死穴，普通工具往往直接宕机： 连医生自己都认不…","summary":"把文档数字化，光认字不够，还得保留结构。 光是把字抠出来没用。 遇到这三个死穴，普通工具往往直接宕机： 连医生自己都认不准的手写病历。 排版错综复杂的嵌套表格。 满是特殊符号的数学公式。 Datalab 新出的 Chandra OCR 2 模型，专门解这道题。 它能把这些极难辨认…","body":"把文档数字化，光认字不够，还得保留结构。\n\n光是把字抠出来没用。\n遇到这三个死穴，普通工具往往直接宕机：\n连医生自己都认不准的手写病历。\n排版错综复杂的嵌套表格。\n满是特殊符号的数学公式。\n\nDatalab 新出的 Chandra OCR 2 模型，专门解这道题。\n它能把这些极难辨认的图片和 PDF 啃下来。\n最核心的本事就是保结构。\n\n提取文字的同时，它完整保留了原文档的排版布局。\n然后直接输出结构化的 HTML、Markdown 或者 JSON。\n字认出来了，版面也没乱。\n\n那些堪称天书的手写笔记和图表，都能被原样解析。\n\n这个专啃硬骨头的工具，目前是免费的。","category":"其它","score":null,"percentile":null,"reason_tags":[],"translated_x_url":"https://x.com/i/status/2079406086889549923","translated_status_id":"2079406086889549923","published_at":"2026-07-21 00:18:06","created_at":"2026-07-21T02:01:32+02:00"}