{"source":{"id":"2078441598824985046","title":"大模型做文档提取，抽完之后往往不敢直接用。 因为你不知道它给出的那个关键数字，到底是从哪一页哪句话里摘出来的，还是模型自…","url":"https://mubeitech.com/p/2078441598824985046"},"method":"semantic-similarity","count":6,"items":[{"rank":1,"id":"16581077","account":"mubei","brand":"@mubei","title":"200 份 PDF，2.8 秒处理完。 而且全在本地跑。 现在让 AI 读文档，最蠢的做法是什么？ 不管三七二十一，把所…","summary":"200 份 PDF，2.8 秒处理完。 而且全在本地跑。 现在让 AI 读文档，最蠢的做法是什么？ 不管三七二十一，把所有 PDF 闭着眼睛丢给 OCR 慢慢啃。 又慢又耗资源。 其实完全没必要。 开源社区新出了个工具 pdf-inspector，Rust 写的。 它换了个工作流…","body":"200 份 PDF，2.8 秒处理完。\n而且全在本地跑。\n\n现在让 AI 读文档，最蠢的做法是什么？\n不管三七二十一，把所有 PDF 闭着眼睛丢给 OCR 慢慢啃。\n又慢又耗资源。\n\n其实完全没必要。\n开源社区新出了个工具 pdf-inspector，Rust 写的。\n它换了个工作流。\n\n拿到一份文件，它不硬来。\n先花大概 20 毫秒做个分类，判断一下 PDF 的类型。\n能直接读的，就在本地直接抽出干净的 Markdown 文本。\n不仅速度快，提取表格和图表的质量也在第一梯队。\n\n这就给开发 Agent 的人留了个极高效率的口子。\n先花 20 毫秒摸清文档结构。\n遇到真骨头，再决定要不要上 OCR。","category":"其它","score":null,"translated_x_url":"https://x.com/i/status/2083659387864793378","translated_status_id":"2083659387864793378","published_at":"2026-08-01 08:38:58","created_at":"2026-08-01T10:29:54+02:00","url":"https://mubeitech.com/p/16581077","markdown_url":"https://mubeitech.com/p/16581077/markdown"},{"rank":2,"id":"2078751823909839012","account":"mubei","brand":"@mubei","title":"把文档数字化，光认字不够，还得保留结构。 光是把字抠出来没用。 遇到这三个死穴，普通工具往往直接宕机： 连医生自己都认不…","summary":"把文档数字化，光认字不够，还得保留结构。 光是把字抠出来没用。 遇到这三个死穴，普通工具往往直接宕机： 连医生自己都认不准的手写病历。 排版错综复杂的嵌套表格。 满是特殊符号的数学公式。 Datalab 新出的 Chandra OCR 2 模型，专门解这道题。 它能把这些极难辨认…","body":"把文档数字化，光认字不够，还得保留结构。\n\n光是把字抠出来没用。\n遇到这三个死穴，普通工具往往直接宕机：\n连医生自己都认不准的手写病历。\n排版错综复杂的嵌套表格。\n满是特殊符号的数学公式。\n\nDatalab 新出的 Chandra OCR 2 模型，专门解这道题。\n它能把这些极难辨认的图片和 PDF 啃下来。\n最核心的本事就是保结构。\n\n提取文字的同时，它完整保留了原文档的排版布局。\n然后直接输出结构化的 HTML、Markdown 或者 JSON。\n字认出来了，版面也没乱。\n\n那些堪称天书的手写笔记和图表，都能被原样解析。\n\n这个专啃硬骨头的工具，目前是免费的。","category":"其它","score":null,"translated_x_url":"https://x.com/i/status/2079406086889549923","translated_status_id":"2079406086889549923","published_at":"2026-07-21 00:18:06","created_at":"2026-07-21T02:01:32+02:00","url":"https://mubeitech.com/p/2078751823909839012","markdown_url":"https://mubeitech.com/p/2078751823909839012/markdown"},{"rank":3,"id":"16118689","account":"mubei","brand":"@mubei","title":"很多人以为玩 Agent 最贵的是大模型推理。 其实根本不是。 最烧钱、最折磨人的，是把网页喂给模型之前的“脏活”。 你…","summary":"很多人以为玩 Agent 最贵的是大模型推理。 其实根本不是。 最烧钱、最折磨人的，是把网页喂给模型之前的“脏活”。 你想让 Agent 帮你读个网页，得先抓取、清洗、去重。 一个几万字的超长网页，里面塞满了无用的 HTML 标签和垃圾信息。 你把这些玩意儿一股脑塞给大模型，To…","body":"很多人以为玩 Agent 最贵的是大模型推理。\n其实根本不是。\n最烧钱、最折磨人的，是把网页喂给模型之前的“脏活”。\n\n你想让 Agent 帮你读个网页，得先抓取、清洗、去重。\n一个几万字的超长网页，里面塞满了无用的 HTML 标签和垃圾信息。\n你把这些玩意儿一股脑塞给大模型，Token 烧起来简直像是在用金子当柴烧。\n\n最近 Hermes Agent 搞了个新动作，算是把这笔账算明白了。\n他们不吹嘘自己模型有多聪明，直接把刀子动在了“喂饭”的成本结构上。\n\n按照官方的宣传，他们现在读取网页的速度最高能快 60 倍，费用最高便宜 49 倍。\n当然，这只是厂商自己的测试口径，实际疗效还得看具体场景。\n\n但它解决问题的思路，确实戳中了开发者的心窝子。\n它的逻辑其实挺朴素。\n首先，抓取后端在源头就把网页清洗干净，直接把“纯肉”喂给 Agent，砍掉了所有冗余的重复处理步骤。\n其次，遇到那种巨长的网页，它不傻乎乎地一次性全吞下去。\n它先把大网页保存在本地，根据 Agent 的实际需求，按需进行分页读取。\n\n这就跟吃自助餐一样。\n以前是把整个牛排店连盘子带桌子一起吞下去，算账时按吨付费。\n现在是把肉切好了放在本地，吃多少、切多少、拿多少。\n\nAI 应用要想真正普及，别天天整那些“智力涌现”的宏大叙事。\n把抓取、清洗、本地分页这些工程细节抠明白，把成本打下来，才是真正的硬道理。","category":"其它","score":null,"translated_x_url":"https://x.com/i/status/2072263080604483933","translated_status_id":"2072263080604483933","published_at":"2026-07-01 09:24:54","created_at":"2026-07-01T11:07:15+02:00","url":"https://mubeitech.com/p/16118689","markdown_url":"https://mubeitech.com/p/16118689/markdown"},{"rank":4,"id":"16633616","account":"mubei","brand":"@mubei","title":"200多页的PDF，变成Markdown要多久？ 半秒钟。 以前处理长篇论文、合同和报告，光是解析PDF就是一套笨重的流…","summary":"200多页的PDF，变成Markdown要多久？ 半秒钟。 以前处理长篇论文、合同和报告，光是解析PDF就是一套笨重的流程。 现在的门槛，直接变成了一个可以在浏览器里跑的开源组件。 这个开源项目叫 pdf-inspector。 它不包打天下，做不到把所有畸形的PDF都无损解析，更…","body":"200多页的PDF，变成Markdown要多久？\n半秒钟。\n\n以前处理长篇论文、合同和报告，光是解析PDF就是一套笨重的流程。\n现在的门槛，直接变成了一个可以在浏览器里跑的开源组件。\n\n这个开源项目叫 pdf-inspector。\n它不包打天下，做不到把所有畸形的PDF都无损解析，更不是通用的OCR。\n但在对付常规长文档时，它的速度堪称恐怖。\n\n半秒吞下200页，直接吐出干干净净的Markdown文本。\n不用配置复杂的运行环境，不用把文件传给第三方服务器。\n靠你自己的浏览器就能跑。\n\n谁日常被海量文献和报告淹没，谁就能直接受益。","category":"其它","score":null,"translated_x_url":"https://x.com/i/status/2084453258420949121","translated_status_id":"2084453258420949121","published_at":"2026-08-03 23:06:06","created_at":"2026-08-04T00:35:38+02:00","url":"https://mubeitech.com/p/16633616","markdown_url":"https://mubeitech.com/p/16633616/markdown"},{"rank":5,"id":"2080420729636422039","account":"mubei","brand":"@mubei","title":"模型的上下文窗口再大，对话一关，AI智能体的记忆照样清零。 想让它过目不忘，得建知识图谱，但传统做法代价极高。 你得拉起…","summary":"模型的上下文窗口再大，对话一关，AI智能体的记忆照样清零。 想让它过目不忘，得建知识图谱，但传统做法代价极高。 你得拉起四个独立的机器学习模型： 一个做命名实体识别，一个做关系分类，一个搞实体归一化，再来一个生成摘要。 每个都要人工标数据，换个专业领域立马水土不服。 Boris…","body":"模型的上下文窗口再大，对话一关，AI智能体的记忆照样清零。\n想让它过目不忘，得建知识图谱，但传统做法代价极高。\n\n你得拉起四个独立的机器学习模型：\n一个做命名实体识别，一个做关系分类，一个搞实体归一化，再来一个生成摘要。\n每个都要人工标数据，换个专业领域立马水土不服。\n\nBoris Cherny发布了一份“图工程”操作手册，把这条流水线掀了。\n那四个重度依赖训练的模型，被四个Claude提示词直接平替。\n\n纯靠提示词接力。\n抽取提示词用Haiku，直接从原始文档里抓取实体和主谓宾关系。\n解析提示词用Sonnet，把不同写法的同一个名字精准合并成一个节点。\n摘要提示词跨越不同文档，给核心实体生成全貌画像。\n查询提示词顺着搭好的图谱，直接进行多步推理。\n\n整套流程，不需要机器学习工程师。\n唯一的“训练数据”，就是一个Pydantic代码结构。\n没有外挂额外的自然语言处理库，也没有训练任何新模型。\n\n原本阅后即焚的一次性上下文，就这样变成了永久可复用的知识图谱。","category":"其它","score":null,"translated_x_url":"https://x.com/i/status/2080576533396173125","translated_status_id":"2080576533396173125","published_at":"2026-07-24 08:03:50","created_at":"2026-07-24T10:01:15+02:00","url":"https://mubeitech.com/p/2080420729636422039","markdown_url":"https://mubeitech.com/p/2080420729636422039/markdown"},{"rank":6,"id":"16019942","account":"mubei","brand":"@mubei","title":"为什么现在的 AI Agent 看起来智商爆表，一干活就拉胯？ 因为它们根本出不了门。 模型再聪明，拿不到真实数据也是白…","summary":"为什么现在的 AI Agent 看起来智商爆表，一干活就拉胯？ 因为它们根本出不了门。 模型再聪明，拿不到真实数据也是白搭。 你让 Claude 帮你分析个行业趋势，它一出门就撞墙。 推特的 API 贵得要死，很多网页抓取还要订阅，B站和小红书更是直接把 AI 拦在外面。 每个平…","body":"为什么现在的 AI Agent 看起来智商爆表，一干活就拉胯？\n因为它们根本出不了门。\n\n模型再聪明，拿不到真实数据也是白搭。\n你让 Claude 帮你分析个行业趋势，它一出门就撞墙。\n推特的 API 贵得要死，很多网页抓取还要订阅，B站和小红书更是直接把 AI 拦在外面。\n每个平台都是一座信息孤岛，AI 只能在过去的语料库里“打转”。\n\n最近有个开源项目彻底火了，叫 Agent-Reach。\n它解决的正是这个最卡脖子的痛点：把多平台的公开内容访问，直接做成了一个通用的工具层。\n免费，开源，一条命令打通 14 个主流平台。\n\n安装极其简单。\n你甚至不用懂复杂的代码，直接把安装指令发给大模型（比如 Cursor），一分多钟就能自动搞定。\n中间只需要你手动配合一步：在 Chrome 浏览器里装一个 OpenCLI 的扩展。\n验证成功后，你的 AI Agent 就等于拥有了合规访问公开网页的“眼睛”。\n\n有人立刻拿它做了实测。\n去抓取小红书上一篇关于“裁判马宁出征世界杯”的公开笔记和评论。\n指令一敲，Agent-Reach 瞬间启动，速度极快。\n它抓到了正文，连底下上万条公开评论也迅速归纳总结出了主题。\n\nAI 时代的下半场，拼的是让 AI 顺畅、合规地触达真实世界的公开信息，而非单纯卷模型参数。\n当公开的数据孤岛被合规工具层层破开，AI 代理才真正开始从“聊天玩具”变成真正的“生产力工具”。\n这个项目，值得所有做 Agent 开发和个人研究的人立刻去跟进。","category":"其它","score":null,"translated_x_url":"https://x.com/i/status/2070272531643224256","translated_status_id":"2070272531643224256","published_at":"2026-06-25 21:32:53","created_at":"2026-06-25T23:20:52+02:00","url":"https://mubeitech.com/p/16019942","markdown_url":"https://mubeitech.com/p/16019942/markdown"}]}