{"source":{"id":"mb-20260828-dcf07c","title":"一个 78 兆的视频文件，被压缩到不到 1 兆，画面里的人脸和文字却完好无损","url":"https://mubeitech.com/p/mb-20260828-dcf07c"},"method":"semantic-similarity","count":6,"items":[{"rank":1,"id":"2064718736783823145","account":"mubei","brand":"@mubei","title":"视频生成模型都是只会生搬硬套像素的“傻瓜”？最近这个流行说法被新论文直接打脸了。 有人断言，只有像 V-JEPA 这样的…","summary":"视频生成模型都是只会生搬硬套像素的“傻瓜”？最近这个流行说法被新论文直接打脸了。 有人断言，只有像 V-JEPA 这样的“世界模型”才真懂物理。 看看这张图的测试数据。 研究人员对几款扩散模型（Diffusion models）进行了测试。 测什么？测物体恒常性、形状保持、重力、…","body":"视频生成模型都是只会生搬硬套像素的“傻瓜”？最近这个流行说法被新论文直接打脸了。\n有人断言，只有像 V-JEPA 这样的“世界模型”才真懂物理。\n\n看看这张图的测试数据。\n研究人员对几款扩散模型（Diffusion models）进行了测试。\n测什么？测物体恒常性、形状保持、重力、连续性这些物理基础。\n结果不仅及格，而且以压倒性优势暴打了被寄予厚望的 V-JEPA 和 VideoMAE。\n普通的 VAE 更是惨不忍睹。\n\n这里有个硬核细节：研究用的是“线性探测（Linear probe）”。\n啥意思？就是不加任何复杂的滤镜，用最简单的线性模型去提取信息。\n在这种极简的测试下，AI 还能精准预测物理变化，说明扩散模型内部，早就有一套相当清晰、明确的物理世界表征。\n它没有瞎猜，它在内部重建了物理法则。\n\nAI 进化路线的成见正在被打破。\n那些被认为只会“大力出奇迹”和“暴力画图”的生成模型，其实在疯狂吞噬数据的同时，已经悄悄摸透了这个世界的运行规律。","category":"其它","score":100,"translated_x_url":"https://x.com/i/status/2064797405199859964","translated_status_id":"2064797405199859964","published_at":"2026-06-10 19:05:45","created_at":"2026-06-10T21:03:53.783610","url":"https://mubeitech.com/p/2064718736783823145","markdown_url":"https://mubeitech.com/p/2064718736783823145/markdown"},{"rank":2,"id":"mb-20260827-1b87b1","account":"mubei","brand":"","title":"全世界每天播放的上百亿次视频，几乎都必须从同一个免费程序里穿过去","summary":"全世界每天播放的上百亿次视频，几乎都必须从同一个免费程序里穿过去","body":"全世界每天播放的上百亿次视频，几乎都必须从同一个免费程序里穿过去。\n\n无论是万亿市值巨头的流媒体，还是火星探测器传回地球的着陆画面。\n\n它撑起了整个互联网的视频大厦，却没有一家公司拥有它，也没有人为它打过广告。\n\n写出这套核心代码的法国人，二十多年前随手把它送给全世界，转身回公寓算圆周率去了。\n\n他叫法布里斯·贝拉（Fabrice Bellard）。\n\n2000 年底，他在业余时间写下了这个叫 FFmpeg 的多媒体工具。\n\n做完之后，他没成立公司，没去硅谷融资，甚至没拿它换过一分钱。\n\n2004 年，他觉得这套工具已经能够解决问题，直接退出了项目。\n\n他回到巴黎的公寓，用一台普通的家用台式机和几块硬盘，花了 131 天，算出了圆周率小数点后 2.7 万亿位，打破了当时超级计算机的世界纪录。\n\n随后，他又随手写出了支撑大半个云计算底座的虚拟化模拟器 QEMU，以及十多秒就能编译并启动操作系统的 C 语言编译器。\n\n他把这些成果全部免费公开，不接受采访，不办发布会，个人网站上连一张照片都没有。\n\n天才转身去探索下一座山峰，被留下的代码却支撑起了一个万亿美元的数字世界。\n\n数字视频从来不是单一标准。\n\n它是过去几十年里，不同相机、手机、游戏主机和广播机构留下的数百种混乱格式。\n\n全世界没有任何一家商业公司愿意从零重写这套繁重的脏活累活。\n\n因为 FFmpeg 的志愿者们，靠着一行行逆向工程，把过去三十年所有被大公司遗忘的旧格式，全都无偿啃了下来。\n\n商业巨头做出了最理性的经济选择：直接把整个帝国的视频业务，搭在这群志愿者的免费劳动上。\n\n这台机器在经济学上叫「数字公地的不对称提取」。\n\n上层的商业巨头享受着零边际成本带来的暴利，底层的维护成本却被完全抛给极少数凭热爱发电的开发者。\n\n荒谬在 2025 年底彻底浮出水面。\n\n拥有顶尖算力的科技巨头，派出人工智能安全系统全面扫描开源代码。\n\n人工智能在 FFmpeg 的旧仓库深处，挖出了一个针对 1995 年卢卡斯艺术公司古老电脑游戏的解码器漏洞。\n\n随后，巨头向这群不领薪水的开源志愿者发去了一封限期 90 天修复的正式通知。\n\n志愿者在公开回应里提出质问：万亿美元市值的科技巨头依靠免费代码赚取数百亿利润，如今用人工智能给三十年前的老游戏代码挑刺，却指望开源志愿者无偿加班擦屁股？\n\n撑起整个数字视频文明的这套核心底座，在过去绝大部分时间里，商业资助几乎为零。\n\n直到 2024 年，德国主权技术基金才给它提供了历史上第一笔政府资助，金额只有 15.7 万欧元。\n\n而接替贝拉维护了这个项目 11 年、修补了 2700 多个安全漏洞的核心开发者，在几个月的高强度安全维护中，拿到的报酬仅仅只有 7500 欧元。\n\n现代科技文明最脆弱的软肋，从来不在那些光鲜亮丽的发布会上。\n\n它恰恰藏在那些被所有人视作理所当然、却没有任何商业巨头愿意付账的免费地基里。\n\n一两个天才用纯粹的好奇心为世界铺好了路。\n\n商业系统在上面建起了摩天大楼。\n\n当大楼越盖越高，所有人都忙着计算顶层的租金，却指望那个最初挖地基的人，永远在地下免费修补裂缝。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-27 21:12:42","created_at":"2026-08-27 21:12:42","url":"https://mubeitech.com/p/mb-20260827-1b87b1","markdown_url":"https://mubeitech.com/p/mb-20260827-1b87b1/markdown"},{"rank":3,"id":"mb-20260823-f590d9","account":"mubei","brand":"","title":"一台 4700 美元的个人电脑，能在本地跑动参数量上千亿的顶级大模型","summary":"一台 4700 美元的个人电脑，能在本地跑动参数量上千亿的顶级大模型","body":"一台 4700 美元的个人电脑，能在本地跑动参数量上千亿的顶级大模型。\n跑出 47 tok/s 的推理速度，还顶着 400k 的超长上下文。\n很多人的第一反应是：这肯定把模型压成了人工智障。\n在过去的认知里，把超大模型塞进个人电脑，唯一的方法是死磕量化。\n把权重从 16 位浮点数一路压到 4 位、3 位，甚至 2 位。\n但单维度的压缩很快就会撞墙。\n位宽压得太狠，量化误差指数级爆发，模型直接开始胡言乱语。\n另一条路是剪枝。\n可传统密集模型的剪枝同样行不通：零散剔除的权重破坏了规整的矩阵结构，显卡根本跑不出硬件加速。\n两边都走不通，很多人便认定：顶级算力永远只能锁在云端机房。\n为什么 4700 美元的桌面设备能把这堵墙撞碎？\n因为真正的突破，从来不在单一维度上硬挤。\n它把两台方向完全不同的压缩机器叠在了一起。\n这台机器叫正交压缩。\n混合专家模型架构给算法提供了一个前所未有的结构切口。\n在这种架构里，模型是由数十个甚至上百个细分专家组成的网络。\n每生成一个词，真正被激活的只有少数几个专家。\n开源开发者 0xSero 借助 REAP 专家激活剪枝算法，先给所有专家跑了一轮校准。\n算法找出了那些在绝大多数任务中几乎从不响应的低频专家，整块剥离。\n整整 18.5% 的结构冗余被干脆利落地砍掉，而每个词调用的核心专家预算完好无损。\n这是第一步：在结构维度上剔除闲置专家。\n紧接着，在剩下的骨干专家身上，套上 turboderp 开发的 EXL3 算法，进行 3-bit 精度量化。\n这是第二步：在数值维度上压缩权重的位宽。\n两个动作是正交的。\n剪枝清理的是结构冗余，量化清理的是数值冗余。\n因为攻击的是两个互不干扰的独立维度，两者的压缩收益直接相乘，却避开了单一技术推向极限时的崩塌风险。\n显存占用被砍掉了一大截，每秒吞吐量却保住了。\n算力行业过去几年一直在制造一种云端垄断的恐慌。\n数千亿美元砸进集中式算力中心，普通人似乎只能按字数向云端服务器交租。\n但计算技术的演进，从来不会单向偏向中心化。\n算法在正交维度的每一次解耦，都在以乘数效应拉低硬件的成本底线。\n当一台桌面级的消费硬件，就能流畅运转过去需要整个机架才能支撑的智能。\n算力的主权，就不再只能被锁在巨头的数据中心里。\n决定智能普及速度的，不只是巨头烧了多少资本开支。\n更在底层算法如何把昂贵的门槛，一步步砸进每个普通开发者的书桌。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-23 00:21:49","created_at":"2026-08-23 00:21:49","url":"https://mubeitech.com/p/mb-20260823-f590d9","markdown_url":"https://mubeitech.com/p/mb-20260823-f590d9/markdown"},{"rank":4,"id":"2029936664429183319","account":"mubei","brand":"@mubei","title":"几千亿美元砸进硅谷，只为了抢 GPU。 这些天价显卡 99% 的时间和电费，到底耗在了哪里？ 算矩阵乘法。 说白了就是把…","summary":"几千亿美元砸进硅谷，只为了抢 GPU。 这些天价显卡 99% 的时间和电费，到底耗在了哪里？ 算矩阵乘法。 说白了就是把一堆数字排成方阵，然后互相乘。 这就是现代 AI 神经网络的全部底座。 现在的解法极其暴力。 普通的电脑 CPU 顶多 16 到 32 个核心。 GPU 直接塞…","body":"几千亿美元砸进硅谷，只为了抢 GPU。\n这些天价显卡 99% 的时间和电费，到底耗在了哪里？\n\n算矩阵乘法。\n说白了就是把一堆数字排成方阵，然后互相乘。\n这就是现代 AI 神经网络的全部底座。\n\n现在的解法极其暴力。\n普通的电脑 CPU 顶多 16 到 32 个核心。\nGPU 直接塞进去成千上万个算力单元。\n\n单拎出来比，GPU 的单个核心根本跑不过 CPU。\n它完全是靠人海战术，用极度密集的并行计算把整体速度堆上去。\n但这套用电信号硬算的模式，越来越吃力。\n\n华尔街最近盯上了一个新东西。\n光子计算。\n\n与其用电流在硅片里苦苦排队，不如直接用光学硬件来跑算法。\nAI 硬件的下一次大洗牌，才刚刚起步。","category":"其它","score":100,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-05-05 05:25:30","created_at":"2026-05-05T07:24:27.543138","url":"https://mubeitech.com/p/2029936664429183319","markdown_url":"https://mubeitech.com/p/2029936664429183319/markdown"},{"rank":5,"id":"mb-20260827-c46740","account":"mubei","brand":"","title":"训一个几千亿参数的大模型，上万张最顶级的显卡，有一大半时间根本没在算","summary":"训一个几千亿参数的大模型，上万张最顶级的显卡，有一大半时间根本没在算","body":"训一个几千亿参数的大模型，上万张最顶级的显卡，有一大半时间根本没在算。\n算力租金按秒扣费，电表飞速打转，机房风扇震耳欲聋。\n但芯片的浮点运算单元，却在成片成片地熄火发呆。\n业界的真实数字冷冰冰摆在那里。\n哪怕是顶尖实验室，模型算力利用率通常也只有 35% 到 43%。\n剩下的六成算力，蒸发去了哪里？\n是算法写得太慢，还是代码逻辑不够优化？\n为什么在 Python 里写得整整齐齐的线性代码，扔进上万张显卡之后，会碎成一地残渣？\n这台让万亿资本买来的算力大面积瘫痪的机器，叫通信重叠与关键路径气泡。\n要看懂这台机器，先看单张显卡和集群的本质区别。\n单张显卡训练很简单：数据喂进显存，核心埋头计算。\n但千亿参数的大模型，根本塞不进任何单张显卡的显存。\n工程师必须把模型生生切碎，分摊到几千甚至上万张显卡上。\n张量并行把每一层的矩阵乘法横竖切开。\n全分片数据并行把模型参数、梯度和优化器状态彻底剥离。\n专家并行和上下文并行把海量参数和数十万字的序列切散。\n这种切分带来了一个致命代价。\n任何一张显卡想要算下一层网络，必须先等别的显卡把中间结果传过来。\n在硬件底层，显卡从来不是按代码顺序单线推进的。\n它跑在两条平行的硬件轨道上。\n一条是负责矩阵乘法的高速计算流。\n一条是负责跨卡数据搬运的通信流。\n这两条轨道在时间线上贴身肉搏。\n最理想的状态，是当前层在计算流里疯狂运转时，下一层要用的参数已经在通信流里提前搬运完毕。\n这在工程上叫计算与通信重叠。\n只要算力跑完的瞬间数据刚好到位，跨卡通信的耗时就被彻底藏在计算背后。\n但物理现实没有这么仁慈。\n跨机柜的光纤只要有一丝抖动，或者层与层之间的依赖拓扑解不开，通信就会慢上几个微秒。\n一旦计算流算完了，而通信流的数据还没送达，硬件同步机制会瞬间踩下急刹车。\n在底层的执行轨迹图上，显卡会留下一大片空白。\n工程上把这片空白叫气泡。\n只要这个气泡落在了决定整体速度的关键路径上，几万张每小时烧掉几万美元的显卡，就必须集体陪着它原地发呆。\nAI 研究者 Vlad Savinov 拆解过 PyTorch 官方分布式训练框架 torchtitan 的真实底层轨迹。\n把掩盖在代码背后的底层事件拉平在时间轴上，才能看清真相。\n算力根本不是平铺直叙的流水线，是一张充满阻塞、等待与抢跑的有向无环图。\nMeta 训练 4050 亿参数的 Llama 3.1 时，动用了 1.6 万张 H100 显卡。\n即便用尽了交错流水线调度、异步张量并行与微块切分，把能重叠的通信全部塞进计算缝隙，整体算力利用率依然被锁在 40% 左右。\n这就是为什么 AI 军备竞赛的底层法则正在发生质变。\n很多人看算力竞争，习惯盯着谁买了十万张显卡，以为算力是简单的乘法累加。\n在超大规模分布式系统里，算力遵循的是残酷的拓扑规律。\n芯片堆得越多，通信复杂度的爆炸速度就越快，时间轴上的气泡就越难被压平。\n真正拉开顶尖实验室差距的，从来不是买显卡的支票厚度。\n是在微秒级的时间轴上，把跨卡通信死死压进计算缝隙里的工程编排能力。\n谁能把通信完全藏进阴影里，谁就能用一半的芯片跑出对手两倍的速度。\n藏不住通信的，买再多显卡，也不过是在高昂的电费账单里，养了一大堆在网线面前排队发呆的昂贵发热器。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-27 11:28:33","created_at":"2026-08-27 11:28:33","url":"https://mubeitech.com/p/mb-20260827-c46740","markdown_url":"https://mubeitech.com/p/mb-20260827-c46740/markdown"},{"rank":6,"id":"mb-20260827-d0ae18","account":"mubei","brand":"","title":"把一个 3130 亿参数的庞然大物，塞进一台只有 8GB 内存的 MacBook 里运转","summary":"把一个 3130 亿参数的庞然大物，塞进一台只有 8GB 内存的 MacBook 里运转","body":"把一个 3130 亿参数的庞然大物，塞进一台只有 8GB 内存的 MacBook 里运转。\n按照过去的算力常识，313B 模型哪怕压缩到极限制式，至少也需要 160GB 显存。\n8GB 内存，连这个模型权重文件的零头都装不下。\n但这套系统不仅没有爆内存崩溃，运行所需的常驻内存甚至只要 5.14GB。\n在配备 64GB 内存的笔记本上，它每秒能稳稳吐出接近 4 个 token。\n苹果的统一内存物理定律失效了吗？\n它是怎么在一台消费级笔记本上，把过去需要机房集群才能跑的庞然大物转起来的？\n答案不在更贵的硬件芯片里。\n在一台被重新设计的软件机器里。\n权重感知流式分页机制。\n开发者马可·班比尼（Marco Bambini）写了一个用纯 C 语言构建、零第三方依赖的开源推理引擎 WARP。\n在这之前，他已经用这套引擎在 Mac 上跑通了 2.78 万亿参数的 Kimi K3 模型。\n这套引擎真正击穿的，是整个行业对大模型推理的一条思维惯性。\n过去大家默认：要在本地跑大模型，必须把所有权重一股脑全部塞进物理内存。\n如果内存装不下，交给操作系统的虚拟内存去硬盘交换，系统就会瞬间卡死。\n因为操作系统的分页机制是盲目的。\n它根本不知道神经网络在下一毫秒要算什么，频繁触发缺页中断，读盘延迟会把生成速度直接砸到每秒 0.01 个字。\n但今天的超大模型，底层架构早就变了。\n无论是万亿参数的 Kimi K3，还是 3130 亿参数的 GLM-5.3-Flash，它们都是混合专家模型。\n混合专家模型有一个决定性的物理特性：激活稀疏性。\n虽然模型总参数高达几千亿甚至上万亿，但当它处理某一个特定的词时，真正被激活的专家可能只有百分之几。\n绝大多数参数，在当下的那一瞬间根本不需要参与运算。\n看到这个特性，WARP 做了三件极其精巧的事。\n第一件，主干常驻。\n它把注意力层、基础嵌入层这些每次运算都必不可少的共享骨干，常驻在物理内存中。\n对 3130 亿参数的 GLM-5.3-Flash 来说，这个核心骨干只有 5.14GB。\n一台最普通的 8GB 笔记本，刚好能把它稳稳托住。\n第二件，前瞻路由与流式预取。\n现代苹果电脑的固态硬盘，顺序读取速度高达每秒数吉字节。\nWARP 设计了一套前瞻路由器。\n当系统正在计算第 N 层的时候，路由器就已经提前算出了下一层需要哪几个专家。\n它抢在计算发生前，把那几个特定的专家张量从固态硬盘里异步流式读出来，用完立刻释放。\n硬盘读盘与芯片计算，在时间线上被完全重叠覆盖。\n第三件，专家局部性缓存。\n如果你的电脑有 64GB 内存，剩余的空闲空间就会被自动用作动态专家缓存。\n人类的自然语言具有天然的语义局部性。\n上一个词调用了负责代码或逻辑推理的专家，接下来的一串词大概率还会继续复用它。\n只要命中了内存缓存，连读盘的步骤都被彻底省去。\n整个行业过去两年都在陷入一种硬件堆料的军备竞赛。\n大家以为要在本地跑动前沿智能，唯一的出路就是买更贵的工作站、插满大显存计算卡、或者向云端机房交高昂的接口费。\n但只要推理软件真正理解了神经网络的稀疏几何结构，显存与硬盘之间那道不可逾越的鸿沟就消失了。\n它把一个原本绝望的显存容量死结，转化成了一个优雅的固态硬盘吞吐与路由预测问题。\n技术的范式转移，往往不靠更暴力的硬件堆叠。\n它发生在有人看穿了新算法的物理本质，然后给操作系统那套几十年前的古老齿轮，重新写了一套匹配现代智能的规则。\n当几千亿参数的顶尖模型不再被锁在数据中心的机柜里，能够顺着普通背包里的固态硬盘静静流淌时，算力垄断的围墙其实已经被推开了一条缝隙。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-27 21:12:44","created_at":"2026-08-27 21:12:44","url":"https://mubeitech.com/p/mb-20260827-d0ae18","markdown_url":"https://mubeitech.com/p/mb-20260827-d0ae18/markdown"}]}