来源:10台M4 Mac mini 搭成集群能干啥?(OpenClaw前置工作);UP:制造局

一句话结论

10 台 M4 Mac mini(基础版 4000+ 人民币/台)能搭成 100核CPU / 160GB统一内存 / 1.2TB/s 带宽 / 380TOPS AI算力的桌面集群,是 OpenClaw 类分布式本地 AI 推理的平民硬件底座。

核心规格(10节点)

维度数值含义
CPU100核(40 性能核 + 60 能效核,4P+6E)高强度串行 vs 后台调度/IO 各司其职
统一内存160GB跨节点共享池,CPU/GPU/NNE 同址访问
总带宽1.2TB/s10 节点 × 120GB/s,避免 PCIE 总线延迟
NPU380 TOPS(38/节点 × 10)边缘侧量化大模型推理够用

架构杀手锏:统一内存

  • 传统 PCIE 显存 ↔ CPU 内存来回搬运是分布式 AI 最大瓶颈
  • 单节点内存带宽 120GB/s,10 节点并发 1.2TB/s
  • 例子:Llama 3 70B Q4 约需 40GB 显存 → 单台 16GB Mac mini 跑不动,10 节点分摊每节点不到 5GB

网络选型

方案优势适用
10GbE 万兆以太网标准化、稳;需选配 10GBE 接口微服务编排、视频抓取等常规 IO
雷电网桥 + RDMA极低延迟、张量并行友好对延迟敏感的分布式 AI 训练/推理

软件栈

  • MLX 框架(Apple)— 跨节点分布式部署,开发者无需写复杂显存管理代码
  • 适合:本地量化大模型、分布式微服务、大规模 4K 视频转码

写入边界

  • 视频是”制造局”介绍性质,理论数据为主;实际跑 Llama 3 70B Q4 的真实吞吐、节点间 RDMA 延迟未在视频中给出
  • 380 TOPS 是 NPU 算力,与 GPU FP16 算力不能直接对比;MLX 框架对模型/算子的支持范围是关键
  • 视频本身标注”OpenClaw 前置工作”——OpenClaw 是什么、用了这套集群做什么,目前未公开

参考资料

  1. 原始 B 站视频