来源:10台M4 Mac mini 搭成集群能干啥?(OpenClaw前置工作);UP:制造局
一句话结论
10 台 M4 Mac mini(基础版 4000+ 人民币/台)能搭成 100核CPU / 160GB统一内存 / 1.2TB/s 带宽 / 380TOPS AI算力的桌面集群,是 OpenClaw 类分布式本地 AI 推理的平民硬件底座。
核心规格(10节点)
| 维度 | 数值 | 含义 |
|---|---|---|
| CPU | 100核(40 性能核 + 60 能效核,4P+6E) | 高强度串行 vs 后台调度/IO 各司其职 |
| 统一内存 | 160GB | 跨节点共享池,CPU/GPU/NNE 同址访问 |
| 总带宽 | 1.2TB/s | 10 节点 × 120GB/s,避免 PCIE 总线延迟 |
| NPU | 380 TOPS(38/节点 × 10) | 边缘侧量化大模型推理够用 |
架构杀手锏:统一内存
- 传统 PCIE 显存 ↔ CPU 内存来回搬运是分布式 AI 最大瓶颈
- 单节点内存带宽 120GB/s,10 节点并发 1.2TB/s
- 例子:Llama 3 70B Q4 约需 40GB 显存 → 单台 16GB Mac mini 跑不动,10 节点分摊每节点不到 5GB
网络选型
| 方案 | 优势 | 适用 |
|---|---|---|
| 10GbE 万兆以太网 | 标准化、稳;需选配 10GBE 接口 | 微服务编排、视频抓取等常规 IO |
| 雷电网桥 + RDMA | 极低延迟、张量并行友好 | 对延迟敏感的分布式 AI 训练/推理 |
软件栈
- MLX 框架(Apple)— 跨节点分布式部署,开发者无需写复杂显存管理代码
- 适合:本地量化大模型、分布式微服务、大规模 4K 视频转码
写入边界
- 视频是”制造局”介绍性质,理论数据为主;实际跑 Llama 3 70B Q4 的真实吞吐、节点间 RDMA 延迟未在视频中给出
- 380 TOPS 是 NPU 算力,与 GPU FP16 算力不能直接对比;MLX 框架对模型/算子的支持范围是关键
- 视频本身标注”OpenClaw 前置工作”——OpenClaw 是什么、用了这套集群做什么,目前未公开