苹果发布了 M6 和 M5 Ultra 两颗芯片,官方标题里直接写着 performance and AI compute。M6 进 Mac mini,M5 Ultra 进 Mac Studio,现已开放预订,9 月 22 日开始交付。
M6 是苹果第一颗 2 纳米芯片,也是台积电 2 纳米工艺的首批量产产品之一。规格是 12 核 CPU(2 个超核、4 个性能核、6 个能效核)、12 核 GPU、双 16 核神经网络引擎,最高 32GB 统一内存、170GB/s 带宽。苹果称它拥有全球最快的单线程性能,多线程比 M5 快 1.2 倍,GPU 的 AI 计算能力较 M5 提升约 30%、较 M1 提升 8 倍以上,神经网络引擎性能是上一代的 2 倍。
M5 Ultra 走的是堆料路线:用新一代 UltraFusion 把两颗双芯片的 M5 Max 连起来,四芯片架构在 M 系列上是第一次。
| M6 | M5 Ultra | |
|---|---|---|
| CPU | 12 核 | 最高 36 核 |
| GPU | 12 核 | 最高 80 核 |
| 神经网络引擎 | 双 16 核 | 32 核 |
| 统一内存 | 最高 32GB | 最高 512GB |
| 内存带宽 | 170GB/s | 1.2TB/s |
M5 Ultra 的 GPU 这次带上了 Neural Accelerators,AI 计算能力较 M3 Ultra 提升 4.5 倍、较 M1 Ultra 提升 6 倍以上;1.2TB/s 的带宽比 M3 Ultra 高 50%。苹果的原话是 “M5 Ultra features a massive GPU, now with Neural Accelerators, and more unified memory bandwidth, pushing the boundaries of what a desktop can do”。
512GB 这条线能装下什么
统一内存的意义在本地推理场景里最直观:CPU 和 GPU 共用一块内存,模型权重不用在显存和内存之间来回搬。对独立显卡方案来说,显存多少就是硬上限;对 Mac Studio 来说,上限现在是 512GB。
粗算一笔。开源侧那批六七千亿参数的 MoE 模型,四位量化后的权重体积大致在 350GB 到 400GB 这一档,再算上 KV 缓存和运行时开销,512GB 这个容量刚好把它们整台机器装下来。同规格的数据中心方案要凑出这个显存容量,得靠多卡互联,成本和供电完全是另一个量级。
带宽仍是短板。1.2TB/s 放在桌面上是很高的数字,摆到数据中心的 HBM 方案面前还差着一截,长上下文推理时出词速度会明显受制。它换来的是另一种东西:一台插墙上的机器,跑本地模型,数据不出门。
2 纳米这一步
M6 拿到 2 纳米首发,节奏上苹果依然站在最前面。工艺红利体现在能效比而非峰值频率——12 核里塞了 6 个能效核,加上 170GB/s 的带宽(只比 M5 高 10%),M6 的设计取向是把功耗压住,AI 算力的增量主要来自 GPU 和神经网络引擎的重构。
放在同一周的产业背景里看,方向是重合的。数据中心那头在拼每千瓦能跑多少推理,桌面这头在拼一台机器能装下多大的模型。推理成本正在同时从两端被往下压,只是压法不同。
至于 Mac mini 上的 M6 配 32GB 内存上限,本地跑得动的模型规模有限,这颗芯片的目标客群显然不在这条线上。
参考来源:Apple Newsroom 官方公告、MacRumors、CocoLoop、Phoronix、9to5Mac;核心数、内存容量带宽与倍数口径以官方公告核对,量化模型体积为按公开参数粗算。