蘋果的 AI 策略與其他業者很不一樣——不追求最強通用模型,主打端側部署與隱私保護。
端側模型:3B 參數
2025 年 WWDC 上,蘋果公布了 Apple Foundation Models(AFM),端側版本約 30 億參數,專為 Apple Silicon 最佳化。
幾項關鍵技術:
- KV-cache 共享:模型分成兩個 block(深度比 5:3),後面的 block 直接複用前面的 KV cache,記憶體佔用減少 37.5%。
- 2-bit 量化感知訓練:權重壓到 2 bit,embedding 層 4 bit,KV cache 8 bit。
- 低秩適配器:補償量化帶來的精度損失。
最終效果:一個 3B 參數的模型壓縮到可以在 iPhone 上流暢運行,同時保持足夠的能力水準。
服務端模型:PT-MoE
處理不了的複雜任務交給服務端,但使用的是蘋果自己的 Private Cloud Compute——在蘋果自研晶片的雲伺服器上運行,資料不離開蘋果的安全飛地。
服務端架構稱為 Parallel-Track MoE,由多個較小的 Transformer「軌道」平行處理 token,只在輸入和輸出邊界進行同步。同步開銷減少了 87.5%。
隱私優先
蘋果這套設計的優先順序很清楚:
- 能在端側跑的就不上雲。
- 必須上雲的用 Private Cloud Compute。
- 支援 15 種語言、理解圖文輸入。
這與 OpenAI、Anthropic、Google 那種「一切上雲」的路線形成鮮明對比。蘋果賭的是:使用者願意為隱私犧牲一些能力上限。
開發者也有福利——蘋果開放了 Foundation Models 框架,第三方 app 可以直接呼叫端側模型。不過能力上與 GPT-4 等級的雲端模型還有差距,更適合做輕量級的文字處理與理解任務。
參考來源:CocoLoop、Apple Machine Learning Research