Google研究院於8月26日發布GlucoFM,這是一個只處理連續血糖監測(CGM)曲線的自監督基礎模型。論文發表於arXiv,編號2605.30865,作者為Google Research的Ahmed A. Metwally與Zechen Li。它鎖定的場景相當具體:戴在手臂上的感測器每五分鐘吐出一個數值,累積幾天就是一條又長又雜訊多的曲線,醫師想從中讀出胰島素阻抗、β細胞功能等指標,過去得靠人工進行特徵工程。
模型的做法是把曲線拆成兩路處理。一路負責慢變數,也就是幾小時到一天的代謝趨勢;另一路負責快變數,像是餐後血糖飆升、夜間低血糖這類短時間的偏移。兩路分別編碼後再合併成表示。團隊特別做了消融實驗,結果只保留「事件流」的版本表現最差——瞬時波動本身撐不起一張穩定的代謝樣貌。
數字攤開來看
預訓練用掉10.9萬小時未標註CGM資料,來自五個資料集、477筆參與者/療程紀錄。評測涵蓋CGMacros、史丹佛世代、Hall世代與ShanghaiT2DM四個族群、七項臨床預測任務,交叉組合共14組世代-任務評測。對手是GluFormer的最佳版本,GlucoFM的PR-AUC平均高出5.8個百分點,相對提升約7.5%。糖尿病風險與β細胞功能兩項全面領先,胰島素阻抗在四組評測中贏下三組。餐後血糖反應預測的MAE為21.88 mg/dL,基準模型為22.90。跨資料集遷移的12組評測中贏了11組,領先幅度介於0.5到8.6分之間。
少樣本(few-shot)的部分更貼近實際場景。在每個類別只給一位有標註的參與者、或只用1%觀測量的設定下,GlucoFM依然保住優勢。臨床研究裡標註成本往往比資料蒐集成本高出一個量級,這一點比排行榜分數更具實用價值。
資料規模是個反差
粗略算一下:10.9萬小時以五分鐘一次取樣,大約是130萬個資料點。同期的語言模型動輒從數兆token起跳,這個量級放進去幾乎看不見。477筆紀錄、五個資料集,規模同樣稱不上龐大。Google自己在限制事項裡寫得很直白:預訓練族群偏小,模型目前只能按獨立的24小時區間處理,看不到週級、月級的趨勢。
訊號類基礎模型和語言模型並不共用同一套規模邏輯。CGM曲線自由度低、結構性強,幾百人的資料就足以讓模型學會「什麼算正常波動」。在後續計畫裡,Google提到要擴大到更大、更多元的族群,做原生的多日建模、支援即時適應,還想釐清不同世代之間的雜訊模式差異。
落到裝置上
評測分別在Dexcom和Libre兩種感測器上建模驗證過,說明模型並未被單一硬體的取樣特性綁死。874組配對餐食事件、34名參與者的餐後反應資料,數量不大但口徑乾淨。CGM這幾年正從糖尿病管理往健康族群滲透,免處方版本一旦推出,配戴的人只會更多,能拿來做自監督訓練的未標註曲線資料也會跟著增加。輕量、能少樣本遷移的模型,恰好卡在這個位置上。
參考來源:Google Research官方部落格、arXiv論文2605.30865、CocoLoop;模型架構、預訓練資料量與14組世代-任務評測口徑以官方部落格所列為準。