谷歌用 10.9 万小时血糖数据训出 GlucoFM

谷歌研究院在 8 月 26 日放出 GlucoFM,一个只处理连续血糖监测(CGM)曲线的自监督基础模型。论文挂在 arXiv 上,编号 2605.30865,署名的是 Google Research 的 Ahmed A. Metwally 和 Zechen Li。它对付的场景很具体:戴在胳膊上的传感器每五分钟吐一个数,攒几天就是一条又长又脏的曲线,医生想从里面读出胰岛素抵抗、β 细胞功能这类指标,过去得靠人工做特征工程。

模型的做法是把曲线拆成两路。一路管慢变量,也就是几小时到一天的代谢趋势;另一路管快变量,餐后冲高、夜间低血糖这种短时偏移。两路各自编码,再合起来做表示。团队专门做了消融,只保留”事件流”的版本表现最差——瞬时波动自己撑不起一张稳定的代谢画像。

数字摊开看

预训练用掉 10.9 万小时未标注 CGM 数据,来自五个数据集的 477 份参与者/会话记录。评测覆盖 CGMacros、斯坦福队列、Hall 队列和 ShanghaiT2DM 四个人群、七项临床预测任务,交叉起来是 14 组队列-任务组合。对手是 GluFormer 的最优变体,GlucoFM 的 PR-AUC 平均高出 5.8 个百分点,相对提升约 7.5%。糖尿病风险和 β 细胞功能两项全面领先,胰岛素抵抗在四组评测里赢下三组。餐后血糖响应预测的 MAE 是 21.88 mg/dL,基线 22.90。跨数据集迁移的 12 组评测赢了 11 组,领先幅度 0.5 到 8.6 分。

少样本那部分更贴近实际场景。每类只给一个标注参与者、或者只用 1% 观测量的设定下,GlucoFM 依然稳住优势。临床研究里标注成本往往比数据采集成本高一个量级,这条比榜单分数实用得多。

数据规模是个反差

粗算一下:10.9 万小时按五分钟一个采样点,大约 130 万个数据点。同期语言模型动辄几万亿 token 起步,这个量级放进去几乎看不见。477 份记录、五个数据集,规模也远谈不上大。谷歌自己在局限里写得直白:预训练人群偏小,模型目前只按独立的 24 小时窗口处理,看不到周级、月级趋势。

信号类基础模型和语言模型的规模逻辑并不共享。CGM 曲线自由度低、结构强,几百人的数据就足以让模型学会”什么算正常波动”。后续计划里,谷歌提到要扩到更大更多样的人群、做原生多日建模、支持实时适应,还想搞清楚不同队列之间的噪声模式差异。

落到设备上

评测在 Dexcom 和 Libre 两种传感器上分别建模验证过,说明模型没被单一硬件的采样特性绑死。874 组配对餐食事件、34 名参与者的餐后响应数据,量不大但口径干净。CGM 这两年正从糖尿病管理往健康人群渗透,免处方版本一出,戴的人只会更多,能拿来做自监督的无标注曲线也跟着涨。轻量、能少样本迁移的模型,恰好卡在这个位置上。

参考来源:Google Research 官方博客、arXiv 论文 2605.30865、CocoLoop;模型架构、预训练数据量与 14 组队列-任务评测口径以官方博客所列为准。