AI 快讯 编译自 marktechpost #模型发布#健康科技#可穿戴设备

Google 发布 SensorFM:基于万亿分钟传感器数据的可穿戴健康基础模型

Google Research 联合 DeepMind 推出 SensorFM,一个在超过 1 万亿分钟传感器数据上预训练的可穿戴健康基础模型。该模型使用 ViT-1D 架构,在 35 项健康预测任务中 34 项超越传统特征工程方法,并支持缺失数据自适应处理。本文详解其技术细节、扩展规律及对中文圈健康科技领域的启示。

编译发布 2026/07/10 原文发布 2026/07/10

一句话看懂

Google 发布 SensorFM,一个在 500 万人、超 1 万亿分钟传感器数据上预训练的健康基础模型,在 35 项任务中 34 项超越传统方法。

详细发生了什么

Google Research、Google DeepMind 与多所大学合作推出了 SensorFM,这是一个专为可穿戴健康时间序列表示学习设计的大规模传感器基础模型。模型输入来自 PPG、加速度计、EDA、皮肤温度和高度计五个传感器的 34 个一分钟聚合特征,按七类组织,使用 24 小时 context window。骨干网络是 ViT-1D 编码器,采用 masked-autoencoder 训练目标,patch size 为 [20, 1]。

预训练数据来自 500 万同意参与者,采样时间为 2024 年 9 月至 2025 年 9 月,覆盖 100 多个国家、美国所有 50 个州,以及 20 多种 Fitbit 和 Pixel Watch 型号,总计超过 20 亿小时(超 1 万亿分钟)。模型有四个变体(XXS、XS、S、B),参数从 138K 到 110M,每个变体使用成比例的数据量。评估使用独立数据,涵盖 13,985 名受试者,来自三项前瞻性 IRB 批准研究,涉及代谢、心脏、呼吸、睡眠和心理健康,共 35 项任务。

扩展实验显示,SensorFM-B 在 500 万数据上相比 XXS 将重建验证损失降低 31%,生成损失平均下降 28%,下游分类 AUC 提升 0.09,回归 r 提升 0.21。但模型容量超过数据量时会出现过拟合。模型还采用自适应与继承掩码(AIM)处理缺失数据,在随机插补任务上 MSE 降低 74.8%。

下游使用中,冻结编码器嵌入经 PCA-50 降维后训练线性分类头,在 35 项任务中 34 项击败手工特征工程基线。研究还使用 5 个 LLM 智能体自动搜索预测头,在 30,516 次实验中,智能体找到的头在 16/20 分类任务上优于线性探针。最后,临床评估显示,SensorFM 预测与真实标签在医生评分中无统计差异。

中文圈视角

SensorFM 对中文圈健康科技领域有几点直接启示:

  1. 国内可穿戴设备厂商的平替机会:华为、小米、OPPO 等拥有大量可穿戴用户数据,但缺乏类似的基础模型。SensorFM 的预训练范式(ViT-1D + masked-autoencoder)可直接复现,国内厂商可基于自有数据训练类似模型,用于心率异常预警、睡眠质量评估等场景。

  2. 数据隐私与合规挑战:SensorFM 使用 500 万参与者的数据,涉及 100+ 国家。国内健康数据受《个人信息保护法》和《数据安全法》严格监管,跨设备数据融合需用户明确同意,且数据出境受限。国内模型需在合规框架内设计,可能需与医院或研究机构合作获取脱敏数据。

  3. 中文场景的适配:模型基于 Fitbit/Pixel Watch 数据,国内主流设备(华为、小米)的传感器采样率和特征可能不同。中文用户的心血管、代谢疾病风险模型需重新训练或微调,但 SensorFM 的 AIM 缺失处理机制对国内设备常见的数据断连(如充电、摘表)有直接借鉴价值。

  4. 临床落地的差距:国内健康 AI 产品多聚焦单一任务(如房颤检测),SensorFM 的多任务能力可降低开发成本。但国内医疗 AI 监管要求三类医疗器械认证,模型作为“筛查工具”而非诊断工具,需与医院合作进行临床试验。

几条值得记住的细节

  • SensorFM 有四个变体:XXS(138K 参数)、XS(933K)、S(7.29M)、B(110.76M),每个使用成比例数据量。
  • 预训练数据来自 500 万参与者,覆盖 100+ 国家,20+ 设备型号,总计超 1 万亿分钟。
  • AIM 缺失处理机制在随机插补任务上 MSE 降低 74.8%,信号插补降低 83.7%。
  • 线性探针(PCA-50 + Logistic Regression)在 35 项任务中 34 项击败手工特征工程基线。
  • 临床评估中,4 名医生对 31 名真实用户的健康摘要评分,SensorFM 预测与真实标签无统计差异(p=0.396)。

一句话总结

SensorFM 证明大规模传感器预训练模型在健康预测上效果显著,国内可穿戴厂商可借鉴其技术路线,但需解决数据合规与设备适配问题。