中文精炼导读

核心观点

  • Google Research 发布 SensorFM:一个在超过一万亿分钟、来自 500 万人的可穿戴传感器数据上预训练的大型传感器基础模型,据称是迄今最大、最多样的可穿戴数据训练集。
  • SensorFM 用自监督的掩码重建(missing-aware masked reconstruction)直接从无标签数据学习,学习到"感知人类生理学"的通用表征,可迁移到心血管、代谢、睡眠、心理健康以及生活方式与人口统计等 35 个健康预测任务。
  • 模型与数据共同缩放(co-scaling)带来明确收益:最大变体 SensorFM-B 相比最小变体重建损失降低 31%,分类任务 AUC 平均提升 9%、回归任务 Pearson 系数平均提升 21%,且缩放曲线没有饱和迹象。
  • 冻结编码器 + 轻量线性探针即可在 34/35 个任务上超越特征工程监督基线;对抑郁症、焦虑症这类因人而异、只在传感器数据里留下微弱痕迹的"难测"状况,缩放后的预训练尤其有价值。
  • 一个由协作/竞争的 LLM agent 组成的"教室"能自动生成、测试并改进预测头代码(探索了 3 万多个候选方案);把 SensorFM 接入 Personal Health Agent 后,医生盲评显示其健康摘要质量显著优于基线,且与"直接喂真实标签"没有统计学显著差异。
SensorFM 总览
SensorFM 总览

内容精讲

据估计全球已有数十亿台可穿戴设备,精准追踪心率、运动、皮肤温度、血氧和睡眠,跨越数天、数周甚至数月。这种连续的纵向生理与行为数据流,是预防性、个性化健康最有前景的原材料之一。但把低层信号转化为有意义洞察仍很困难:第一,基线生理、生活方式与健康状况因人而异,在一个人身上预示风险的模式在另一个人身上可能毫无意义;第二,训练模型所需的标签(确诊、化验结果、有效问卷)昂贵、采集缓慢,且几乎无法回溯收集。因此大多数可穿戴健康模型只能"一次一个结局"地构建,用定制的监督流水线瞄准窄小的端点,难以在人类健康的广度上泛化。

SensorFM 换了一条路:直接从人群规模的、无标签的可穿戴数据学习。预训练语料采样自 500 万名同意将其数据用于健康与健康研究的参与者(2024 年 9 月至 2025 年 9 月),覆盖 100 多个国家、美国全部 50 个州、超过 20 款 Fitbit 与 Pixel Watch 设备型号。每位参与者取几周数据,合计超过 20 亿小时、即超过一万亿分钟的分钟级信号。SensorFM 摄取由五种传感器模态派生的 34 个分钟级聚合特征:光电容积脉搏波(PPG)、加速度计、皮肤电活动(EDA)、皮肤温度和高度计,共同捕捉心率与心率变异性、血氧饱和度、睡眠阶段、运动与步数、皮肤电导和温度,覆盖完整的 24 小时窗口。

预训练不依赖标签,通过自监督重建进行,建立在 LSM-2 及其 Adaptive and Inherited Masking(AIM)框架之上。这个设计选择至关重要,因为"缺失和碎片化数据"才是可穿戴设备的常态:传感器电源循环、设备脱腕、省电模式、传感器开关机等都会造成数据缺口。传统自监督方法假设完整、不间断的输入,只能被迫插值补全(可能引入偏差)或丢弃不完整窗口(浪费宝贵数据)。AIM 两条路都不走:它把真实世界的缺失当作自然产物,直接从"不完整记录"学习,把从真实缺口继承的 token 与为重建目标人工掩码的 token 一视同仁,从而得到"天生对缺失有感知"的表征——SensorFM 不仅能容忍碎片化数据,还能建设性地利用它。

缩放实验:数据与模型规模共同放大带来收益
缩放实验:数据与模型规模共同放大带来收益

任何基础模型的核心问题都是"规模是否转化为能力"。团队做了系统的缩放实验:预训练数据量跨越四个数量级(约 200 万到 20 亿传感器小时),模型规模也跨越四个数量级(10 万到 1 亿参数)。结果是清晰而鼓舞人心的:预训练损失随数据与容量增长而规律下降,且这些收益确实传导到下游健康任务。最大的 SensorFM-B 相比最小变体,重建损失降低 31%,分类任务平均提升 9% AUC、回归任务平均提升 21% Pearson 系数。最大的提升来自同时缩放两个维度:数据与容量按比例增加时,生成式预训练与判别式下游性能都产生近乎线性的增益,且曲线没有饱和迹象——在 35 个任务中 SensorFM-B 赢了 33 个。

为了检验表征的通用性,团队在三个独立的、经 IRB 批准的前瞻性研究(共 13,985 名参与者)上评估了 SensorFM 的 35 个判别式健康任务,横跨心血管健康、代谢风险、心理健康、睡眠、人口统计与生活方式六类。他们冻结 SensorFM 编码器、只训练一个轻量线性头,对比基于工程化特征的监督基线,发现:线性探针在 34/35 个任务上超越特征工程基线,无需任何任务特定架构(广泛泛化);加入人口统计特征(年龄、性别等)只带来小幅提升,且随模型缩放该提升缩小——更大模型在预训练中隐式学到了生理相关特征;对抑郁与焦虑这类"难测"状况,缩放后的预训练尤其有价值,SensorFM 似乎学到了通常淹没这类信号的个体差异、挑出了跨人群的模式;标签效率也很高——只需一小部分标注样本,SensorFM 就迅速超越仅人口统计和特征工程基线,而高质量标签稀缺恰恰是医疗场景的常态。

一个通用的 embedding 只与"适配它的成本"一样有用。传统上,把 embedding 变成每个新端点的强预测器需要手工特征工程、架构选择和超参调优。为了自动化这一切,团队构建了一个智能体"教室":一组协作又竞争的 LLM agent 迭代地生成、测试和改进可执行代码,在 SensorFM embedding 上构建预测头。实验探索了超过 30,000 个候选方案,agent 设计的头在 20 个分类任务中的 16 个、15 个回归任务中的 12 个击败了简单线性探针。两个规律浮现:解决方案质量随搜索单调提升,且与底层 LLM 的能力成正比——更强模型(如更新版 Gemini)产生更好方案,而 agent 间协作帮助较弱模型缩小差距。

最后验证 SensorFM 能否端到端有用——作为一个把 AI 健康教练"落地"在个人真实生理上的工具。团队把它集成进 Personal Health Agent,用 31 份真实参与者档案比较三种生成健康摘要的条件:人口统计 + 每日可穿戴指标 + SensorFM 预测;人口统计 + 每日指标 + 真实测量值;仅人口统计 + 每日指标(基线)。一组盲评医生按五个维度(上下文、相关性、可辩护性、个性化、危害潜力)打分,在超过 40 小时的专家评估中产生 1,860 条评分。结果引人注目:加入 SensorFM 预测在所有维度都显著改善了回答;而且"以 SensorFM 预测为grounding"与"以真实测量值为grounding"没有统计学显著差异——模型的推断服务 agent 的效果与真实标签几乎相当。

阅读价值

适合可穿戴健康研究、医疗 AI 与基础模型领域的从业者:这篇文章系统展示了"从单任务定制模型转向通用生理表征"的完整路径——数据构建、缺失感知预训练、缩放定律、下游泛化、agent 自动化适配与健康 agent 落地五个环节都有实证数据支撑;对想了解传感器基础模型到底能做什么、以及"AI 健康教练"可行性的人来说,是一份高质量参考。

阅读英文原文 → 返回 AI 技术文档

本文为中文精炼导读,由 AI 基于原文整理,内容与图片版权归原作者所有。原文: https://research.google/blog/sensorfm-towards-a-general-intelligence-and-interface-for-wearable-health-data/