Google SensorFM: foundation-модель на 1 трлн минут данных с фитнес-браслетов
Google обучила SensorFM на данных от 5 млн человек. Модель сначала выучивает структуру физиологических сигналов, а затем переиспользует представление для предсказаний по кардиологии, метаболизму и сну. На 34 из 35 задач эмбеддинги превзошли ручные признаки.
Что
Google представила SensorFM — foundation-модель для анализа данных с носимых устройств. Обучение проведено на более чем 1 триллионе минут сенсорных данных, собранных у 5 миллионов пользователей фитнес-браслетов.
Как
Ключевая архитектурная идея — двухэтапный подход. Вместо того чтобы сразу сжимать сырые сигналы (пульс, движение, температура) в грубые усреднённые метрики, модель сначала выучивает внутреннюю структуру и закономерности этих физиологических сигналов. Затем это общее представление переиспользуется для решения конкретных downstream-задач.
Цифры
- Объём данных: >1 трлн минут сенсорных данных.
- Размер датасета: данные от 5 млн человек.
- Качество: выученные эмбеддинги обошли инженерные (рукотворные) признаки на 34 из 35 задач предсказания.
Что перенять
Паттерн «сначала выучить структуру сырых сигналов, потом дообучать под задачу» применим к любым временным рядам с носимых устройств. Это аргумент против ручного фичеринга: если данных достаточно, эмбеддинги из предобученной модели могут заменить десятки рукотворных признаков.
Для данных с носимых устройств: предобученная модель на >1 трлн минут сырых сигналов даёт эмбеддинги, которые побеждают ручные признаки на 34/35 задач — эпоха ручного фичеринга для wearables заканчивается.