Продольные данные (longitudinal data) — это данные, в которых один и тот же объект наблюдается многократно во времени. Каждому субъекту (пациенту, человеку, домохозяйству, фирме) соответствует несколько измерений, упорядоченных по времени.

По-русски также используют термины панельные данные и данные повторных измерений. Иногда между ними проводят различия: панельные данные чаще означают много объектов и мало моментов времени, продольные — меньше объектов, но больше временных точек. На практике эти термины часто взаимозаменяемы.


1. Отличие от поперечных данных

Поперечные (cross-sectional)Продольные (longitudinal)
Наблюдений на объектОдноНесколько
ВремяОдин моментНесколько моментов
Что можно изучатьРазличия между объектамиИзменения внутри объекта
ПримерОпрос разных людей в 2024 годуОпрос одних и тех же людей каждый год

Ключевое преимущество продольных данных: можно изучать динамику, то есть как объект меняется со временем, а не только статические различия.


2. Формальная запись

Обычно данные записываются в «длинном» формате:

  • — объект (субъект, кластер);
  • — момент времени;
  • — значение отклика для -го объекта в момент ;
  • — предикторы (могут быть постоянными во времени или меняться).

Пример:

idвремяАДпрепарат
10140A
11135A
12130A
20150B
21148B
22145B

3. Основные свойства

  1. Корреляция внутри объекта. Измерения одного и того же человека похожи друг на друга. Обычная регрессия предполагает независимость наблюдений — здесь это нарушается.
  2. Между- и внутри-индивидуальная вариация. Можно отдельно оценивать, чем люди отличаются друг от друга, и как каждый меняется со временем.
  3. Временной порядок. Наблюдения упорядочены, и это важно (например, для автокорреляции).
  4. Несбалансированность. У разных объектов может быть разное число измерений и разные моменты времени.
  5. Пропуски и выбывание. Люди могут пропускать визиты или выходить из исследования. Механизм пропусков (MCAR, MAR, MNAR) критичен для выводов.

4. Примеры

  • Артериальное давление у пациентов каждый месяц в клиническом исследовании.
  • Рост и вес детей, измеряемые ежегодно.
  • Доход домохозяйств по годам.
  • Успеваемость учеников по четвертям.
  • ВВП стран за 20 лет.
  • Экспрессия генов у одного пациента в разные моменты лечения.

5. Задачи анализа

  • Описать траектории изменения отклика.
  • Оценить эффект лечения, времени, ковариат.
  • Разделить эффекты между объектами и внутри объекта.
  • Предсказать будущие значения.
  • Изучить связь между изменением одной переменной и изменением другой.
  • Скорректировать на информативное выбывание.

6. Методы анализа

  • Линейные смешанные модели (LMM) — для непрерывного отклика.
  • Обобщённые линейные смешанные модели (GLMM) — для бинарного, счётного отклика.
  • GEE (generalized estimating equations) — маргинальные модели, фокус на популяционный эффект.
  • Модели переходов (transition models) — отклик зависит от предыдущих значений.
  • Модели роста (growth curve models) — траектории как функция времени.
  • Совместные модели (joint models) — продольный отклик + время до события.
  • Анализ выживаемости — если интересует время до выбывания/события.
  • Байесовские иерархические модели.

7. Проблемы и тонкости

  • Корреляция: нужно учитывать, иначе стандартные ошибки неверны.
  • Пропуски: LMM корректны при MAR; при MNAR нужен анализ чувствительности.
  • Несбалансированность: не все методы одинаково хорошо работают.
  • Time-varying covariates: могут быть эндогенными (зависят от прошлого отклика).
  • Выбор ковариационной структуры: независимость, compound symmetry, AR(1), unstructured.
  • Отделение эффекта возраста, периода и когорты: в возраст-период-когорта анализе это известная проблема идентифицируемости.

8. Программное обеспечение

  • R: lme4, nlme, geepack, JM, joineR, brms.
  • Python: statsmodels (MixedLM, GEE), PyMC.
  • SAS: PROC MIXED, PROC GENMOD, PROC NLMIXED.
  • SPSS: MIXED, GENLINMIXED.
  • Stata: mixed, xtreg, xtgee, stjm.

Кратко

Продольные данные — это многократные измерения одних и тех же объектов во времени. Они позволяют изучать изменения внутри объекта, но требуют методов, учитывающих корреляцию между повторными наблюдениями и возможные пропуски. Основные инструменты — смешанные модели, GEE и совместные модели.