Продольные данные (longitudinal data) — это данные, в которых один и тот же объект наблюдается многократно во времени. Каждому субъекту (пациенту, человеку, домохозяйству, фирме) соответствует несколько измерений, упорядоченных по времени.
По-русски также используют термины панельные данные и данные повторных измерений. Иногда между ними проводят различия: панельные данные чаще означают много объектов и мало моментов времени, продольные — меньше объектов, но больше временных точек. На практике эти термины часто взаимозаменяемы.
1. Отличие от поперечных данных
| Поперечные (cross-sectional) | Продольные (longitudinal) | |
|---|---|---|
| Наблюдений на объект | Одно | Несколько |
| Время | Один момент | Несколько моментов |
| Что можно изучать | Различия между объектами | Изменения внутри объекта |
| Пример | Опрос разных людей в 2024 году | Опрос одних и тех же людей каждый год |
Ключевое преимущество продольных данных: можно изучать динамику, то есть как объект меняется со временем, а не только статические различия.
2. Формальная запись
Обычно данные записываются в «длинном» формате:
- — объект (субъект, кластер);
- — момент времени;
- — значение отклика для -го объекта в момент ;
- — предикторы (могут быть постоянными во времени или меняться).
Пример:
| id | время | АД | препарат |
|---|---|---|---|
| 1 | 0 | 140 | A |
| 1 | 1 | 135 | A |
| 1 | 2 | 130 | A |
| 2 | 0 | 150 | B |
| 2 | 1 | 148 | B |
| 2 | 2 | 145 | B |
3. Основные свойства
- Корреляция внутри объекта. Измерения одного и того же человека похожи друг на друга. Обычная регрессия предполагает независимость наблюдений — здесь это нарушается.
- Между- и внутри-индивидуальная вариация. Можно отдельно оценивать, чем люди отличаются друг от друга, и как каждый меняется со временем.
- Временной порядок. Наблюдения упорядочены, и это важно (например, для автокорреляции).
- Несбалансированность. У разных объектов может быть разное число измерений и разные моменты времени.
- Пропуски и выбывание. Люди могут пропускать визиты или выходить из исследования. Механизм пропусков (MCAR, MAR, MNAR) критичен для выводов.
4. Примеры
- Артериальное давление у пациентов каждый месяц в клиническом исследовании.
- Рост и вес детей, измеряемые ежегодно.
- Доход домохозяйств по годам.
- Успеваемость учеников по четвертям.
- ВВП стран за 20 лет.
- Экспрессия генов у одного пациента в разные моменты лечения.
5. Задачи анализа
- Описать траектории изменения отклика.
- Оценить эффект лечения, времени, ковариат.
- Разделить эффекты между объектами и внутри объекта.
- Предсказать будущие значения.
- Изучить связь между изменением одной переменной и изменением другой.
- Скорректировать на информативное выбывание.
6. Методы анализа
- Линейные смешанные модели (LMM) — для непрерывного отклика.
- Обобщённые линейные смешанные модели (GLMM) — для бинарного, счётного отклика.
- GEE (generalized estimating equations) — маргинальные модели, фокус на популяционный эффект.
- Модели переходов (transition models) — отклик зависит от предыдущих значений.
- Модели роста (growth curve models) — траектории как функция времени.
- Совместные модели (joint models) — продольный отклик + время до события.
- Анализ выживаемости — если интересует время до выбывания/события.
- Байесовские иерархические модели.
7. Проблемы и тонкости
- Корреляция: нужно учитывать, иначе стандартные ошибки неверны.
- Пропуски: LMM корректны при MAR; при MNAR нужен анализ чувствительности.
- Несбалансированность: не все методы одинаково хорошо работают.
- Time-varying covariates: могут быть эндогенными (зависят от прошлого отклика).
- Выбор ковариационной структуры: независимость, compound symmetry, AR(1), unstructured.
- Отделение эффекта возраста, периода и когорты: в возраст-период-когорта анализе это известная проблема идентифицируемости.
8. Программное обеспечение
- R:
lme4,nlme,geepack,JM,joineR,brms. - Python:
statsmodels(MixedLM,GEE),PyMC. - SAS:
PROC MIXED,PROC GENMOD,PROC NLMIXED. - SPSS:
MIXED,GENLINMIXED. - Stata:
mixed,xtreg,xtgee,stjm.
Кратко
Продольные данные — это многократные измерения одних и тех же объектов во времени. Они позволяют изучать изменения внутри объекта, но требуют методов, учитывающих корреляцию между повторными наблюдениями и возможные пропуски. Основные инструменты — смешанные модели, GEE и совместные модели.