Линейная смешанная модель (Linear Mixed Model, LMM) — это статистическая модель, обобщающая обычную линейную регрессию. Она одновременно содержит фиксированные и случайные эффекты и применяется для данных с групповой (кластерной) структурой: повторные измерения у одного пациента, ученики в классах, наблюдения в семьях и т.п.


1. Идея

  • Фиксированные эффекты — общие для всей популяции. Это то, что обычно интересует исследователя: эффект лечения, времени, пола, возраста. Оцениваются как коэффициенты регрессии.
  • Случайные эффекты — индивидуальные отклонения для каждого кластера (пациента, класса, больницы). Они считаются случайными величинами из общего распределения и позволяют учесть, что наблюдения внутри одной группы похожи друг на друга.

2. Формула

Для кластера :

  • — вектор наблюдений для -го кластера;
  • — матрица предикторов фиксированных эффектов;
  • — вектор фиксированных коэффициентов;
  • — матрица предикторов случайных эффектов;
  • — случайные эффекты кластера;
  • — ошибки внутри кластера.

Для отдельного наблюдения в кластере :

Маргинально:

То есть корреляция внутри кластера возникает из-за случайных эффектов и/или структуры ошибок.


3. Пример

Исследуется влияние препарата на артериальное давление. Пациенты измеряются несколько раз.

Модель:

  • — фиксированные эффекты: средний эффект препарата, времени, взаимодействия;
  • — случайный перехват пациента (индивидуальный исходный уровень);
  • — случайный наклон по времени (индивидуальная динамика);
  • — остаточная ошибка.

Модель учитывает, что измерения одного пациента коррелированы и что пациенты могут по-разному реагировать на время.


4. Оценивание

Используются:

Сначала оцениваются компоненты дисперсии (, ), затем фиксированные эффекты через обобщённый МНК. Случайные эффекты предсказываются как BLUP (best linear unbiased predictors).


5. Проверка гипотез

Для фиксированных эффектов:

  • Wald-тесты;
  • t-тесты с приближёнными степенями свободы (Satterthwaite, Kenward–Roger);
  • доверительные интервалы.

Для сравнения моделей:

  • тест отношения правдоподобия (LRT);
  • AIC, BIC;
  • бутстрап;
  • байесовские методы.

Важно: обычные p-значения из lmer в R могут быть неадекватными, поэтому используют lmerTest или pbkrtest.


6. Структура случайных эффектов

Примеры в R:

  • случайный перехват: (1 | id);
  • случайный наклон: (0 + time | id) или (time | id);
  • коррелированные перехват и наклон: (1 + time | id);
  • некоррелированные: (1 | id) + (0 + time | id).

Бывают:

  • вложенные случайные эффекты (ученики внутри классов);
  • перекрёстные случайные эффекты (испытуемые и стимулы).

7. Ковариационные структуры ошибок

Для часто используют:

  • независимость: ;
  • compound symmetry — одинаковая корреляция внутри кластера;
  • AR(1) — корреляция убывает со временем;
  • Toeplitz;
  • unstructured.

Выбор структуры влияет на стандартные ошибки и выводы.


8. Преимущества

  • Корректно работает с несбалансированными данными.
  • Учитывает корреляцию внутри кластеров.
  • Позволяет оценить вариацию между группами.
  • Может работать с пропусками, если они MAR (missing at random).
  • Даёт более эффективные оценки, чем усреднение по кластерам.

9. Ограничения

  • Сложнее в интерпретации, чем обычная регрессия.
  • Требует корректной спецификации случайных эффектов.
  • Возможны проблемы сходимости.
  • p-значения для фиксированных эффектов не всегда тривиальны.
  • Предполагает нормальность случайных эффектов и ошибок.
  • Не спасает от MNAR-пропусков.

10. Программное обеспечение

  • R: lme4 (lmer), nlme (lme), lmerTest, brms.
  • Python: statsmodels (MixedLM), PyMC.
  • Julia: MixedModels.jl.
  • SAS: PROC MIXED.
  • SPSS: MIXED.
  • Stata: mixed.

Кратко

Линейная смешанная модель = линейная регрессия + случайные эффекты для кластеров. Она описывает как популяционные закономерности (фиксированные эффекты), так и индивидуальные различия (случайные эффекты), корректно учитывая корреляцию внутри групп. Это один из основных инструментов для продольных и иерархических данных. При пропусках LMM даёт корректные оценки, если пропуски MAR; при подозрении на MNAR-пропуски нужен анализ чувствительности.