MAR-пропуски (Missing At Random — «пропуски, случайные при условии наблюдаемых данных») — это механизм пропусков, при котором вероятность пропуска зависит только от наблюдаемых переменных, но не от самих пропущенных значений (после учёта всего, что мы наблюдаем).
По-русски иногда говорят «условно случайные пропуски».
Формально
Пусть:
- — полные данные, которые делятся на (наблюдаемые) и (пропущенные);
- — индикатор наблюдения: , если значение наблюдаем, , если пропущено.
Тогда MAR означает:
То есть после conditioning на наблюдаемые данные вероятность пропуска не зависит от пропущенной части.
Сравнение с MCAR и MNAR
| Механизм | Что означает | Пример |
|---|---|---|
| MCAR | Пропуск не зависит ни от каких данных | Анкеты потерялись при пересылке |
| MAR | Пропуск зависит только от наблюдаемых данных | Мужчины реже указывают доход, но если мы знаем пол, возраст и образование, пропуск дохода уже не зависит от самого дохода |
| MNAR | Пропуск зависит от самих пропущенных значений | Люди с очень высоким доходом не указывают доход даже после учёта пола и возраста |
Важно: MAR — это не то же самое, что «пропуски совсем случайны». Пропуски могут быть систематическими, но эта систематичность полностью объясняется наблюдаемыми переменными.
Примеры MAR
- Опрос о доходе. Молодые люди чаще отказываются указывать доход. Если возраст наблюдается, то при его учёте пропуск дохода можно считать MAR.
- Клиническое исследование. Пациенты с более тяжёлым исходным состоянием чаще выбывают. Если тяжесть на старте измерена и включена в модель, выбывание может быть MAR.
- Продольные данные. Пациент пропускает визит, потому что переехал; переезд связан с наблюдаемыми сопутствующими переменными (возраст, район), но не с его текущим состоянием здоровья.
MNAR-контрпример: пациент пропускает визит именно потому, что ему резко стало хуже. Это ухудшение — как раз то, что мы хотели измерить, но не измерили. Здесь уже MNAR.
Почему MAR важен
При MAR механизм пропусков называют игнорируемым, если параметры модели данных и модели пропусков различны. Это означает, что для получения корректных оценок не нужно явно моделировать механизм пропуска. Можно использовать:
- метод максимального правдоподобия на наблюдаемых данных (FIML);
- множественную импутацию (multiple imputation);
- линейные смешанные модели (LMM);
- обобщённые линейные смешанные модели (GLMM).
Именно поэтому LMM корректны при MAR: они используют все доступные наблюдения и учитывают корреляцию внутри кластеров, не требуя моделировать, почему именно возник пропуск.
Чего MAR не делает
- MAR не означает, что пропущенные и наблюдаемые значения одинаковы. Они могут систематически различаться, но эти различия объясняются наблюдаемыми переменными.
- MAR нельзя надёжно проверить по самим данным. Можно тестировать MCAR против MAR (например, тест Литла), но отличить MAR от MNAR без дополнительных предположений или внешней информации нельзя.
- При MAR обычный анализ «только по полным случаям» (complete-case) может быть смещён, если пропуск зависит от наблюдаемых переменных, связанных с исходом. Нужны методы, использующие все наблюдения.
В контексте смешанных моделей
Линейная смешанная модель даёт несмещённые оценки, если пропуски MAR. Если есть подозрение на MNAR, основной анализ при MAR дополняют анализом чувствительности:
- delta-adjustment;
- tipping point;
- selection models;
- pattern-mixture models;
- shared-parameter models.
Кратко
MAR-пропуски — это пропуски, вероятность которых зависит только от наблюдаемых данных и не зависит от пропущенных значений после учёта наблюдаемых. Это более слабое и реалистичное предположение, чем MCAR. При MAR многие современные методы (LMM, множественная импутация, FIML) дают корректные результаты без явного моделирования механизма пропуска. Однако MAR — это предположение, которое нельзя проверить по данным, и при подозрении на MNAR нужен анализ чувствительности.