MAR-пропуски (Missing At Random — «пропуски, случайные при условии наблюдаемых данных») — это механизм пропусков, при котором вероятность пропуска зависит только от наблюдаемых переменных, но не от самих пропущенных значений (после учёта всего, что мы наблюдаем).

По-русски иногда говорят «условно случайные пропуски».


Формально

Пусть:

  • — полные данные, которые делятся на (наблюдаемые) и (пропущенные);
  • — индикатор наблюдения: , если значение наблюдаем, , если пропущено.

Тогда MAR означает:

То есть после conditioning на наблюдаемые данные вероятность пропуска не зависит от пропущенной части.


Сравнение с MCAR и MNAR

МеханизмЧто означаетПример
MCARПропуск не зависит ни от каких данныхАнкеты потерялись при пересылке
MARПропуск зависит только от наблюдаемых данныхМужчины реже указывают доход, но если мы знаем пол, возраст и образование, пропуск дохода уже не зависит от самого дохода
MNARПропуск зависит от самих пропущенных значенийЛюди с очень высоким доходом не указывают доход даже после учёта пола и возраста

Важно: MAR — это не то же самое, что «пропуски совсем случайны». Пропуски могут быть систематическими, но эта систематичность полностью объясняется наблюдаемыми переменными.


Примеры MAR

  1. Опрос о доходе. Молодые люди чаще отказываются указывать доход. Если возраст наблюдается, то при его учёте пропуск дохода можно считать MAR.
  2. Клиническое исследование. Пациенты с более тяжёлым исходным состоянием чаще выбывают. Если тяжесть на старте измерена и включена в модель, выбывание может быть MAR.
  3. Продольные данные. Пациент пропускает визит, потому что переехал; переезд связан с наблюдаемыми сопутствующими переменными (возраст, район), но не с его текущим состоянием здоровья.

MNAR-контрпример: пациент пропускает визит именно потому, что ему резко стало хуже. Это ухудшение — как раз то, что мы хотели измерить, но не измерили. Здесь уже MNAR.


Почему MAR важен

При MAR механизм пропусков называют игнорируемым, если параметры модели данных и модели пропусков различны. Это означает, что для получения корректных оценок не нужно явно моделировать механизм пропуска. Можно использовать:

  • метод максимального правдоподобия на наблюдаемых данных (FIML);
  • множественную импутацию (multiple imputation);
  • линейные смешанные модели (LMM);
  • обобщённые линейные смешанные модели (GLMM).

Именно поэтому LMM корректны при MAR: они используют все доступные наблюдения и учитывают корреляцию внутри кластеров, не требуя моделировать, почему именно возник пропуск.


Чего MAR не делает

  • MAR не означает, что пропущенные и наблюдаемые значения одинаковы. Они могут систематически различаться, но эти различия объясняются наблюдаемыми переменными.
  • MAR нельзя надёжно проверить по самим данным. Можно тестировать MCAR против MAR (например, тест Литла), но отличить MAR от MNAR без дополнительных предположений или внешней информации нельзя.
  • При MAR обычный анализ «только по полным случаям» (complete-case) может быть смещён, если пропуск зависит от наблюдаемых переменных, связанных с исходом. Нужны методы, использующие все наблюдения.

В контексте смешанных моделей

Линейная смешанная модель даёт несмещённые оценки, если пропуски MAR. Если есть подозрение на MNAR, основной анализ при MAR дополняют анализом чувствительности:

  • delta-adjustment;
  • tipping point;
  • selection models;
  • pattern-mixture models;
  • shared-parameter models.

Кратко

MAR-пропуски — это пропуски, вероятность которых зависит только от наблюдаемых данных и не зависит от пропущенных значений после учёта наблюдаемых. Это более слабое и реалистичное предположение, чем MCAR. При MAR многие современные методы (LMM, множественная импутация, FIML) дают корректные результаты без явного моделирования механизма пропуска. Однако MAR — это предположение, которое нельзя проверить по данным, и при подозрении на MNAR нужен анализ чувствительности.