Как проверить качество данных после очистки
Качество очищенного набора проверяют не по числу исправленных строк, а по тому, насколько данные пригодны для конкретной задачи. Для этого до обработки фиксируют исходное состояние, задают допустимые пороги и затем сравнивают полноту, корректность, уникальность и согласованность. Отдельно контролируют, не удалила ли процедура полезные записи.
Какие показатели действительно отражают качество?
Набор нельзя оценить одной универсальной величиной. Обычно используют несколько показателей, каждый из которых выявляет свой класс проблем: пропуски, дубли, недопустимые значения или противоречия между полями.
| Показатель | Что измеряет | Как рассчитывают |
|---|---|---|
| Полнота | Долю заполненных обязательных полей | Заполненные значения делят на ожидаемое число значений |
| Валидность | Соответствие формату, диапазону и бизнес-правилам | Корректные записи делят на все проверенные записи |
| Уникальность | Отсутствие повторяющихся сущностей | Уникальные записи сравнивают с общим объёмом набора |
| Согласованность | Отсутствие противоречий между полями и источниками | Считают записи, прошедшие межполевые проверки |
| Точность | Соответствие реальному или эталонному значению | Данные сопоставляют с надёжным контрольным источником |
Точность иногда невозможно проверить автоматически: для неё нужен эталон. Например, дата может соответствовать формату, но оставаться ошибочной по смыслу. Валидность здесь будет высокой, а точность — неизвестной.
Как задать правила до начала обработки?
Сначала нужно определить назначение набора и критичные поля. Одни и те же пропуски по-разному влияют на отчётность, прогнозную модель или каталог объектов, поэтому пороги выбирают по последствиям ошибки, а не по абстрактному представлению о порядке.
Правило должно содержать проверяемое условие и действие при нарушении. Для даты задают формат и допустимый период, для цены — диапазон и валюту, для идентификатора — обязательность и уникальность. Если значение не проходит проверку, его исправляют, отправляют на ручной разбор либо помечают как неизвестное. Простое удаление строки подходит не всегда.
Полезно заранее выделить контрольную выборку и сохранить исходную версию набора. Тогда результат можно сравнить не только с формальными ограничениями, но и с тем, что было потеряно или изменено. Без такой точки отсчёта обработка напоминает уборку при тусклом свете: поверхность выглядит чистой, однако часть нужных вещей могла исчезнуть вместе с мусором.
Как измерить результат после очистки?
После обработки повторяют те же проверки, которые выполнялись на исходном наборе. Сравнение должно показывать изменение каждого показателя, количество затронутых записей и причины исправлений.
- Зафиксировать объём набора до и после процедуры.
- Повторно вычислить полноту, валидность, уникальность и согласованность.
- Проверить контрольную выборку по эталонным источникам или вручную.
- Просмотреть записи, удалённые либо существенно изменённые автоматически.
- Сравнить распределения ключевых признаков и найти неожиданные сдвиги.
- Сохранить журнал правил, ошибок и выполненных действий.
Резкое сужение диапазона или исчезновение редкой категории может означать не улучшение, а чрезмерно жёсткий фильтр. Особенно внимательно проверяют выбросы: необычное значение бывает ошибкой, но иногда отражает реальный объект или событие.
Почему высокий общий показатель может вводить в заблуждение?
Средняя оценка скрывает локальные дефекты. Набор может быть почти полностью заполнен, но иметь пропуски именно в поле, от которого зависит расчёт целевого показателя.
Поэтому результаты разбивают по источникам, периодам, регионам, типам объектов или другим значимым сегментам. Такая детализация показывает, где проблема сосредоточена. Если ошибки приходят из одной системы, исправлять только итоговую таблицу мало: при следующей загрузке дефект появится снова.
Не менее опасна формальная уникальность. Две записи об одной сущности могут различаться пробелом, сокращением или написанием адреса. Проверка точного совпадения не заметит дубль, поэтому для отдельных полей применяют нормализацию и сопоставление по нескольким признакам. Границы такого объединения обычно проверяют на выборке вручную.
Когда набор можно считать готовым к использованию?
Данные готовы, когда критичные показатели достигли заданных порогов, изменения воспроизводимы, а оставшиеся ограничения известны пользователю. Полного отсутствия ошибок добиться удаётся не всегда; важнее понимать их масштаб и влияние на решение.
Перед публикацией отчёта или запуском модели фиксируют версию набора, дату проверки, применённые правила и нерешённые проблемы. Это превращает разовую обработку в контролируемый процесс. Если очередная загрузка меняет привычное распределение или приносит россыпь новых дублей, отклонение становится заметно сразу, ещё до того, как оно попадёт в график или расчёт.