Узел «Заполнение пропусков» обрабатывает пропущенные значения. Список параметров узла представлен в таблице ниже. 


Таблица «Параметры узла "Заполнение пропусков"»

Параметр

Возможные значения и ограничения

Описание

Название

Ручной ввод.
Ограничений на значение нет.

Название узла, которое будет отображаться в интерфейсе.

Описание

Ручной ввод.
Ограничений на значение нет.

Описание узла.

Создать общий индикатор пропущенных значений

Чекбокс.

Выбор данного чекбокса указывает на необходимость расчета общего для всех переменных набора данных индикатора пропущенных значений.
После успешного выполнения узла созданный индикатор можно найти по ссылке «Выходные параметры». Ему будет назначена роль Предиктора с типом Binary.

Создать индивидуальные индикаторы пропущенных значений

Чекбокс.

Выбор данного чекбокса указывает на необходимость расчета индивидуальных индикаторов пропущенных значений для выбранной далее переменной.
После успешного выполнения узла созданный индикатор можно найти по ссылке «Выходные параметры». Ему будет назначена роль Предиктора с типом Binary.

Максимальная доля пропусков

Ручной ввод.

Данный параметр указывает максимальную долю пропусков

Выбор переменных для заполнения пропусков

Кнопка.

При выборе кнопки откроется окно Выбор переменных для заполнения пропусков.

Drop duplicates

Чекбокс.

Выбор данного чекбокса дает доступ к раскрывающемуся списку переменных для удаления дубликатов.

Drop dupes subset

Раскрывающийся список.

Список содержит все колонки датасета используемого в пайплайне и позволяет выбрать пространство данных для удаления дубликатов.

Drop dupes keep

Раскрывающийся список.

Позволяет выбрать стратегию удаления дубликатов, first, last, none.

Outliers method

Раскрывающийся список.

Позволяет стратегию удаления выбросов.


В окне «Выбор переменных для заполнения пропусков» пользователь имеет возможность задать метод восстановления пропущенных данных. Для этого необходимо:

  • В столбце «Выбрать» нажать на чекбокс и при необходимости изменить Стратегию заполнения.
  • При выборе стратегии заполнения Константой нужно указать ее значение в соответствующем столбце.
  • Сохранить изменения.


Окно Выбор переменных для заполнения пропусков


В зависимости от задачи, можно использовать тот или иной метод заполнения отсутствующих элементов. Заменить пропуски можно на:

  • Моду – наиболее часто встречающееся значение (подходит для категориальных переменных).
  • Константу – выбранное конкретное значение.
  • Среднее – находится суммированием всех чисел в выборке и делением полученной суммы на количество чисел.
  • Медиану – если взять все элементы множества и отсортировать, то это число делит множество пополам. Одна половина множества равна или больше этого числа, а другая меньше или равна этому числу.
  • Минимум.
  • Максимум.

Результаты выполнения узла:

  • Таблица с примером данных. Отображаются первые 100 наблюдений.
  • Таблица с количеством пропусков по каждой переменной набора данных.
  • Таблица замененных значений.

В результате выполнения узла в наборе данных будут рассчитаны новые переменные с заполненными пропущенными значениями (с префиксом IMP_):

Результаты выполнения узла «Заполнение пропусков»


При установке флажка в чекбоксе Drop dupes появляется выпадающий список всех колонок, на основании которых необходимо удалить дубликаты.
В списке методов удаления необходимо выбрать, какая строка среди всех дублированных данных будет сохранена: первая, последняя или же будут удалены все дублирующиеся значения
При выборе Outliers method, отличного от none, появится выбор колонок, по которым будут оцениваться выбросы в наборе данных.
После этого можно в списке выбрать стратегию удаления выбросов, IQR, Z score, Winsorize.
При конфигурировании удаления выбросов можно для каждого метода выбрать необходимые параметры:
IQR – указать межквартильный размах, за пределами которого данные будут отброшены.
Winsorize – указать верхний и нижний процентили распределения данных.
Z score - указать значение меры в стандартных отклонениях.


Настройки удаления дубликатов


  • Нет меток