Узел «Заполнение пропусков» обрабатывает пропущенные значения. Список параметров узла представлен в таблице ниже. 


Таблица «Параметры узла "Заполнение пропусков"»

Параметр

Возможные значения и ограничения

Описание

Название

Ручной ввод.
Ограничений на значение нет.

Название узла, которое будет отображаться в интерфейсе.

Описание

Ручной ввод.
Ограничений на значение нет.

Описание узла.

Создать общий индикатор пропущенных значений

Чекбокс.

Выбор данного чекбокса указывает на необходимость расчета общего для всех переменных набора данных индикатора пропущенных значений.
После успешного выполнения узла созданный индикатор можно найти по ссылке «Выходные параметры». Ему будет назначена роль Предиктора с типом Binary.

Создать индивидуальные индикаторы пропущенных значений

Чекбокс.

Выбор данного чекбокса указывает на необходимость расчета индивидуальных индикаторов пропущенных значений для выбранной далее переменной.
После успешного выполнения узла созданный индикатор можно найти по ссылке «Выходные параметры». Ему будет назначена роль Предиктора с типом Binary.

Максимальная доля пропусков

Ручной ввод.

Данный параметр указывает максимальную долю пропусков

Выбор переменных для заполнения пропусков

Кнопка.

При выборе кнопки откроется окно Выбор переменных для заполнения пропусков.

Drop duplicates

Чекбокс.

Выбор данного чекбокса дает доступ к раскрывающемуся списку переменных для удаления дубликатов.

Drop dupes subset

Раскрывающийся список.

Список содержит все колонки датасета используемого в пайплайне и позволяет выбрать пространство данных для удаления дубликатов.

Drop dupes keep

Раскрывающийся список.

Позволяет выбрать стратегию удаления дубликатов, first, last, none.

Outliers method

Раскрывающийся список.

Позволяет стратегию удаления выбросов.


В окне «Выбор переменных для заполнения пропусков» пользователь имеет возможность задать метод восстановления пропущенных данных. Для этого необходимо:



В зависимости от задачи, можно использовать тот или иной метод заполнения отсутствующих элементов. Заменить пропуски можно на:

Результаты выполнения узла:

В результате выполнения узла в наборе данных будут рассчитаны новые переменные с заполненными пропущенными значениями (с префиксом IMP_):


При установке флажка в чекбоксе Drop dupes появляется выпадающий список всех колонок, на основании которых необходимо удалить дубликаты.
В списке методов удаления необходимо выбрать, какая строка среди всех дублированных данных будет сохранена: первая, последняя или же будут удалены все дублирующиеся значения
При выборе Outliers method, отличного от none, появится выбор колонок, по которым будут оцениваться выбросы в наборе данных.
После этого можно в списке выбрать стратегию удаления выбросов, IQR, Z score, Winsorize.
При конфигурировании удаления выбросов можно для каждого метода выбрать необходимые параметры:
IQR – указать межквартильный размах, за пределами которого данные будут отброшены.
Winsorize – указать верхний и нижний процентили распределения данных.
Z score - указать значение меры в стандартных отклонениях.