Узел «Заполнение пропусков» обрабатывает пропущенные значения. Список параметров узла представлен в таблице ниже.
Таблица «Параметры узла "Заполнение пропусков"»
Параметр | Возможные значения и ограничения | Описание |
|---|---|---|
Название | Ручной ввод. | Название узла, которое будет отображаться в интерфейсе. |
Описание | Ручной ввод. | Описание узла. |
Создать общий индикатор пропущенных значений | Чекбокс. | Выбор данного чекбокса указывает на необходимость расчета общего для всех переменных набора данных индикатора пропущенных значений. |
Создать индивидуальные индикаторы пропущенных значений | Чекбокс. | Выбор данного чекбокса указывает на необходимость расчета индивидуальных индикаторов пропущенных значений для выбранной далее переменной. |
Максимальная доля пропусков | Ручной ввод. | Данный параметр указывает максимальную долю пропусков |
Выбор переменных для заполнения пропусков | Кнопка. | При выборе кнопки откроется окно Выбор переменных для заполнения пропусков. |
Drop duplicates | Чекбокс. | Выбор данного чекбокса дает доступ к раскрывающемуся списку переменных для удаления дубликатов. |
Drop dupes subset | Раскрывающийся список. | Список содержит все колонки датасета используемого в пайплайне и позволяет выбрать пространство данных для удаления дубликатов. |
Drop dupes keep | Раскрывающийся список. | Позволяет выбрать стратегию удаления дубликатов, first, last, none. |
Outliers method | Раскрывающийся список. | Позволяет стратегию удаления выбросов. |
В окне «Выбор переменных для заполнения пропусков» пользователь имеет возможность задать метод восстановления пропущенных данных. Для этого необходимо:
|
В зависимости от задачи, можно использовать тот или иной метод заполнения отсутствующих элементов. Заменить пропуски можно на:
Результаты выполнения узла:
В результате выполнения узла в наборе данных будут рассчитаны новые переменные с заполненными пропущенными значениями (с префиксом IMP_):
|
При установке флажка в чекбоксе Drop dupes появляется выпадающий список всех колонок, на основании которых необходимо удалить дубликаты.
В списке методов удаления необходимо выбрать, какая строка среди всех дублированных данных будет сохранена: первая, последняя или же будут удалены все дублирующиеся значения
При выборе Outliers method, отличного от none, появится выбор колонок, по которым будут оцениваться выбросы в наборе данных.
После этого можно в списке выбрать стратегию удаления выбросов, IQR, Z score, Winsorize.
При конфигурировании удаления выбросов можно для каждого метода выбрать необходимые параметры:
IQR – указать межквартильный размах, за пределами которого данные будут отброшены.
Winsorize – указать верхний и нижний процентили распределения данных.
Z score - указать значение меры в стандартных отклонениях.
|