Узел «Разделение выборки» разбивает набор данных на части: обучающую (используемую в процессе обучения модели), валидационную (используемую для подбора оптимального набора гиперпараметров модели) и тестовую согласно выбранным пропорциям.

Список параметров узла представлен в таблице ниже.

Таблица «Параметры узла "Разделение выборки"»

Параметр

Возможные значения и ограничения

Описание

Название

Ручной ввод.
Ограничений на значение нет.

Название узла, которое будет отображаться в интерфейсе.

Описание

Ручной ввод.
Ограничений на значение нет.

Описание узла.

Разделение выборки на части

Ручной ввод доли (в %) для каждой части.
Сумма долей должна быть равна 100%.

Доли обучающей, валидационной и тестовой выборок в исходном наборе данных.

Метод разбиения

Раскрывающийся список со следующими значениями:

  • Simple Random (по умолчанию).
  • Stratified.

Метод разбиения исходного набора данных. Предусмотрены:

  • Simple Random — все наблюдения имеют одинаковый шанс быть отобранными.
  • Stratified — случайный отбор наблюдений выполняется в пределах каждого класса.

Seed

Ручной ввод числового значения.
По умолчанию — 12345.

Начальное числовое значение для генератора случайных чисел.

Результаты выполнения узла:

Таблица с указанием долей наблюдений, попавших в соответствующую выборку. Для изменения доли воспользуйтесь спиннером справа от числового поля или введите значение вручную.

Пример таблицы с указанием долей выборок


  • Нет меток