В основе узла «Дерево решений» лежит алгоритм, обобщающий наблюдения правилами вида «Если…, то…» в иерархическую, последовательную структуру в виде дерева. Правила генерируются в процессе обучения.
Данная иерархическая структура состоит из двух типов элементов — узлов и листьев.
Алгоритм работы: Процесс построения деревьев решений представляет собой последовательное, рекурсивное разбиение множества наблюдений на подмножества с применением решающих правил в узлах. Разбиение продолжается до момента, пока не будет достигнуто условие остановки алгоритма. Последний узел, который не осуществляет проверку и разбиение, становится листом.
Список параметров узла представлен в таблице ниже.


Таблица «Параметры узла "Дерево решений"»

Параметр

Возможные значения и ограничения

Описание

Название

Ручной ввод.
Ограничений на значение нет.

Название узла, которое будет отображаться в интерфейсе.

Описание

Ручной ввод.
Ограничений на значение нет.

Описание узла.

Критерий разбиения

Раскрывающийся список со следующими значениями:

  • squared error (по умолчанию),
  • friedman mse,
  • absolute error,
  • poisson.

Данный параметр задает критерий разбиения для регрессионной задачи. Предусмотрены следующие критерии:

  • squared error (среднеквадратичная ошибка),
  • friedman mse (среднеквадратичная ошибка с оценкой улучшения Фридмана),
  • absolute error (средняя абсолютная ошибка),
  • poisson (отклонение Пуассона).

Стратегия разбиения

Раскрывающийся список со следующими значениями:

  • best (по умолчанию),
  • random.

Данный параметр задает стратегию разделения на каждом узле. Предусмотрены следующие стратегии:

  • best – выбор наилучшей функции сегментации и точки сегментации.
  • random – случайное разделение.

Максимальная глубина

Ручной ввод.
Неотрицательное число.
По умолчанию — 5.

Данный параметр задает максимальную глубину дерева, после достижения которой алгоритм останавливает работу.

Минимальное количество наблюдений для разбиения

Ручной ввод.
Неотрицательное число.
По умолчанию — 2.

Данный параметр задает минимальное количество наблюдений, которое должно быть в разбиении.

Минимальное количество наблюдений в листе

Ручной ввод.
Неотрицательное число.
По умолчанию — 5.

Данный параметр задает минимальное количество наблюдений, которое может быть в листе.

Минимальная доля веса наблюдений в листе

Ручной ввод.
Неотрицательное число.
По умолчанию — 0.

Данный параметр определяет минимальный весовой коэффициент выборки в листовом узле. По умолчанию наблюдения имеют одинаковый вес.

Максимальное количество признаков

Раскрывающийся список со следующими значениями:

  • all (по умолчанию),
  • sqrt,
  • log2,
  • number,
  • frac.

Данный параметр определяет максимальное количество признаков, которое будет учитываться при поиске лучшего разделения. Предусмотрены следующие варианты:

  • all – учитывать все доступные признаки.
  • sqrt – учитывать sqrt (число всех доступных признаков).
  • log2 – учитывать log2 (число всех доступных признаков).
  • number – учитывать указанное число признаков.
  • frac – учитывать int (указанное число * число всех доступных признаков).
    При выборе number или frac появится дополнительный параметр Число (вводится int) и Frac (вводится float) соответственно.

Сид дерева

Ручной ввод.
По умолчанию — 12345.

Начальное числовое значение для генератора случайных чисел.

Максимальное количество листов

Ручной ввод.
Неотрицательное число.
По умолчанию — 0.

Данный параметр определяет максимальное количество листов в дереве.

Минимальное снижение неоднородности

Ручной ввод.
Неотрицательное число.
По умолчанию — 0.

Данный параметр определяет минимальное снижение неоднородности.
Узел будет разделен, если это разделение вызовет уменьшение неоднородности большее или равное указанному значению.

Альфа для обрезки дерева

Ручной ввод.
По умолчанию — 0.

Данный параметр регулирует количество отсекаемых узлов. Чем больше значение ccp_alpha, тем большее количество узлов удаляется из дерева.

Использовать кросс-валидацию

Чекбокс.

Установленный чекбокс предполагает использование кросс-валидации. Необходимо указать количество разбиений (по умолчанию 5).
При необходимости настройте стратификацию. Для этого требуется установить соответствующий чекбокс и указать переменную из выпадающего списка.

Автоподбор параметров

Чекбокс.

Установленный чекбокс предполагает использование автоподбора гиперпараметров:

  • Количество итераций подбора (10 по умолчанию).
  • Метрика для оптимизации (mse или mae).
  • Оценка точности автоподбора (Заданная валидационная выборка, новая валидационная выборка, кросс-валидация).
  • Количество потоков автоподбора (0 по умолчанию).
  • Количество потоков кросс-валидации (1 по умолчанию).
  • Лимит времени на оптимизацию (3600 по умолчанию).
  • Тип сэмплера (Random, TPE, CMAES, NSGAII, QMC).
  • Критерий разбиения (squared error, friedman_mse, Absolute error, poisson).
  • Стратегия разбиения (best, random).
  • Максимальная глубина (от, до).
  • Минимальное количество наблюдений для разбиения.
  • Минимальное количество наблюдений в листе.
  • Максимальное количество признаков (all, sqrt, log2, number, frac).
  • Минимальная доля ввеса наблюдений в листе.
  • Максимальное количество листов.
  • Минимальное снижение неоднородности.
  • Альфа для обрезки дерева.



Результаты выполнения узла:
Узел «Дерево решений» имеет разные результаты в зависимости от решаемой задачи.
Результаты бинарной классификации представлены следующими объектами:

  • График ROC.


Пример графика ROC



  • График Lift.


Пример графика Lift
  • График Cumulative Lift.


Пример графика Cumulative Lift



  • График Gain.


Пример графика Gain



  • График Cumulative Gain.


Пример графика Cumulative Gain



  • Диаграмма дерева решений.


Пример графика дерева решений



  • Матрица ошибок для обучающей, тестовой и валидационной выборки (в зависимости от настройки распределения выборки).
    • Матрица ошибок, обучающая.


Матрица ошибок, обучающая




    • Матрица ошибок, тестовая.


Матрица ошибок, тестовая




    • Матрица ошибок, валидационная.


Матрица ошибок, валидационная




  • Таблица с примером данных.


Таблица с примером данных


  • Таблица с метриками качества модели.


Пример таблицы с метриками качества модели
  • Таблица со списком переменных, отсортированных по важности.


Пример таблицы со списком переменных, отсортированных по важности


Результаты многоклассовой классификации представлены следующими объектами:

  • Диаграмма дерева решений (см. рисунок «Пример графика дерева решений» выше).
  • Таблица с метриками качества модели.


Пример таблицы с метриками качества модели
  • Таблица с метриками качества модели для задачи классификации.


Пример таблицы с метриками качества модели для задачи классификации



  • Таблица со списком переменных, отсортированных по важности.


Пример таблицы со списком переменных, отсортированных по важности



Результаты регрессии представлены следующими объектами:

  • Тепловые карты обучающей, тестовой и валидационной выборок.


Пример тепловой карты на данных обучающей выборки



  • Диаграмма дерева решений.


Пример диаграммы дерева решений для задачи регрессии



  • Таблица с метриками качества модели.


Пример таблицы с метриками качества модели



  • Нет меток