Запишетесь на полный курс Машинного обучения на Python по адресу [email protected]
Сходство или различие между объектами классификации или точность регрессии устанавливается в зависимости от выбранного метрического расстояния между предсказанным значением и истинным. Если каждый объект описывается i свойствами (признаками), то он может быть представлен как точка в i-мерном пространстве, и сходство с другими объектами будет определяться как соответствующее расстояние. При регрессии используются различные меры расстояния между объектами.
1. Евклидово расстояние
Это, пожалуй, наиболее часто используемая мера расстояния. Она является геометрическим расстоянием в многомерном пространстве и вычисляется следующим образом:
P = √Σ(Ai - Bi)^2
где:
P – расстояние между объектами A и B;
Ai – значение i-свойства объекта A;
Bi – значение i-свойства объекта B.
Естественное, с геометрической точки зрения, евклидова мера расстояния может оказаться бессмысленной, если признаки измерены в разных единицах. Чтобы исправить положение, прибегают к нормированию каждого признака. Применение евклидова расстояния оправдано в следующих случаях:
свойства (признаки) объекта однородны по физическому смыслу и одинаково важны для классификации или регрессии;
признаковое пространство совпадает с геометрическим пространством.
2. Квадрат евклидова расстояния
Данная мера расстояния используется в тех случаях, когда требуется придать больше значение более отдаленным друг от друга объектам.
3. Взвешенное евклидово расстояние
Применяется в тех случаях, когда каждому i-свойству удается приписать некоторый «вес» wi, пропорционально степени важности признака в задаче машинного обучения.
Определение весов, как правило, связано с дополнительными исследованиями, например, организацией опроса экспертов и обработкой их мнений.
4. L1-расстояние, или расстояние городских кварталов
Также называется манхэттенским, сити-блок расстоянием или Хемминговым расстоянием. Это расстояние является разностью по координатам. В большинстве случаев эта мера расстояния приводит к таким же результатам, как и для обычного расстояния Евклида. Однако отметим, что для этой меры влияние отдельных больших разностей (выбросов) уменьшается (так как они не возводятся в квадрат). L1-расстояние вычисляется по формуле:
P = Σ|Ai - Bi|
5. Расстояние Чебышева
Принимает значение наибольшего модуля разности между значениями соответствующих свойств (признаков) объектов:
P = MAX|Ai - Bi|
Если рассмотреть расстояние "на 1 клетку" в разных метриках, то самым маленьким будет расстояние Чебышева, затем Евклидово, затем L1.
6. Расстояние Минковского
Является обобщением расстоянием L1 (p=1), Евклида (p=2) и Чебышева (p=oo):
D = (Σ(Ai - Bi)^p)^(1/p)
7. Процент несогласия
Эта мера расстояния используется в тех случаях, когда свойства (признаки) объекта являются категориальными:
P = VALUE|Ai ≠ Bi|
Например, первый признак объекта – пол, второй – возраст, третий – место работы. Представим значения свойств (признаков) объекта в виде вектора значений. Первый вектор – (жен, 28 лет, учительница), второй вектор – (муж, 28 лет, менеджер). Процент несогласия равен 2/3. Эти вектора различаются на 66.6%.
Выбор меры расстояния и весов для классифицирующих свойств – очень важный этап, так как от этих процедур зависят состав и количество формируемых классов, а также степень сходства объектов внутри классов.
В большинстве случаев нормализация входных параметров, а также выбор L1-расстояния или процента несогласия в случае бинарных признаков позволяет добиться максимальной точности в задачах классификации.