Как машинное обучение выбирает соседей: разбор скрытых метрик
На Хабре опубликована статья о том, как алгоритмы kNN и k-means принимают решения на основе расстояний между точками данных. Автор DDPronin показывает, что стандартный подход скрывает важную информацию: какие именно признаки повлияли на классификацию.
Вместо того чтобы суммировать расстояния и терять детали, можно сохранить отдельные компоненты и понять, дал ли результат один доминирующий признак или равномерный вклад нескольких координат. Такой анализ применим и к стилометрии — определению авторства текстов по характерным чертам письма.
Источник: Хабр — всё
Новости этого рынка выходят у нас в телеграме первыми — @wikipulse.