Пояснение: Как регуляризация L1 автоматически выбирает признаки?

Понять процесс автоматического выбора признаков, выполняемый с помощью регуляризации L1 (LASSO).

Отбор признаков — это процесс выбора оптимального подмножества признаков из заданного набора признаков; Оптимальным подмножеством является то, которое максимизирует производительность модели при решении данной задачи.

Выбор признаков может быть ручным процессом, или, точнее, явным процессом, выполняемым с использованием методов фильтрации или обертывания . В этих методах признаки многократно добавляются или удаляются на основе фиксированного значения метрики, которая определяет важность признака для прогнозирования. Этими метриками могут быть прирост информации, дисперсия или статистика хи-квадрат, и алгоритм будет принимать решение о принятии или отклонении признака на основе фиксированного порогового значения метрики. Важно отметить, что эти методы не являются частью этапа обучения модели и выполняются заранее.

Каким образом регуляризация L1 автоматически выбирает признаки?

Встроенные методы неявно идентифицируют признаки без использования каких-либо заранее определенных критериев отбора и извлекают их непосредственно из обучающих данных. Этот процесс идентификации внутренних признаков является частью фазы обучения модели. Модель учится одновременно идентифицировать признаки и делать соответствующие прогнозы. В последующих разделах мы опишем роль регуляризации в этом процессе идентификации внутренних признаков, сосредоточившись на L1-регуляризации и ее роли в улучшении моделей машинного обучения.

Нормализация и сложность модели: передовые стратегии повышения производительности

Регуляризация — это процесс снижения сложности модели с целью избежать переобучения и добиться обобщения для поставленной задачи.

В данном случае сложность модели аналогична ее способности адаптироваться к закономерностям в обучающих данных. Предположим, что модель представляет собой простой полином от ' x ' со степенью ' d '. Чем выше степень ' d ' полинома, тем гибче становится модель в улавливании закономерностей в наблюдаемых данных. Эта повышенная гибкость может привести к тому, что модель будет запоминать обучающие данные, а не изучать фактические закономерности, что снизит ее способность к обобщению на новые данные.

Переобучение и недообучение

При попытке подогнать полиномиальную модель степени d = 2 к набору обучающих выборок, полученных из полинома третьей степени с некоторым шумом, модель не сможет адекватно отразить распределение выборки. Модель просто не обладает необходимой гибкостью или сложностью для моделирования данных, сгенерированных полиномами третьей степени (или выше). Такая модель считается недообученной на обучающих данных. Недообучение указывает на то, что модель слишком упрощена и не может уловить скрытые закономерности в данных.

Рассматривая тот же пример, предположим теперь, что у нас есть модель со степенью d = 6. Теперь, с увеличением сложности, модель должна легко оценивать исходный кубический полином, использованный для генерации данных (например, устанавливая коэффициенты всех членов с показателями степени > 3 равными 0). Если процесс обучения не будет завершен вовремя, модель продолжит использовать свою дополнительную гибкость для дальнейшего уменьшения ошибки и начнет также учитывать шумовые образцы. Это значительно уменьшит ошибку обучения, но модель теперь страдает от перегрузки обучающих данных. Шум будет изменяться в реальных условиях (или во время тестирования), и любые знания, основанные на прогнозах, будут нарушены, что приведет к высокой ошибке тестирования. Перегрузка означает, что модель слишком сложна и обучается на шуме вместо фактического сигнала.

 

Как определить оптимальную сложность модели?

На практике мы часто имеем ограниченное или не имеем никакого представления о процессе генерации данных или об их истинном распределении. Поиск оптимальной модели с подходящей сложностью, исключающей недообучение или переобучение, представляет собой серьезную задачу. Это требует использования эффективных методов оценки производительности моделей и определения подходящей сложности, которая обеспечивает наилучший баланс между точностью и универсальностью. Используя соответствующие метрики оценки и методы, такие как перекрестная проверка, специалисты могут определить модель, которая лучше всего работает на неизвестных данных, тем самым избегая проблем, связанных с переобучением или недообучением.

 

Один из возможных методов — начать с достаточно надежной модели, а затем уменьшить ее сложность путем выбора признаков. Чем меньше функций, тем менее сложна модель.

Как мы обсуждали в предыдущем разделе, выбор признаков может быть явным (методы фильтрации, методы свертки) или неявным. Избыточные признаки, которые не очень важны для определения значения целевой переменной, следует удалить, чтобы избежать изучения моделью некоррелированных закономерностей в них. Регуляризация также выполняет аналогичную задачу. Итак, как регуляризация и выбор признаков связаны с достижением общей цели оптимальной сложности модели? Снижение сложности моделей машинного обучения имеет решающее значение для повышения производительности и предотвращения переобучения, на чем и сосредоточены как регуляризация, так и отбор признаков.

 

Регуляризация L1 как определитель признаков

Продолжая рассмотрение нашей полиномиальной модели, представим её как функцию от f с входными параметрами x , коэффициентами θ и степенью d.

В полиномиальной модели каждая степень входного сигнала x_i может рассматриваться как признак, образующий следующий вектор:

Мы также определяем целевую функцию, упрощение которой приводит к идеальным параметрам θ* и включает в себя термин регуляризация , который штрафует сложность модели.

Чтобы найти минимум этой функции, нам необходимо проанализировать все критические точки, то есть точки, где производная равна нулю или не определена.

Частную производную по одному из параметров, θj , можно записать следующим образом:

Функция sgn определяется следующим образом:

Примечание : Производная абсолютной функции отличается от функции знака (sgn), определенной выше. Исходная производная не определена в точке x = 0. Мы расширяем определение, чтобы исключить точку перегиба в точке x = 0 и сделать функцию дифференцируемой по всей ее области определения. Кроме того, фреймворки машинного обучения (ML) используют эти расширенные функции, когда основные арифметические операции включают абсолютную функцию. См. эту ссылку на форуме PyTorch.

Вычислив частную производную целевой функции по единственному коэффициенту θj и приравняв её к нулю, мы можем построить уравнение, связывающее оптимальное значение θj с прогнозами, целями и характеристиками.

Рассмотрим приведенное выше уравнение. Если предположить, что входные и целевые значения были центрированы вокруг среднего (т. е. данные были стандартизированы на этапе предварительной обработки), то левая часть уравнения фактически представляет собой дисперсию между значением признака j и разностью между ожидаемым и целевым значениями.

 

Статистическая ковариация между двумя переменными определяет степень влияния одной переменной на значение второй переменной (и наоборот).

Функция знака в правой части уравнения заставляет дисперсию в левой части принимать только три значения (поскольку функция знака возвращает только -1, 0 и 1). Если признак j не нужен и не влияет на прогнозы, дисперсия будет близка к нулю, что делает соответствующий коэффициент θj* равным нулю. В результате признак удаляется из модели. Этот процесс помогает уменьшить сложность и улучшить производительность модели.

 

Представьте себе функцию знака как канавку, прорезанную водой. Вы можете войти в овраг (т. е. русло реки), но чтобы выбраться из него, вам придется столкнуться с огромными препятствиями или крутыми порогами. Регуляризация L1 создает «пороговый» эффект, аналогичный градиенту функции потерь. Градиент должен быть достаточно сильным, чтобы преодолеть барьеры или стать нулевым, в конечном итоге сделав значение коэффициента нулевым.

Чтобы привести более реалистичный пример, рассмотрим набор данных, содержащий выборки, полученные из прямой линии (двухфакторная параметризация) с некоторым добавленным шумом. Оптимальная модель не должна иметь более двух параметров, в противном случае она будет переобучен шуму в данных (с учетом дополнительной свободы/степени полинома). Изменение коэффициентов более высокой мощности в полиномиальной модели не влияет на разницу между целевыми значениями и прогнозами модели и, таким образом, уменьшает их дисперсию с признаком.

В процессе обучения к градиенту функции потерь добавляется/вычитается фиксированный шаг. Если градиент функции потерь (MSE – средняя квадратическая ошибка) меньше постоянного шага, коэффициент в конечном итоге достигнет значения 0. Обратите внимание на уравнение ниже, которое показывает, как коэффициенты обновляются с использованием градиентного спуска:


Если синяя часть выше меньше λα , которое само по себе является очень малым числом, то Δθj приблизительно равно постоянному шагу λα . Знак этого шага (красная часть) зависит от sgn(θj) , выход которого зависит от θj . Если значение θj положительно, т.е. больше ε , то sgn(θj) равно 1, что делает Δθj приблизительно равным -λα , приближая его к нулю.

Чтобы подавить постоянный шаг (красная часть), делающий коэффициент нулевым, градиент функции потерь (синяя часть) должен быть больше размера шага. Чтобы получить больший градиент для функции потерь, значение признака должно существенно влиять на выходные данные модели.

Таким образом, признак, а точнее, соответствующий ему параметр, значение которого не связано с выходными данными модели, обнуляется регуляризацией L1 во время обучения.

 

Дальнейшее чтение и заключение

  • Чтобы получить больше информации по этой теме, я задал вопрос на Reddit r/MachineLearning, иСледовать за Он содержит различные толкования, с которыми вам, возможно, будет интересно ознакомиться.
  • Мадияр Айтбаев также имеет интересный блог Охватывает тот же вопрос, но с инженерным пояснением.
  • Блог Брайан Кинг объясняет организацию с вероятностной точки зрения.
  • это النقاش На сайте CrossValidated он объясняет, почему критерий L1 поощряет использование разреженных моделей. Блог Подробная статья Мукула Ранджана объясняет, почему норма L1 способствует тому, чтобы транзакции стали нулевыми, а норма L2 — нет.

«L1-регуляризация выбирает признаки» — это простое утверждение, с которым соглашается большинство специалистов по машинному обучению, не углубляясь в его внутреннюю работу. Этот блог — попытка поделиться своим пониманием и ментальной моделью с читателями, чтобы ответить на этот вопрос интуитивно. Для предложений и вопросов вы можете найти мой адрес электронной почты на моем сайте . Продолжайте учиться и хорошего вам дня!

 

Комментарии закрыты.