Гиперпараметр (машинное обучение)

ИИ-обзор статьи
Гиперпараметр — параметр в машинном обучении, значение которого устанавливается перед началом процесса обучения для управления им, в отличие от параметров модели, определяемых в ходе тренировки.
Влияние гиперпараметров на обучение и проблемы оптимизации
Время обучения модели зависит от выбора гиперпараметров. Типы данных гиперпараметров (непрерывные или целочисленные) создают проблемы оптимизации из-за смешанных типов. Также некоторые гиперпараметры взаимозависимы, например, размер скрытого слоя зависит от количества слоёв.
Необучаемость гиперпараметров градиентными методами
Некоторые гиперпараметры не могут быть обучены методами на основе градиента, так как описывают представление модели. Несмотря на это, они влияют на функцию потерь. Примером служит толерантность к ошибкам в методе опорных векторов.
Переобучение при настройке степени полинома
Попытка обучить некоторые гиперпараметры на обучающих данных ведёт к переобучению. Например, степень полинома в регрессии будет расти, подгоняя модель под шум в данных, что ухудшает обобщающую способность, несмотря на низкую ошибку обучения.
Настраиваемость и критические гиперпараметры LSTM
Большая часть изменений производительности может быть связана с несколькими гиперпараметрами. Для LSTM наиболее критичны темп обучения и размер сети, тогда как пакетирование и инерция менее значимы.
Цель и процесс оптимизации гиперпараметров
Оптимизация гиперпараметров направлена на поиск их набора, минимизирующего функцию потерь на обучающих данных. Целевая функция принимает кортеж гиперпараметров и возвращает связанные потери.

Гиперпараметр — параметр в машинном обучении, значение которого используется для управления процессом обучения. В отличие от значений других параметров (обычно весов узлов), которые определяются во время тренировки.

Гиперпараметры могут быть классифицированы как гиперпараметры модели, которые не могут быть определены во время обучения машины c помощью обучающего набора, потому что они относятся к задаче выбора модели, или гиперпараметры алгоритма, которые в принципе не имеют влияния на производительность модели но оказывают воздействие на скорость и качество процесса обучения. Примером гиперпараметра модели является топология и размер нейронной сети. Примером гиперпараметра алгоритма являются темп обучения и размер набора данных (batch size), также как и размер мини-набора данных (mini-batch size). Набором данных может называться полная выборка данных, а мини-набором данных размер выборки меньшим размером.

Для различных алгоритмов обучения модели, требуются различные гиперпараметры, некоторым простым алгоритмам (таким как Обычные наименьшие квадраты линейной регрессии) они не требуются. Учитывая гиперпараметры, алгоритм обучения настраивает свои параметры с помощью данных. Например, LASSO — это алгоритм, который добавляет параметр регуляризации в алгоритм регрессии обычных наименьших квадратов и этот параметр должен быть установлен перед оценкой параметров с помощью алгоритма обучения.[1]

Соображения

Время необходимое для обучения и тестирования модели может зависеть от выбора её гиперпараметров.[2] Гиперпараметр обычно имеет непрерывный или целочисленный тип данных, что приводит к проблемам оптимизации связанным со смешанными типами.[2] Существование некоторых гиперпараметров зависит от значения других гиперпараметров, например размер каждого скрытого слоя в нейронной сети может зависеть от количества слоев.[2]

Сложнообучаемые параметры

Обычно, но не всегда, гиперпараметры не могут быть обучены с использованием хорошо известных методов, основанных на градиенте (таких как градиентный спуск, LBFGS), которые обычно используются для обучения параметров. Эти гиперпараметры, являются теми параметрами описывающими представление модели, которые не могут быть обучены с использованием основных методов оптимизации, но тем не менее имеют влияние на функцию потерь. Примером может служить толерантность гиперпараметра к ошибкам в методе опорных векторов.

Необучаемые параметры

Иногда, гиперпараметры не могут быть обучены с использованием обучающих данных, потому что они агрессивно увеличивают производительность модели и могут отодвинуть функцию потерь на не желаемый минимум (переобучаясь и подхватывая шум в данных), в отличие от правильного отображения богатства структуры в данных. Например, если мы рассматриваем степень полиномиального уравнения, соответствующего регрессионной модели, как обучаемый параметр, степень будет увеличиваться до тех пор пока модель не будет идеально подходить к данным, выдавая небольшую ошибку при обучении, но плохую производительность обобщения.

Настраиваемость

Большая часть изменений производительности может быть связана всего с несколькими гиперпараметрами..[3][2][4]Настраиваемость алгоритма, гиперпараметра, или взаимодействие гиперпараметров это измерение того, насколько высокую производительность можно получить такой настройкой.[5] Для LSTM, хотя темп обучения с последующим размером сети и являются самыми критическими гиперпараметрами,[6] пакетирование и инерция не имеют значительного влияния на производительность.[7]

Хотя некоторые исследования выступают за использование размеров мини-пакетов с тысячами экземпляров, другие исследования обнаружили, что самая лучшая производительность достигается с размерами мини-пакетов между 2 и 32 экземпляра.[8]

Надёжность

Присущая стохастичность в обучении прямо подразумевает что эмпирическая производительность гиперпараметра не обязательно является его настоящей производительностью.[2] Методы которые не надёжны к простым изменениям в гиперпараметрах, случайные первоначальные значения, или даже различные имплементации того же самого алгоритма не могут быть интегрированы в критически важные системы управления без значительного упрощения и повышения надежности.[9]

Алгоритмы обучения с подкреплением, в частности, требуют измерения их производительности с использованием большого количества случайных первоначальных значений, и также измерения их чувствительности к выборам гиперпараметров.[9] Их оценка с небольшим количеством случайных первоначальных значений не оценивает производительность адекватно, в связи со слишком высокой вариативностью.[9] Некоторые методы обучения с подкреплением, например DDPG (Градиент глубокой детерминированной политики), более чувствительны к выборам гиперпараметров чем другие.[9]

Оптимизация

Оптимизация гиперпараметров осуществляет поиск набора гиперпараметров, дающего оптимальную модель, которая минимизирует предопределенную функцию потерь на предоставленных обучающих данных.[2] Целевая функция берет кортеж гиперпараметров и возвращает связанные потери.[2]

Воспроизводимость

Кроме настраиваемых параметров, машинное обучение включает хранение и организацию параметров и результатов, и убеждение того, что они воспроизводимы.[10] При отсутствии надежной инфраструктуры для этих целей, исследовательский код часто быстро развивается, но ставит под угрозу такие важные аспекты, как учёт и воспроизводимость.[11] Платформы для онлайн-сотрудничества, предназначенные для машинного обучения позволяют ученым автоматически делиться, организовывать и обсуждать эксперименты, данные, и алгоритмы.[12] Воспроизводимость может быть особенно сложной для моделей глубоко обучения.[13]

Примечания

  1. Yang, Li; Shami, Abdallah (2020-11-20). “On hyperparameter optimization of machine learning algorithms: Theory and practice”. Neurocomputing [англ.]. 415: 295—316. arXiv:2007.15745. DOI:10.1016/j.neucom.2020.07.061. ISSN 0925-2312. S2CID 220919678.
  2. 1 2 3 4 5 6 7 Claesen, Marc, and Bart De Moor. "Hyperparameter Search in Machine Learning." arXiv preprint arXiv:1502.02127 (2015)..
  3. Leyton-Brown, Kevin; Hoos, Holger; Hutter, Frank (January 27, 2014). “An Efficient Approach for Assessing Hyperparameter Importance”: 754—762 – via proceedings.mlr.press.
  4. van Rijn, Jan N., and Frank Hutter. "Hyperparameter Importance Across Datasets." arXiv preprint arXiv:1710.04725 (2017)..
  5. Probst, Philipp, Bernd Bischl, and Anne-Laure Boulesteix. "Tunability: Importance of Hyperparameters of Machine Learning Algorithms." arXiv preprint arXiv:1802.09596 (2018)..
  6. Greff, K.; Srivastava, R. K.; Koutník, J.; Steunebrink, B. R.; Schmidhuber, J. (October 23, 2017). “LSTM: A Search Space Odyssey”. IEEE Transactions on Neural Networks and Learning Systems. 28 (10): 2222—2232. arXiv:1503.04069. DOI:10.1109/TNNLS.2016.2582924. PMID 27411231. S2CID 3356463.
  7. Breuel, Thomas M. "Benchmarking of LSTM networks." arXiv preprint arXiv:1508.02774 (2015)..
  8. Revisiting Small Batch Training for Deep Neural Networks (2018)..
  9. 1 2 3 4 Mania, Horia, Aurelia Guy, and Benjamin Recht. "Simple random search provides a competitive approach to reinforcement learning." arXiv preprint arXiv:1803.07055 (2018)..
  10. Greff, Klaus, and Jürgen Schmidhuber. "Introducing Sacred: A Tool to Facilitate Reproducible Research.".
  11. Greff, Klaus, et al. "The Sacred Infrastructure for Computational Research.".
  12. Vanschoren, Joaquin, et al. "OpenML: networked science in machine learning." arXiv preprint arXiv:1407.7722 (2014)..
  13. Villa, Jennifer; Zimmerman, Yoav Reproducibility in ML: why it matters and how to achieve it. Determined AI Blog (25 мая 2018). Дата обращения: 31 августа 2020.

Категории