Автоматическое машинное обучение

ИИ-обзор статьи
Автоматическое машинное обучение (AutoML) — это процесс автоматизации всех этапов применения машинного обучения к реальным задачам, от подготовки данных до построения и оптимизации готовых моделей.
Автоматизация трудоемких этапов машинного обучения
В традиционном подходе специалист вручную выполняет предобработку данных, выделение и отбор признаков, выбор алгоритма и настройку гиперпараметров. AutoML автоматизирует эти шаги, делая машинное обучение доступным для неспециалистов.
Ключевые автоматизируемые этапы
AutoML автоматизирует выбор модели, оптимизацию гиперпараметров и поиск нейронных архитектур. Также автоматизируются ансамблирование моделей, метаобучение и трансферное обучение, а также выбор пайплайна с учётом ограничений.
Баланс между экспертом и автономией
В AutoML сохраняется проблема «кустарной индустрии», когда процессы зависят от ручных решений экспертов. Необходим баланс между участием специалистов и степенью автономии систем, для создания которых требуются знания алгоритмов и значительные трудозатраты.
Проблемы метаобучения и ресурсов
Вызовами AutoML остаются задачи метаобучения и эффективного распределения вычислительных ресурсов.

Автоматическое машинное обучение (англ. Automated machine learning, AutoML) — это процесс автоматизации задач применения машинного обучения к реальным задачам. Это сочетание автоматизации и машинного обучения[1].

Автоматическое машинное обучение потенциально охватывает все этапы — от работы с исходным набором данных до построения модели машинного обучения, готовой к внедрению. AutoML был предложен как решение на базе искусственного интеллекта для постоянно растущей сложности применения методов машинного обучения. Высокая степень автоматизации в AutoML позволяет неспециалистам использовать модели и методы машинного обучения без необходимости становиться экспертами в этой области. Автоматизация полного цикла применения методов машинного обучения дополнительно обеспечивает более простые решения, ускоряет их создание, а получаемые модели зачастую превосходят по качеству разработанные вручную[2].

К распространённым техникам AutoML относятся оптимизация гиперпараметров, метаобучение и поиск нейронных архитектур.

Сравнение со стандартным подходом

В типичном приложении машинного обучения специалисты располагают входными данными, которые используются для обучения модели. Сырые данные могут требовать преобразований для того, чтобы их можно было использовать с различными алгоритмами. Эксперт вынужден осуществлять предобработку данных, выделение признаков, извлечение признаков и отбор признаков. После этого проводится выбор алгоритма и оптимизация гиперпараметров, чтобы максимизировать качество прогноза модели. Если используется глубокое обучение, то архитектуру нейронной сети также подбирает специалист.

Каждый из этих шагов может быть довольно сложным и становится препятствием при практическом использовании машинного обучения. AutoML нацелен на упрощение данной последовательности действий, чтобы неспециалисты могли корректно и эффективно применять методы машинного обучения.

Автоматизация машинного обучения играет важную роль в более широкой задаче автоматизации науки о данных, которая также включает такие сложные задачи, как инженерия данных, исследование данных, интерпретация моделей и прогнозирование[3].

Этапы автоматизации

Автоматическое машинное обучение может охватывать различные стадии процесса машинного обучения[4]. Основные этапы автоматизации включают:

  • Подготовка данных и их загрузка (из необработанных и различных форматов)
    • Распознавание типа столбцов, например: булевый, дискретный числовой, непрерывный числовой или текстовый
    • Определение назначения столбцов, например: целевой признак/метка, поле стратификации, числовой признак, категориальный текстовый признак или произвольный текст
    • Определение типа задачи, например: бинарная классификация, регрессия, кластеризация или ранжирование
  • Выделение признаков
  • Выбор модели — выбор алгоритма машинного обучения, часто включая несколько конкурирующих программных реализаций
  • Ансамблирование — подход, при котором использование нескольких моделей часто даёт лучшие результаты, чем одна модель[5]
  • Оптимизация гиперпараметров алгоритма обучения и этапа формирования признаков
    • Поиск нейронной архитектуры
  • Выбор пайплайна с учётом ограничений времени, памяти и сложности
  • Выбор метрик оценки качества и процедур валидации
  • Проверка задачи
  • Анализ полученных результатов
  • Формирование пользовательских интерфейсов и визуализаций

Проблемы и ограничения

В области автоматического машинного обучения существует ряд важных вызовов. Одной из ключевых тем считается так называемое «развитие в формате кустарной индустрии». Эта формулировка отражает проблему, когда процессы сильно зависят от ручных решений и субъективности экспертов, что противоречит самой идее машинного обучения — построению систем, которые способны учиться и улучшаться самостоятельно, основываясь на анализе данных. В сущности, речь идёт о балансе между степенью участия экспертов и степенью автономии машин при обучении. Тем не менее, для разработки таких систем требуются знания алгоритмов машинного обучения и проектирования систем, а также значительные трудозатраты на их создание и настройку[6].

Дополнительными вызовами остаются задачи метаобучения[7] и эффективного распределения вычислительных ресурсов.

Примечания

  1. Spears, Taylor; Bondo Hansen, Kristian (18 декабря 2023). “The Use and Promises of Machine Learning in Financial Markets”. The Oxford Handbook of the Sociology of Machine Learning [англ.]. Oxford University Press. DOI:10.1093/oxfordhb/9780197653609.013.6. ISBN 978-0-19-765360-9. Дата обращения 2024-06-10.
  2. Olson, R.S. Automating Biomedical Data Science Through Tree-Based Pipeline Optimization : [англ.] / R.S. Olson, Urbanowicz, R.J., Andrews, P.C. … [et al.]. — Springer, 2016. — Vol. 9597. — P. 85–97. — doi:10.1007/978-3-319-31204-0_9.
  3. De Bie, Tijl; De Raedt, Luc; Hernández-Orallo, José; Hoos, Holger H.; Smyth, Padhraic; Williams, Christopher K. I. (март 2022). “Automating Data Science”. Communications of the ACM [англ.]. 65 (3): 76—87. DOI:10.1145/3495256. Проверьте дату в |date= (справка на английском)
  4. AutoML 2014 @ ICML (англ.). AutoML 2014 Workshop @ ICML. Дата обращения: 28 марта 2018.
  5. Erickson, Nick; Mueller, Jonas; Shirkov, Alexander; Zhang, Hang; Larroy, Pedro; Li, Mu & Smola, Alexander (13 марта 2020), AutoGluon-Tabular: Robust and Accurate AutoML for Structured Data, arΧiv:2003.06505 [stat.ML]. 
  6. Glover, Ellen (2018). “Machine Learning with Python: Clustering”. Built in [англ.]. DOI:10.4135/9781526466426.
  7. Meta Learning Challenges (англ.). metalearning.chalearn.org. Дата обращения: 3 декабря 2023.

Литература