Машинное обучение
Материал из Documentation.
Машинное обучение — область искусственного интеллекта, тесно связанная с математической статистикой, оптимизацией и прикладной математикой. Она изучает методы построения алгоритмических моделей, которые обучаются на данных для выявления закономерностей и повышения качества решения определённой задачи на основе накопленного опыта. Характерной чертой этой дисциплины во многих прикладных задачах является замена явного программирования жёсткого решающего правила обучением модели или её параметров по данным. В традиционном подходе человек в явном виде задаёт алгоритмическую логику обработки информации. Парадигма машинного обучения концептуально меняет этот процесс. Во многих распространённых методах исследователь задаёт общую математическую структуру модели, критерий измерения её качества и алгоритм оптимизации, а конкретные параметры, определяющие итоговое поведение вычислительной системы, подбираются автоматически. Обученная модель обретает способность обобщать опыт, что позволяет ей выдавать предсказания для новых входных данных на основе выявленных статистических закономерностей (в рамках заложенных допущений модели и структуры самих данных). Методы машинного обучения во многом опираются на математическую статистику, теорию оптимизации и информатику. Математическая статистика предоставляет методы вероятностного моделирования и анализа неопределённости, теория оптимизации — методы поиска экстремумов функций, а информатика — алгоритмические методы и подходы к организации и масштабированию вычислений.
[править] История
Развитие концепций обучения по данным берёт своё начало в середине XX века. Важным теоретическим шагом стала работа Уоррена Маккаллока и Уолтера Питтса 1943 года, в которой была предложена ранняя математическая модель искусственного нейрона. Практической вехой стала разработка концепции перцептрона Фрэнком Розенблаттом. Его классическая работа с математическим описанием была опубликована в 1958 году; впоследствии эта концепция получила аппаратную реализацию в системе Mark I Perceptron с матрицей фотоэлементов, разработка и ранние демонстрации которой относятся к периоду 1958—1960 годов (публично система демонстрировалась, в частности, в 1960 году). Термин «машинное обучение» получил известное раннее употребление благодаря исследователю Артуру Сэмюэлу, использовавшему его в 1959 году в работе о компьютерной программе для игры в шашки. На протяжении десятилетий область переживала циклы научного энтузиазма и спадов, известных как «зимы искусственного интеллекта», которые провоцировались завышенными ожиданиями, ограничениями тогдашних методов и вычислительной техники, невыполнением ряда амбициозных прогнозов и сокращением финансирования. В 1980-х годах произошёл ренессанс нейросетевых исследований. Хотя идеи алгоритма обратного распространения ошибки восходят к более ранним работам, включая диссертацию Пола Вербоса 1974 года, широкую известность метод получил после работ Дэвида Румельхарта, Джеффри Хинтона и Рональда Уильямса 1986 года, включая их ставшую классической статью в журнале Nature. Конец XX века ознаменовался ростом популярности строгих статистических подходов в машинном обучении; одним из наиболее заметных примеров стал метод опорных векторов, современная формулировка которого сложилась в работах начала 1990-х годов и получила классическое изложение в статье Коринны Кортес и Владимира Вапника 1995 года.
Значительный прорыв произошёл в начале 2010-х годов. Исторически он иллюстрируется архитектурой AlexNet в 2012 году, успех которой базировался на использовании глубоких свёрточных сетей, больших размеченных баз данных (ImageNet), вычислениях на графических процессорах, а также на ряде эффективных архитектурных и регуляризационных решений, включая функции активации ReLU, методы dropout и аугментацию данных.
[править] Фундаментальные принципы статистического обучения
Во многих задачах статистического машинного обучения центральную роль играют задачи аппроксимации функций и принцип минимизации эмпирического риска. Типичная математическая задача рассматривает наблюдаемые данные как выборку из некоторого неизвестного распределения, часто предполагая независимую одинаково распределённую выборку или иную явно заданную структуру зависимости. Цель алгоритма состоит в выборе из заданного класса гипотез функции, которая наилучшим образом приближает зависимость между входными признаками и целевыми значениями. В рамках принципа минимизации эмпирического риска алгоритм стремится минимизировать среднюю функцию потерь на обучающей выборке; на практике этот оптимизационный критерий часто дополняют регуляризацией. Функция потерь количественно оценивает расхождение между предсказанием модели и наблюдаемым целевым значением. Процесс минимизации потерь для масштабных наборов данных часто осуществляется с использованием стохастического градиентного спуска (SGD) и его адаптивных вариантов, что особенно характерно при обучении больших дифференцируемых моделей. Ключевым понятием является обобщающая способность, под которой понимается способность модели сохранять качество на новых данных из того же или релевантного распределения.
При анализе обобщающей способности важную роль традиционно играет компромисс между смещением и дисперсией, хотя для современных глубоких моделей картина может быть сложнее из-за явлений вроде двойного спуска. Избыточная гибкость модели может позволить ей подстраиваться под статистический шум обучающих данных, что приводит к переобучению. Слишком простая относительно структуры задачи модель может страдать от недообучения.
Для независимой оценки качества необходимо изолировать тестовые данные от обучения и выбора гиперпараметров; на практике данные разделяют на обучающую, валидационную и тестовую части либо используют схемы перекрёстной проверки.
[править] Смещение и разброс
Представь, что ты учишься стрелять по мишени.
Высокое смещение (bias) — это когда ты стабильно мажешь, но всегда в одну и ту же сторону. Например, твой прицел сбит, и все пули ложатся левее центра. Ты попадаешь в одну точку, но она не там, где надо. В машинном обучении это значит: модель слишком простая, она не видит закономерностей в данных и систематически ошибается. Это называют недообучением.
Высокий разброс (variance) — это когда твои выстрелы разбросаны по всей мишени, но в среднем они около центра. Руки трясутся: иногда в десятку, иногда в молоко. В машинном обучении это значит: модель слишком сложная, она запоминает данные вместе с шумом и по-разному ведёт себя на новых примерах. Это переобучение.
Идеал — низкое смещение и низкий разброс: все пули кучно в центре.
Связь простая: увеличь сложность модели — упадёт смещение, но вырастет разброс. Упрости — наоборот. Задача — найти баланс, где сумма ошибок минимальна. В машинном обучении это называют компромиссом смещения и разброса (bias-variance tradeoff).
[править] Парадигмы машинного обучения
Среди методологического многообразия подходов выделяют несколько основных парадигм машинного обучения, в том числе обучение с учителем, обучение без учителя, обучение с подкреплением.
[править] Обучение с учителем
Обучение с учителем представляет собой процесс конструирования модели на основе размеченного набора данных, где каждому входному объекту сопоставлен известный целевой ответ. В рамках этой парадигмы решаются задачи классификации, направленные на предсказание одной или нескольких дискретных категорий, и задачи регрессии, используемые для прогнозирования непрерывной числовой величины.
[править] Обучение без учителя
Обучение без учителя применяется в случаях, когда алгоритму предоставляются исключительно данные, лишённые каких-либо меток. Цель системы заключается в самостоятельном обнаружении скрытой структуры. Сюда входят задачи кластеризации для группировки схожих объектов и алгоритмы снижения размерности.
[править] Обучение с подкреплением
Обучение с подкреплением представляет собой парадигму, основанную на последовательном взаимодействии программного агента со средой. В отличие от обучения с учителем, агент обычно не получает размеченных примеров, напрямую указывающих, какое действие следует выбрать в каждом состоянии. Агент совершает выбор, переходит из одного состояния среды в другое и получает от неё скалярный численный сигнал вознаграждения, который может быть положительным, отрицательным или нулевым. Его цель заключается в поиске стратегии (политики), максимизирующей ожидаемое суммарное (часто дисконтированное) вознаграждение. Формальной основой многих задач служат марковские процессы принятия решений (MDP), а важнейшие соотношения для функций ценности и оптимальных стратегий задаются уравнениями Беллмана (при этом существуют и частично наблюдаемые постановки POMDP). В классическом online-обучении важную роль играет компромисс между исследованием новых действий и использованием уже полученной информации. Подобные системы продемонстрировали высокие результаты в задачах, требующих сложного планирования. Историческими примерами служат матч 2016 года, в котором система AlphaGo смогла победить одного из сильнейших игроков мира Ли Седоля со счётом 4:1 в игре го, а также успех OpenAI Five в 2019 году в киберспортивной дисциплине Dota 2, характеризовавшейся частичной наблюдаемостью и специфическими ограничениями. Обучение с подкреплением также активно исследуется в робототехнике.
[править] Другие парадигмы
Промежуточные подходы включают обучение с частичным привлечением учителя, где лишь малая часть данных размечена экспертами. Существенное значение приобрело самонаблюдаемое обучение (self-supervised learning). В этой парадигме обучающий сигнал автоматически конструируется из структуры самих неразмеченных данных. Модели учатся предсказывать скрытые фрагменты текста или изображения, будущие элементы последовательности, либо сближать представления различных преобразований одного объекта и, в некоторых контрастивных методах, разносить представления разных объектов. Это позволяет обучать полезные внутренние представления для их последующего использования в конкретных прикладных задачах.
[править] Подготовка данных и работа со структурированной информацией
Надёжность и точность моделей напрямую зависят от качества исходных данных. В цикле разработки интеллектуальных систем значительную долю времени занимает процесс подготовки данных и инженерия признаков. Этот этап подразумевает обнаружение и обработку ошибок или аномалий с учётом предметной области (поскольку статистический выброс может быть важнейшим реальным наблюдением), работу с пропущенными значениями, стандартизацию масштабов числовых признаков, а также применение экспертных знаний для конструирования новых признаков. Разнородные категориальные значения кодируются в числовой формат, а из временных рядов извлекаются статистические и временные признаки.
На многих типичных табличных задачах эмпирические исследования показывают, что древовидные ансамбли, такие как алгоритмы случайного леса и градиентного бустинга, остаются конкурентоспособными или превосходят стандартные нейросетевые архитектуры, хотя результат зависит от свойств данных и масштаба задачи. Ансамбли деревьев уверенно сохраняют роль сильных базовых стандартов в промышленных задачах на гетерогенных признаках, в том числе благодаря малой чувствительности к масштабированию и, в значительной степени, к строго монотонным преобразованиям числовых признаков, а также способности эффективно моделировать нелинейности и взаимодействия переменных.
[править] Глубокое обучение и архитектуры нейронных сетей
Глубокое обучение преимущественно основано на использовании многослойных искусственных нейронных сетей. Ключевым преимуществом этого подхода является способность моделей выстраивать иерархические представления непосредственно из сырых пикселей, звуковых волн или текстовых токенов. В процессе обработки информации сеть переходит от выделения простейших низкоуровневых характеристик к формированию сложных семантических абстракций.
Свёрточные нейронные сети (CNN) оказали определяющее влияние на компьютерное зрение. В их архитектуре операция свёртки обрабатывает пространственную структуру и в теории обеспечивает эквивариантность к сдвигам. Применение операций пулинга и глобальной агрегации признаков способствует устойчивости или частичной инвариантности к пространственным преобразованиям. В реальных архитектурах строгая эквивариантность может нарушаться из-за шага свёртки (stride), субдискретизации и граничных эффектов, связанных с добавлением отступов (padding).
Для анализа текстов исторически применялись рекуррентные нейронные сети, однако в современных системах обработки естественного языка их во многом вытеснила архитектура трансформеров, предложенная в 2017 году. Отказ от рекуррентности в пользу механизма самовнимания (self-attention) позволил трансформеру гибко моделировать зависимости между элементами последовательности и обеспечил значительно более высокий параллелизм обучения по сравнению с последовательными рекуррентными архитектурами, что стало одним из ключевых факторов, обеспечивших масштабирование крупных языковых моделей.
[править] Генеративные модели
В рамках глубокого обучения активно развивается класс генеративных моделей. В широком смысле их алгоритмическая цель состоит в аппроксимации распределения обучающих данных для последующей генерации новых объектов, статистически правдоподобных и структурно схожих с исходной выборкой. Важными историческими вехами стали вариационные автоэнкодеры (VAE); базовая работа Diederik Kingma и Max Welling по ним была представлена как препринт в 2013 году и опубликована на конференции ICLR в 2014 году. Другим важнейшим классом выступают диффузионные вероятностные модели. Хотя идея обучения через обратный диффузионный процесс была известна как минимум с 2015 года, новый этап быстрого научного развития начался около 2020 года после появления архитектуры DDPM и последующих работ; широкое индустриальное распространение последовало в начале 2020-х годов. Диффузионные алгоритмы обучаются обращать процесс постепенного зашумления, генерируя данные или их латентные представления из случайного шума. Это позволило достичь высоких результатов, в ряде бенчмарков соответствовавших передовому уровню, в синтезе детализированных изображений. Генеративные подходы также успешно применяются для синтеза речи, генерации аудио и музыки, включая диффузионные модели, работающие в сжатых латентных представлениях, а также для отдельных задач генерации символической музыки.
[править] Вероятностный подход и оценка обобщающей способности
Вероятностные методы моделируют неопределённость посредством вероятностных распределений и во многих задачах позволяют получать предиктивное распределение для неизвестных величин. В байесовском подходе неопределённость относительно параметров модели представляется априорным распределением, которое после учёта наблюдаемых данных преобразуется в апостериорное. Это даёт механизм интеграции предварительных знаний и построения байесовских credible intervals — интервалов, которым при заданной модели и данных соответствует определённая апостериорная вероятность. Для независимой оценки обобщающей способности необходимо изолировать тестовые данные. Важнейшим правилом является то, что любые преобразования, параметры которых оцениваются из данных (импутация, стандартизация, понижение размерности), должны настраиваться исключительно на тренировочной части выборки и лишь затем применяться к валидационной и тестовой; при кросс-валидации такие преобразования настраиваются отдельно внутри каждого обучающего фолда. Это снижает риск утечки данных (data leakage). Метрики качества подбираются под специфику задачи, варьируясь от анализа метрик precision и recall в задачах классификации до вычисления среднеквадратичной ошибки в задачах регрессии.
[править] Аппаратная инфраструктура
Промышленная реализация алгоритмов машинного обучения связана с развитием аппаратного обеспечения. Обучение передовых архитектур требует реализации очень больших объёмов вычислений, состоящих преимущественно из параллельных операций матричного умножения и тензорных преобразований. Центральные процессоры (CPU) широко используются для инференса многих моделей, работы с решающими деревьями и подготовки данных, однако для обучения масштабных глубоких нейросетей индустрия использует графические ускорители (GPU) и специализированные ускорители для машинного обучения, включая процессоры семейства TPU. В передовых проектах обучение фундаментальных моделей выполняют на вычислительных кластерах, объединяющих от тысяч до десятков тысяч ускорителей, которые синхронизируются высокоскоростными сетями и интерконнектами, использующими InfiniBand или Ethernet с RDMA (например, RoCE). Процесс тренировки крупных архитектур может занимать недели или месяцы непрерывной работы, потребляя существенные объёмы электроэнергии. Одновременно развивается алгоритмическая оптимизация, включающая дистилляцию знаний и квантование (снижение битовой разрядности весов, активаций и, в трансформерах, KV-кэша), что позволяет запускать сети на устройствах с относительно небольшими ресурсами.
[править] Практическое применение и промышленная эксплуатация
Применение машинного обучения охватывает многочисленные отрасли. В реальных продуктах математическая модель, как правило, является одним из компонентов более крупной инженерной системы. Промышленная эксплуатация (MLOps) требует выстраивания надёжных контуров сбора телеметрии, контроля версий данных и мониторинга показателей работы модели. Важной проблемой является дрейф входных данных (data drift), при котором меняются статистические свойства входной информации, и дрейф концепций (concept drift), при котором изменяются сами целевые зависимости. Обнаруженный дрейф может приводить к деградации качества прогнозов и требовать диагностики, перекалибровки или регулярного дообучения алгоритмов. В медицине системы компьютерного зрения помогают анализировать томограммы, выступая в роли систем поддержки принятия клинических решений. В финансовом секторе модели используются для скоринга кредитных рисков и автоматизированного выявления мошеннических транзакций. Рекомендательные алгоритмы персонализируют выдачу контента. Машинное обучение используется для обработки данных бортовых сенсоров и является важным компонентом многих современных систем помощи водителю (ADAS).
[править] Надёжность, интерпретируемость и информационная безопасность
Интеграция предиктивных моделей в процессы принятия решений обостряет вопросы их надёжности, интерпретируемости и защищённости. Линейные модели при небольшом количестве слабо скоррелированных признаков достаточно легко интерпретируются. Современные глубокие нейросети представляют собой сложные нелинейные системы, зачастую содержащие от миллионов до миллиардов и более параметров, что затрудняет интерпретацию и создаёт дополнительные требования при применении в сферах повышенного риска. В ответ развивается направление объяснимого искусственного интеллекта, предлагающее методы post-hoc интерпретации, такие как SHAP и LIME, для оценки вклада конкретных признаков в предсказания модели. Серьёзную угрозу представляют состязательные атаки (adversarial examples): классические исследования демонстрируют существование малых возмущений входных данных, которые способны вызвать ошибочное предсказание. Присутствуют и риски нарушения приватности. Крупные языковые и генеративные модели могут непреднамеренно запоминать фрагменты обучающей выборки, и исследования продемонстрировали возможность при определённых условиях извлекать из модели дословно запомненные фрагменты обучающих данных путём специально подобранных запросов. Для ограничения утечки информации об отдельных объектах выборки могут применяться методы дифференциальной приватности, предоставляющие формальные количественные гарантии приватности при заданных параметрах.
[править] Этические, социальные и правовые аспекты
Масштабное внедрение технологий машинного обучения требует учёта возникающих этических рисков. Одной из обсуждаемых проблем является алгоритмическая предвзятость. Поскольку алгоритмы во многих сценариях обучаются на данных, отражающих прошлые наблюдения и решения, они способны усваивать и воспроизводить статистические различия и смещения исторических данных, включая связанные с социальной дискриминацией. Системы алгоритмического скрининга при найме персонала или оценки рисков могут демонстрировать систематически различающиеся показатели ошибок для разных демографических групп, если данные содержат исторические или измерительные смещения, выборка нерепрезентативна либо сама постановка задачи приводит к различиям между группами. Решение проблемы требует междисциплинарного подхода, аудита данных и использования метрик справедливости. Эти вызовы стимулируют развитие специализированного правового регулирования. В Европейском Союзе принят AI Act. Этот регламент вступил в силу 1 августа 2024 года и применяется поэтапно. Его общая дата применения — 2 августа 2026 года, при этом отдельные положения начали применяться раньше, а для некоторых требований и категорий систем предусмотрены более поздние сроки (в частности, для отдельных высокорисковых систем). Подобные инициативы предъявляют к высокорисковым системам ИИ требования к обязательному документированию, процессам управления рисками и процедурам оценки соответствия.
[править] Современные и перспективные направления
Машинное обучение продолжает активно развиваться. Значительные усилия исследовательского сообщества направлены на снижение зависимости алгоритмов от масштабной ручной разметки данных посредством развития методов самонаблюдаемого обучения. Важной областью остаётся адаптация систем к новым задачам по малому числу примеров (few-shot learning); одним из исследуемых подходов к такой адаптации является метаобучение. В архитектурах, где данные физически распределены по множеству устройств, исследуется федеративное обучение. В этой парадигме данные остаются на клиентских устройствах, которые локально вычисляют обновления модели; затем эти обновления агрегируются сервером. Чтобы сервер не получал доступ к индивидуальным обновлениям клиентов, могут применяться протоколы криптографической безопасной агрегации (secure aggregation). Активно развиваются мультимодальные архитектуры, объединяющие работу с различными форматами информации и позволяющие единым моделям анализировать визуальные сцены, текстовый контекст и звуковые сигналы. На пересечении квантовой физики и информатики исследуется квантовое машинное обучение. И хотя в отдельных теоретических моделях при определённых сильных предпосылках возможны экспоненциальные ускорения квантовых алгоритмов, практическая применимость и практически значимое вычислительное преимущество этих методов для общих задач машинного обучения на сегодняшний день остаются предметом активных исследований.
