Что такое обучение с подкреплением?

Важно

Начиная с 20 сентября 2023 г. нельзя создавать новые ресурсы Персонализатора. Служба Personalizer будет выведена из эксплуатации 25 августа 2026 года. Мы рекомендуем перейти на open-source проект microsoft/learning-loop с открытым исходным кодом.

Обучение с подкреплением — это подход к машинному обучению, который изучает поведение, получая отзывы об использовании.

Обучение с подкреплением работает следующими способами:

  • Предоставление возможности или степени свободы принятия поведения , например принятия решений или выбора.
  • Предоставление контекстной информации о среде и выборе.
  • Предоставление отзывов о том, насколько хорошо поведение достигает определенной цели.

Хотя существует множество подтипов и стилей обучения с подкреплением, это то, как концепция работает в Персонализаторе:

  • Приложение предоставляет возможность отображать один фрагмент содержимого из списка альтернативных вариантов.
  • Приложение предоставляет сведения о каждой альтернативе и контексте пользователя.
  • Приложение вычисляет оценку вознаграждения.

В отличие от некоторых подходов к обучению с подкреплением персонализатор не требует имитации для работы. Его алгоритмы обучения предназначены для реагирования на внешний мир, в отличие от управления им, и для изучения каждой точки данных с пониманием того, что это уникальная возможность, требующая затрат времени и денег на создание, и что возникает ненулевое сожаление (потеря возможного вознаграждения) в случае неоптимальной производительности.

Какой тип алгоритмов обучения с подкреплением использует Персонализатор?

Текущая версия Персонализатора использует контекстные бандиты, подход к обучению с подкреплением, основанный на принятии решений или выборе между конкретными действиями в данных условиях.

Память принятия решений, модель, которая была обучена для получения наилучшего решения, учитывая контекст, использует набор линейных моделей. Они неоднократно показали бизнес-результаты и являются проверенным подходом, частично потому что они могут учиться из реального мира очень быстро, не нуждаясь в многократном обучении, и частично потому, что они могут дополнять защищенные модели обучения и модели глубокой нейронной сети.

Распределение трафика для изучения или наилучшего действия выполняется случайным образом в соответствии с установленным процентным уровнем для исследования, а алгоритмом по умолчанию для исследования является эпсилон-жадный.

История контекстных бандитов

Джон Лэнгфорд придумал название Contextual Bandits (Лэнгфорд и Чжан [2007]), чтобы описать разрешимое подмножество обучения с подкреплением и работал над полутора десятками статей, улучшающих наше понимание того, как обучаться в этой парадигме.

  • Бейгельцимер и т. д. [2011]
  • Dudík et al. [2011a, b]
  • Agarwal et al. [2014, 2012]
  • Бейгельцимер и Лэнгфорд [2009]
  • Li et al. [2010]

Джон также дал несколько учебников ранее по таким темам, как совместное прогнозирование (ICML 2015), контекстная теория банды (NIPS 2013), активное обучение (ICML 2009) и примеры ограничений сложности (ICML 2003)

Какие платформы машинного обучения используют Персонализатор?

Персонализатор в настоящее время использует Vowpal Wabbit в качестве основы машинного обучения. Этот фреймворк обеспечивает максимальную пропускную способность и наименьшую задержку при осуществлении ранжирования персонализации и обучении модели с учетом всех событий.

Ссылки

Дальнейшие действия

Оценка в автономном режиме