Примечание.
Для доступа к этой странице требуется авторизация. Вы можете попробовать войти или изменить каталоги.
Для доступа к этой странице требуется авторизация. Вы можете попробовать изменить каталоги.
Важно
Начиная с 20 сентября 2023 г. нельзя создавать новые ресурсы Персонализатора. Служба Personalizer будет выведена из эксплуатации 25 августа 2026 года. Мы рекомендуем перейти на open-source проект microsoft/learning-loop с открытым исходным кодом.
Обучение с подкреплением — это подход к машинному обучению, который изучает поведение, получая отзывы об использовании.
Обучение с подкреплением работает следующими способами:
- Предоставление возможности или степени свободы принятия поведения , например принятия решений или выбора.
- Предоставление контекстной информации о среде и выборе.
- Предоставление отзывов о том, насколько хорошо поведение достигает определенной цели.
Хотя существует множество подтипов и стилей обучения с подкреплением, это то, как концепция работает в Персонализаторе:
- Приложение предоставляет возможность отображать один фрагмент содержимого из списка альтернативных вариантов.
- Приложение предоставляет сведения о каждой альтернативе и контексте пользователя.
- Приложение вычисляет оценку вознаграждения.
В отличие от некоторых подходов к обучению с подкреплением персонализатор не требует имитации для работы. Его алгоритмы обучения предназначены для реагирования на внешний мир, в отличие от управления им, и для изучения каждой точки данных с пониманием того, что это уникальная возможность, требующая затрат времени и денег на создание, и что возникает ненулевое сожаление (потеря возможного вознаграждения) в случае неоптимальной производительности.
Какой тип алгоритмов обучения с подкреплением использует Персонализатор?
Текущая версия Персонализатора использует контекстные бандиты, подход к обучению с подкреплением, основанный на принятии решений или выборе между конкретными действиями в данных условиях.
Память принятия решений, модель, которая была обучена для получения наилучшего решения, учитывая контекст, использует набор линейных моделей. Они неоднократно показали бизнес-результаты и являются проверенным подходом, частично потому что они могут учиться из реального мира очень быстро, не нуждаясь в многократном обучении, и частично потому, что они могут дополнять защищенные модели обучения и модели глубокой нейронной сети.
Распределение трафика для изучения или наилучшего действия выполняется случайным образом в соответствии с установленным процентным уровнем для исследования, а алгоритмом по умолчанию для исследования является эпсилон-жадный.
История контекстных бандитов
Джон Лэнгфорд придумал название Contextual Bandits (Лэнгфорд и Чжан [2007]), чтобы описать разрешимое подмножество обучения с подкреплением и работал над полутора десятками статей, улучшающих наше понимание того, как обучаться в этой парадигме.
- Бейгельцимер и т. д. [2011]
- Dudík et al. [2011a, b]
- Agarwal et al. [2014, 2012]
- Бейгельцимер и Лэнгфорд [2009]
- Li et al. [2010]
Джон также дал несколько учебников ранее по таким темам, как совместное прогнозирование (ICML 2015), контекстная теория банды (NIPS 2013), активное обучение (ICML 2009) и примеры ограничений сложности (ICML 2003)
Какие платформы машинного обучения используют Персонализатор?
Персонализатор в настоящее время использует Vowpal Wabbit в качестве основы машинного обучения. Этот фреймворк обеспечивает максимальную пропускную способность и наименьшую задержку при осуществлении ранжирования персонализации и обучении модели с учетом всех событий.
Ссылки
- Принятие контекстных решений с низким техническим долгом
- Метод редукций для справедливой классификации
- Эффективные контекстные бандиты в нестационарных мирах
- Прогнозирование остаточной потери: подкрепление: обучение без добавочной обратной связи
- Сопоставление инструкций и визуальных наблюдений с действиями при помощи обучения с подкреплением
- Обучаемся искать лучше, чем ваши учителя