Исследование

Внимание

Начиная с 20 сентября 2023 г. нельзя создавать новые ресурсы Персонализатора. Служба Personalizer будет выведена из эксплуатации 25 августа 2026 года. Рекомендуем перейти на проект с открытым исходным кодом microsoft/learning-loop.

Персонализатор благодаря исследованию способен постоянно предоставлять хорошие результаты даже при изменении поведения пользователя.

После получения вызова ранжирования Персонализатор возвращает RewardActionID, который либо:

  • С помощью известной релевантности сопоставляет наиболее вероятное поведение пользователя на основе текущей модели машинного обучения.
  • использует исследование, которое не соответствует действию с наивысшей вероятностью в ранжировании.

Сейчас Персонализатор использует алгоритм под названием epsilon-greedy для исследования.

Выбор параметра исследования

Вы настраиваете процент трафика, используемого для исследования, на странице Configuration на портале Azure для Personalizer. Этот параметр определяет процент вызовов ранжирования, которые выполняют исследование.

Персонализатор определяет, следует ли изучать или использовать наиболее вероятное действие модели для каждого вызова ранжирования. Это отличается от поведения некоторых платформ A/B-тестирования, которые закрепляют вариант для конкретных идентификаторов пользователей.

Рекомендации по выбору настройки исследования

Выбор параметра исследования — это бизнес-решение о доле взаимодействий пользователей для анализа с целью улучшения модели.

Значение 0 нивелирует многие преимущества Персонализатора. В этом случае Персонализатор не использует никакие взаимодействия пользователя, чтобы находить более хорошие взаимодействия. Это приводит к застою, смещению и в конечном счете снижению производительности модели.

Слишком высокое значение параметра нивелирует преимущества обучения на основе поведения пользователя. Значение 100% подразумевает постоянный случайный выбор, а любое поведение пользователей не может повлиять на результат.

Очень важно не изменять поведение приложения в зависимости от того, анализирует ли Персонализатор новые данные или использует уже изученное лучшее действие. Это может привести к смещению обучения, что в конечном счете снижает потенциальную производительность.

Следующие шаги

Обучение с подкреплением