Рекомендации могут получать больше кликов и при этом хуже выполнять задачу продукта. Пользователь открывает предложенный товар, но не покупает его; читает яркий заголовок, но не находит нужного ответа; выбирает учебный материал, который не помогает освоить тему.
Поэтому до обучения модели нужно определить, какой результат считается полезным и какие ограничения нельзя нарушать ради его роста.
Обзор рекомендательных систем Google описывает задачу персонального отбора контента. Для внедрения этого недостаточно: потребуется связать наблюдаемое поведение с целью конкретного сервиса.
Выбрать результат, который имеет смысл после клика
Для магазина это может быть завершённая покупка с учётом возвратов и доступности товара. Для базы знаний — найденный ответ и завершённая операция. Для обучения — выполнение следующего задания и проверяемое освоение материала.
Задайте основную метрику и защитные показатели. Если оптимизируется покупка, наблюдайте за возвратами и жалобами. Если скорость нахождения ответа — за ошибочными решениями после чтения. Для каждой метрики укажите период, единицу наблюдения и правило связывания события с показанной рекомендацией.
Не используйте задержанный результат раньше, чем он успел проявиться. Сравнение возвратов на второй день после покупки с возвратами за полный месяц создаёт неравные условия.
Клик зависит от места показа
Пользователь не выбирает из всего каталога: он реагирует на то, что ему показали. Предмет на первой позиции получает другую возможность быть замеченным, чем предмет в конце списка.
Работа Joachims, Swaminathan и Schnabel о смещённой обратной связи разбирает проблему позиционного смещения в данных о кликах. Практическое следствие для продукта: журнал показов нужен вместе с журналом действий. Отсутствие клика по непоказанному объекту нельзя трактовать как установленное отсутствие интереса.
Сохраняйте идентификатор запроса рекомендаций, набор доступных кандидатов, показанный порядок и последующие события. Доступ к этим журналам и сроки хранения определяют по задаче и требованиям к данным.
Если система учится только на собственных прошлых показах, популярные объекты могут снова получать больше возможностей для взаимодействия. Механизм знакомства с новыми объектами стоит проектировать отдельно и проверять с ограничением риска для пользователя.
Начать с понятного варианта сравнения
Сложную модель полезно сравнить с простым подходом: популярное в подходящей категории, продолжение текущего сценария или ручные правила подбора. Такой вариант должен соблюдать те же ограничения доступности, цены и прав, что и новая система.
Для нового пользователя можно предложить выбор интересов или использовать контекст текущей задачи. Не нужно придумывать подробный профиль по одному действию. Для нового объекта полезны корректные атрибуты и отдельный способ получить первые наблюдения.
Публикация об анализе эстетических предпочтений с помощью нейросетей относится к исследовательской постановке задачи. Система, предсказывающая взаимодействие с изображением, не получает из этого объективную меру красоты или достоверный психологический портрет человека.
Как устроить проверку
| Этап | Что сравнивать | Типичная причина неверного вывода |
|---|---|---|
| Проверка на исторических данных | Качество на данных, не использованных для настройки | В обучении оказались будущие события |
| Проверка правил | Доступность объектов, права, исключения, лимиты | Модель предлагает недопустимый объект |
| Ограниченный эксперимент | Заранее определённый деловой результат | Группы различаются условиями или смешиваются |
| Наблюдение после запуска | Качество по сегментам и задержанные последствия | Среднее скрывает ухудшение для части пользователей |
При разбиении по времени сохраните реальную последовательность появления данных. Признак, которого ещё не было в момент рекомендации, не должен помогать модели в историческом тесте.
В эксперименте заранее определите единицу назначения в группы. Если один человек регулярно пользуется сервисом, независимое переключение варианта на каждой странице может смешивать влияние. Объём наблюдений и способ оценки неопределённости зависят от этой структуры.
Пример решения по результатам
Предположим, в вымышленном эксперименте кликабельность выросла с 5% до 7%, а доля завершённых покупок среди пользователей с показом уменьшилась с 2% до 1,8%. Эти числа сами по себе ещё не устанавливают статистически устойчивый эффект: нужны объём выборки и оценка неопределённости.
Но уже нельзя отчитаться об успехе только по росту кликов. Следует проверить, какие объекты получили показы, соблюдались ли ограничения и не ухудшилось ли соответствие цели пользователя. При недостатке данных решение откладывают; при подтверждённом вреде возвращают предыдущий вариант.
Для каждого выпуска сохраняйте версию модели, признаков, каталога и правил. Встроенный резервный подбор должен оставаться полезным, когда персональная рекомендация недоступна или данных слишком мало.
Результат внедрения — воспроизводимое улучшение выбранной операции в известных условиях. Один красивый пример персонального попадания этого не доказывает.