Рекомендации могут получать больше кликов и при этом хуже выполнять задачу продукта. Пользователь открывает предложенный товар, но не покупает его; читает яркий заголовок, но не находит нужного ответа; выбирает учебный материал, который не помогает освоить тему.

Поэтому до обучения модели нужно определить, какой результат считается полезным и какие ограничения нельзя нарушать ради его роста.

Обзор рекомендательных систем Google описывает задачу персонального отбора контента. Для внедрения этого недостаточно: потребуется связать наблюдаемое поведение с целью конкретного сервиса.

Выбрать результат, который имеет смысл после клика

Для магазина это может быть завершённая покупка с учётом возвратов и доступности товара. Для базы знаний — найденный ответ и завершённая операция. Для обучения — выполнение следующего задания и проверяемое освоение материала.

Задайте основную метрику и защитные показатели. Если оптимизируется покупка, наблюдайте за возвратами и жалобами. Если скорость нахождения ответа — за ошибочными решениями после чтения. Для каждой метрики укажите период, единицу наблюдения и правило связывания события с показанной рекомендацией.

Не используйте задержанный результат раньше, чем он успел проявиться. Сравнение возвратов на второй день после покупки с возвратами за полный месяц создаёт неравные условия.

Клик зависит от места показа

Пользователь не выбирает из всего каталога: он реагирует на то, что ему показали. Предмет на первой позиции получает другую возможность быть замеченным, чем предмет в конце списка.

Работа Joachims, Swaminathan и Schnabel о смещённой обратной связи разбирает проблему позиционного смещения в данных о кликах. Практическое следствие для продукта: журнал показов нужен вместе с журналом действий. Отсутствие клика по непоказанному объекту нельзя трактовать как установленное отсутствие интереса.

Сохраняйте идентификатор запроса рекомендаций, набор доступных кандидатов, показанный порядок и последующие события. Доступ к этим журналам и сроки хранения определяют по задаче и требованиям к данным.

Если система учится только на собственных прошлых показах, популярные объекты могут снова получать больше возможностей для взаимодействия. Механизм знакомства с новыми объектами стоит проектировать отдельно и проверять с ограничением риска для пользователя.

Начать с понятного варианта сравнения

Сложную модель полезно сравнить с простым подходом: популярное в подходящей категории, продолжение текущего сценария или ручные правила подбора. Такой вариант должен соблюдать те же ограничения доступности, цены и прав, что и новая система.

Для нового пользователя можно предложить выбор интересов или использовать контекст текущей задачи. Не нужно придумывать подробный профиль по одному действию. Для нового объекта полезны корректные атрибуты и отдельный способ получить первые наблюдения.

Публикация об анализе эстетических предпочтений с помощью нейросетей относится к исследовательской постановке задачи. Система, предсказывающая взаимодействие с изображением, не получает из этого объективную меру красоты или достоверный психологический портрет человека.

Как устроить проверку

Этап Что сравнивать Типичная причина неверного вывода
Проверка на исторических данных Качество на данных, не использованных для настройки В обучении оказались будущие события
Проверка правил Доступность объектов, права, исключения, лимиты Модель предлагает недопустимый объект
Ограниченный эксперимент Заранее определённый деловой результат Группы различаются условиями или смешиваются
Наблюдение после запуска Качество по сегментам и задержанные последствия Среднее скрывает ухудшение для части пользователей

При разбиении по времени сохраните реальную последовательность появления данных. Признак, которого ещё не было в момент рекомендации, не должен помогать модели в историческом тесте.

В эксперименте заранее определите единицу назначения в группы. Если один человек регулярно пользуется сервисом, независимое переключение варианта на каждой странице может смешивать влияние. Объём наблюдений и способ оценки неопределённости зависят от этой структуры.

Пример решения по результатам

Предположим, в вымышленном эксперименте кликабельность выросла с 5% до 7%, а доля завершённых покупок среди пользователей с показом уменьшилась с 2% до 1,8%. Эти числа сами по себе ещё не устанавливают статистически устойчивый эффект: нужны объём выборки и оценка неопределённости.

Но уже нельзя отчитаться об успехе только по росту кликов. Следует проверить, какие объекты получили показы, соблюдались ли ограничения и не ухудшилось ли соответствие цели пользователя. При недостатке данных решение откладывают; при подтверждённом вреде возвращают предыдущий вариант.

Для каждого выпуска сохраняйте версию модели, признаков, каталога и правил. Встроенный резервный подбор должен оставаться полезным, когда персональная рекомендация недоступна или данных слишком мало.

Результат внедрения — воспроизводимое улучшение выбранной операции в известных условиях. Один красивый пример персонального попадания этого не доказывает.