Модель быстрее отвечает на короткий запрос, но чаще требует повторной попытки. Другая медленнее начинает генерацию, зато укладывается в требования на длинных документах. Сравнение по одному времени ответа не показывает, какая конфигурация лучше выполнит рабочую задачу.

Для выбора нужен испытательный протокол: одинаковые входы, определённый результат, ограничения качества и нагрузки, зафиксированные настройки. Цена и энергия приобретают смысл внутри этих условий.

Сравнивать конфигурации на одной операции

Определите, что считается завершённым заданием: корректно извлечённые поля, принятый ответ или прошедший проверки документ. Сохраните набор входов и способ оценивания. Разделите материал для настройки и итоговой проверки.

Участником сравнения является вся конфигурация: модель, промпт, инструменты, подготовка данных и правила повторов. Если одному варианту разрешён дополнительный поиск, а другому нет, это сравнение систем с разными возможностями. Его можно проводить, но различие нужно указать.

Порог качества, допустимую задержку и обязательные ограничения устанавливают до испытания. Быстрый вариант, который не выполняет требования операции, не становится победителем по низкой стоимости.

Тема ресурсных ограничений нейросетей рассматривается в публикации 2023 года. Для решения о конкретной системе нужны собственные измерения: общие рассуждения о росте вычислений не определяют её рабочую эффективность.

Зафиксировать условия запуска

В протокол включают версии компонентов, параметры генерации, аппаратную конфигурацию или идентификатор сервиса, размеры входов и правила кэширования. Холодный запуск и прогретый режим проверяют отдельно, если оба встречаются в эксплуатации.

Сначала измерьте выполнение единичных заданий, затем повторите тест при ожидаемой параллельности и в режиме перегрузки. В пользовательскую задержку включайте ожидание очереди, обращения к инструментам и подготовку результата.

Скорость в токенах в секунду полезна для диагностики, но не всегда сопоставима между моделями: объём и способ разбиения текста различаются. Для прикладного выбора важнее время завершённой операции с принятым результатом.

Не ограничивайтесь одним прогоном. Повторения показывают разброс качества и задержки. Для внешнего сервиса фиксируйте дату и доступные сведения о версии; неизменное имя модели не всегда даёт полный контроль над внутренней реализацией.

Пример, где дешёвый вариант не проходит требования

Ниже — условный тест из 1 000 заданий. До запуска установлено: не менее 95% принятых результатов на этом тесте и p95 полной задержки не более 10 секунд. Это иллюстративные требования, не рекомендация для любого продукта. p95 означает, что примерно 95% измеренных задержек не превышают указанное значение.

Показатель Конфигурация A Конфигурация B
Принятые результаты 960 800
p95 полной задержки 9 секунд 4 секунды
Стоимость машинного прогона 30 условных денежных единиц 18 условных денежных единиц
Затраты прогона на принятый результат 0,03125 0,0225

B дешевле и быстрее, но не проходит установленное условие качества. На данном этапе сравнения она не подходит для самостоятельного выполнения всей операции.

Нельзя незаметно добавить B исправление человеком и оставить прежнюю стоимость. В таком случае получится новая конфигурация, для которой повторно измеряют полный цикл, затраты и качество.

Даже выполнение порога на 1 000 заданиях не доказывает его соблюдение на любом будущем потоке. Оцените неопределённость и покрытие важных классов входов; редкие критические ошибки проверяют отдельно.

Измерять энергию в явных границах

Энергия — это накопленное потребление за интервал работы. Для сравнения задайте, какие компоненты входят в измерение: ускоритель, весь сервер, сеть, хранение и другие необходимые части.

Показатель мощности одной GPU не равен энергозатратам всей операции. Значение паспортной мощности также не является измеренным расходом. При собственном стенде используйте доступные измерения с известными единицами и частотой; указывайте, включён ли простой и как распределены общие расходы.

MLPerf Power предлагает методологию сопоставимого измерения энергетической эффективности ML-систем. Описанный здесь прикладной тест не является сертифицированным прогоном MLPerf и не заменяет его правил.

Для внешнего API без телеметрии поставщика нельзя честно вычислить энергию запроса из количества токенов. В этом случае фиксируйте неизвестность, а доступную стоимость измеряйте отдельно. Углеродный след потребует дополнительных сведений об энергоснабжении и границах учёта.

Как оформить решение

Сохраните исходные задания, критерии приёмки, настройки, результаты отдельных попыток и сводку по классам входов. В решении укажите, какой вариант прошёл ограничения и в каких условиях проводилась проверка.

Стоимость полного владения рассматривается отдельно в статье о TCO private AI. Испытательный протокол даёт для такого расчёта измеренные характеристики и помогает не подменить полезную работу количеством генераций.

После изменения модели, маршрутизации или нагрузки повторите значимую часть теста. Выбор относится к зафиксированной конфигурации; он не является бессрочным свойством названия модели.