Модель быстрее отвечает на короткий запрос, но чаще требует повторной попытки. Другая медленнее начинает генерацию, зато укладывается в требования на длинных документах. Сравнение по одному времени ответа не показывает, какая конфигурация лучше выполнит рабочую задачу.
Для выбора нужен испытательный протокол: одинаковые входы, определённый результат, ограничения качества и нагрузки, зафиксированные настройки. Цена и энергия приобретают смысл внутри этих условий.
Сравнивать конфигурации на одной операции
Определите, что считается завершённым заданием: корректно извлечённые поля, принятый ответ или прошедший проверки документ. Сохраните набор входов и способ оценивания. Разделите материал для настройки и итоговой проверки.
Участником сравнения является вся конфигурация: модель, промпт, инструменты, подготовка данных и правила повторов. Если одному варианту разрешён дополнительный поиск, а другому нет, это сравнение систем с разными возможностями. Его можно проводить, но различие нужно указать.
Порог качества, допустимую задержку и обязательные ограничения устанавливают до испытания. Быстрый вариант, который не выполняет требования операции, не становится победителем по низкой стоимости.
Тема ресурсных ограничений нейросетей рассматривается в публикации 2023 года. Для решения о конкретной системе нужны собственные измерения: общие рассуждения о росте вычислений не определяют её рабочую эффективность.
Зафиксировать условия запуска
В протокол включают версии компонентов, параметры генерации, аппаратную конфигурацию или идентификатор сервиса, размеры входов и правила кэширования. Холодный запуск и прогретый режим проверяют отдельно, если оба встречаются в эксплуатации.
Сначала измерьте выполнение единичных заданий, затем повторите тест при ожидаемой параллельности и в режиме перегрузки. В пользовательскую задержку включайте ожидание очереди, обращения к инструментам и подготовку результата.
Скорость в токенах в секунду полезна для диагностики, но не всегда сопоставима между моделями: объём и способ разбиения текста различаются. Для прикладного выбора важнее время завершённой операции с принятым результатом.
Не ограничивайтесь одним прогоном. Повторения показывают разброс качества и задержки. Для внешнего сервиса фиксируйте дату и доступные сведения о версии; неизменное имя модели не всегда даёт полный контроль над внутренней реализацией.
Пример, где дешёвый вариант не проходит требования
Ниже — условный тест из 1 000 заданий. До запуска установлено: не менее 95% принятых результатов на этом тесте и p95 полной задержки не более 10 секунд. Это иллюстративные требования, не рекомендация для любого продукта. p95 означает, что примерно 95% измеренных задержек не превышают указанное значение.
| Показатель | Конфигурация A | Конфигурация B |
|---|---|---|
| Принятые результаты | 960 | 800 |
| p95 полной задержки | 9 секунд | 4 секунды |
| Стоимость машинного прогона | 30 условных денежных единиц | 18 условных денежных единиц |
| Затраты прогона на принятый результат | 0,03125 | 0,0225 |
B дешевле и быстрее, но не проходит установленное условие качества. На данном этапе сравнения она не подходит для самостоятельного выполнения всей операции.
Нельзя незаметно добавить B исправление человеком и оставить прежнюю стоимость. В таком случае получится новая конфигурация, для которой повторно измеряют полный цикл, затраты и качество.
Даже выполнение порога на 1 000 заданиях не доказывает его соблюдение на любом будущем потоке. Оцените неопределённость и покрытие важных классов входов; редкие критические ошибки проверяют отдельно.
Измерять энергию в явных границах
Энергия — это накопленное потребление за интервал работы. Для сравнения задайте, какие компоненты входят в измерение: ускоритель, весь сервер, сеть, хранение и другие необходимые части.
Показатель мощности одной GPU не равен энергозатратам всей операции. Значение паспортной мощности также не является измеренным расходом. При собственном стенде используйте доступные измерения с известными единицами и частотой; указывайте, включён ли простой и как распределены общие расходы.
MLPerf Power предлагает методологию сопоставимого измерения энергетической эффективности ML-систем. Описанный здесь прикладной тест не является сертифицированным прогоном MLPerf и не заменяет его правил.
Для внешнего API без телеметрии поставщика нельзя честно вычислить энергию запроса из количества токенов. В этом случае фиксируйте неизвестность, а доступную стоимость измеряйте отдельно. Углеродный след потребует дополнительных сведений об энергоснабжении и границах учёта.
Как оформить решение
Сохраните исходные задания, критерии приёмки, настройки, результаты отдельных попыток и сводку по классам входов. В решении укажите, какой вариант прошёл ограничения и в каких условиях проводилась проверка.
Стоимость полного владения рассматривается отдельно в статье о TCO private AI. Испытательный протокол даёт для такого расчёта измеренные характеристики и помогает не подменить полезную работу количеством генераций.
После изменения модели, маршрутизации или нагрузки повторите значимую часть теста. Выбор относится к зафиксированной конфигурации; он не является бессрочным свойством названия модели.