Полный текст
Как готовить Triton: рецепты вашей собственной Inference-платформыЕсли вам нужно запустить небольшой инференс одной ML-модели, можно взять команду бэкендеров, дать им эту модель, они обернут её в эндпоинт — и готово. Достаточно короткого скрипта из нескольких строк на Python. Но что, если нужно запускать несколько моделей, оптимизировать выполнение, работать с ансамблем моделей, задействовать CPU и GPU одновременно и т. д.? Все эти проблемы решает NVIDIA Triton Inference Server. Правда, он добавляет одну новую: разобраться с ним и его документацией — тот ещё квест.Посмотрим, насколько сложной задачей может оказаться создание собственного инференса и какие аспекты нужно учитывать