Полный текст
Как приручить LLM: подбор инфраструктуры для инференса. Часть перваяКогда к вам приходят с запросом «Разверните мне Qwen», или ещё сложнее — «Разверните Qwen так, чтобы держать 10 RPS с задержкой до пяти секунд», невольно задаёшься вопросом: «А какая инфраструктура для этого нужна?».В этой серии статей разберёмся, как подобрать оптимальную конфигурацию, тестировать производительность инференса и автоматизировать весь процесс. А чтобы было интереснее, отправимся в уникальное путешествие на дракаре в волшебную долину драконов. Вместе мы напишем книгу по приручению самых разнообразных LLM-«драконов», выясним, какие «GPU-седла» подходят под каждого и какие инструменты использовать для их приручения.