Полный текст
«Золотая рыбка, хочу LLM без GPU»: как собрать Inference-сервер на CPUНужно протестировать или развернуть LLM (модель на сотни миллиардов параметров) в локальной среде, но памяти одной видеокарты не хватает? Серверы с множеством GPU слишком дороги, их цена может доходить до 700 000 ₽ в месяц.Альтернатива — запуск LLM на CPU. Это медленнее, но значительно дешевле: сервер с двумя CPU обойдётся примерно в 150 000 ₽ в месяц. Для небольшого числа пользователей это идеальный вариант. Погрузимся в то, насколько реально запустить крупную языковую модель исключительно на центральном процессоре, узнаем, какие инструменты для этого нужны, и оценим, насколько приемлемой остаётся производительность.