Полный текст
«Как я собрал LLM-печку на 4 GPU, и на что она способна»Дефицит линий PCIe на потребительском железе обходится через конвертацию слотов M.2, что даёт возможность объединить 96 ГБ VRAM без перехода на дорогостоящее HEDT-оборудование. Подключение дополнительных видеокарт реализуется через райзеры и адаптеры M.2 в PCIe 4.0 x4. Урезанная пропускная способность интерфейса компенсируется спецификой работы llama.cpp. Распределение нейросети по слоям (layer split) минимизирует обмен данными: передача контекста происходит исключительно по завершении вычислений целого блока.Узнаем, в какой момент добавление новых графических чипов на узком интерфейсе приводит к обратной деградации скорости генерации токенов.