Полный текст

Как запустить локально LLM, если её веса не помещаются в [видео]памятьЕсли веса модели не помещаются в ОЗУ (или, ещё лучше, в видеопамять), то пользоваться моделью практически невозможно. При вычислении каждого токена все веса придётся заново читать с диска, и минимальную задержку легко посчитать, просто разделив размер модели на скорость чтения. Но даже если у вас дома совершенно случайно не завалялись парочка Nvidia B100 или Mac Studio Ultra/512GB RAM, всё ещё есть возможность запустить большую LLM.