Полный текст

EvoPress: новый подход к оптимизации и сжатию LLM от исследователей ЯндексаЗатраты на инференс LLM и дефицит VRAM стали ключевой болью индустрии. Модели нужно сжимать, но как?Обычно прунинг или квантизацию применяют равномерно — одинаково «стригут» все слои. Но слои не равноценны. Одни можно сжать сильно почти безболезненно, другие — критически важны. Проблема в том, что сжатие нелинейно. Нельзя просто найти «ненужные» слои по эвристике.Исследователи Яндекса и ETH Zurich представили EvoPress. Это эволюционный алгоритм, который сам ищет оптимальную неравномерную конфигурацию сжатия, отбирая лучшие «мутации».Погрузимся в детали этого подхода и посмотрим на результаты.