Полный текст

QAT против QAD: почему 4 бита убивают логику LLMТипичный сценарий 4-битного квантования: экономия памяти ломает математику. Выяснилось, что стандартный QAT для моделей после RL работает хуже, чем PTQ. Cross-Entropy просто стирает «мышление», наработанное на этапе Reinforcement Learning.NVIDIA представила QAD — метод, где вместо заучивания ответов модель копирует поведение «учителя» через KL-дивергенцию. Самое странное: точность восстанавливается даже при обучении на рандомных токенах. Всё дело в градиентах и распределениях, а не в данных.Проанализируем механику восстановления весов.