Полный текст

Парадокс MTP: как утяжеление весов Qwen3.6 всего на 0.3 Гб ускоряет генерацию в два разаРелиз Qwen3.6 с поддержкой Multi-Token Prediction (MTP) в llama.cpp ломает привычную линейную скорость LLM. Дополнительные слои предсказывают сразу несколько токенов за один проход скрытого состояния. Веса растут всего на 0.3 Гб, а скорость генерации подскакивает с 60 до 130 t/s.Главный вопрос — падает ли качество. Исходники sampling.cpp доказывают: алгоритм спекулятивного декодирования обрывает проверку при первом расхождении токенов, выдавая строго lossless-результат. Ускорение напрямую зависит от архитектуры — Dense-модели показывают стабильный двукратный прирост, а вот MoE внезапно выдают деградацию на творческих задачах.