Полный текст

Нейронные аудиокодеки: мощное сжатие звука с помощью LLMgzip жмёт английскую Википедию 3:1. NNCP с нейросетью внутри — 9:1. Лидер мирового бенчмарка LTCB.Идея простая. Берём LLM как огромный словарь токенов — и она предсказывает следующий лучше любого статистического кодера.А теперь — что если так же поступить со звуком?В 2024 году Kyutai выкатили Moshi и аудиокодек Mimi. Он не предсказывает сэмплы напрямую — это было бы безумием, в секунде их десятки тысяч. Mimi сжимает аудио до 12,5 Гц. Около 24 токенов в секунду на каждый слой квантования. Голос. Дыхание. Шум кофейни на фоне. Всё умещается в поток размером с короткое SMS.Внутри — автоэнкодер и остаточный квантователь RVQ. Семантика — за смысл, акустика — за тембр. Развести эти потоки в реалтайме было главной болью всех предыдущих кодеков.