Полный текст
Сбер выложил в открытый доступ две новые речевые модели собственной разработки — GigaChat3.1-Audio-10B и GigaAM Multilingual. Решения созданы специально для русского и языков СНГ, опережая по качеству распознавания мировые аналогиGigaChat Audio способна обрабатывать аудиофайлы и голосовые сообщения без предварительного преобразования речи в текст, научилась понимать интонацию пользователя и получила расширенные возможности по обработке звуковой информации. Отмечается, что GigaChat Audio теперь распознает, с позитивной или негативной эмоцией обращается к нему пользователь - по интонации, характеристикам голоса и нюансам произношения. Модель может обрабатывать записи длиной до трех часов и ориентироваться внутри них: можно спросить, в какой момент разговора обсуждали конкретный вопрос, попросить пересказать отдельный отрезок или получить саммари всей записи со ссылками на таймкоды. Нейросеть также способна различать в записи спикеровGigaAM Multilingual — автоматизирует кол-центры, расшифровку встреч и автосубтитрыОбе разработки открыты для бесплатного использования по всему миру — от создания переводчиков до сервисов помощи людям с нарушениями речиTelegram | VK | MAX