Сбер представил сразу две новые Open Source модели для работы с речью: GigaAM Multilingual и GigaChat Audio.
Обе разработки уже опубликованы в открытом доступе и ориентированы на решение одной из главных проблем современных речевых ИИ: качественную работу с длинными аудиозаписями и поддержку языков с ограниченным количеством обучающих данных.
Разработчики отмечают, что большинство существующих Speech AI-моделей создавались преимущественно для английского языка и сравнительно коротких записей. При работе с казахским, кыргызским, узбекским и другими языками качество распознавания заметно снижается. Новые модели должны изменить эту ситуацию.
GigaAM Multilingual
Первая новинка представляет собой развитие уже известной модели распознавания речи GigaAM. Теперь она поддерживает русский, английский, казахский, кыргызский и узбекский языки.
В состав входят две версии аудиоэнкодера с 240 и 600 миллионами параметров. Они были предварительно обучены более чем на 2 миллионах часов речи на 70+ языках с особым вниманием к языкам стран СНГ. По словам разработчиков, благодаря этому модель значительно быстрее адаптируется к новым языкам по сравнению с Whisper и Omnilingual.
Также представлены новые модели автоматического распознавания речи (CTC ASR), обученные на 50 тысячах часов мультидоменных аудиоданных. Согласно опубликованным тестам, даже компактная версия на 240 млн параметров показывает более высокую точность, чем Whisper Large v3 и Omnilingual 1B, несмотря на значительно меньший размер.
Подробнее:
GigaChat Audio
Вторая разработка стала полноценной audio-native LLM, построенной на базе GigaAM Multilingual и языковой модели GigaChat 3.1.
Она умеет не только распознавать речь, но и поддерживает:
- многоходовые голосовые диалоги;
- перевод аудио;
- классификацию звуков;
- поиск событий внутри записи (temporal grounding);
- описание отдельных фрагментов аудио;
- создание кратких пересказов с временными метками.
Главной особенностью модели стала возможность работать с контекстом продолжительностью до двух часов, тогда как многие существующие решения заметно теряют качество уже на длинных записях.
По данным Сбера, в задаче поиска событий внутри 20-60-минутных аудиозаписей модель значительно превосходит Voxtral, Phi-4 и Qwen3-Omni. Кроме того, GigaChat Audio показывает высокие результаты при понимании русского языка и распознавании эмоций.
Подробнее:
Почему это важно
Появление GigaAM Multilingual и GigaChat Audio показывает, что развитие открытых моделей постепенно выходит за рамки англоязычного рынка. Теперь разработчики смогут создавать собственные решения для русского языка и языков СНГ без необходимости использовать закрытые коммерческие сервисы.
Особенно интересно выглядит поддержка двухчасового контекста. Для расшифровки конференций, интервью, судебных заседаний, образовательных курсов и корпоративных встреч подобная возможность может стать серьезным преимуществом перед большинством существующих Open Source решений.