Что такое Whisper
Whisper – это семейство моделей автоматического распознавания речи (ASR, automatic speech recognition), которое OpenAI выпустила осенью 2022 года и с тех пор развивает открыто: веса и код доступны на GitHub и Hugging Face под лицензией MIT. Архитектурно это encoder- decoder Transformer – та же схема, что и у больших языковых моделей, только на входе не текст, а звук, разбитый на спектрограммы.
Модель обучена на 680 000 часов размеченного аудио, собранного из открытых источников в интернете, и делает сразу три вещи: распознаёт речь на исходном языке, переводит речь на английский текст и определяет, на каком языке вообще говорят. Именно многозадачность и объём разношёрстных данных (разные акценты, фоновый шум, качество записи) – причина, почему Whisper держится устойчиво на живом, не студийном аудио, а не только на чистых дикторских записях.
Версии: от tiny до large-v3-turbo
Whisper выпускается в нескольких размерах – чем больше модель, тем точнее распознавание, но и тем больше видеопамяти и времени нужно на инференс. У всех размеров, кроме large и turbo, есть англоязычная версия с суффиксом .en – она чуть точнее на английском, потому что не тратит «внимание» модели на другие языки.
| МОДЕЛЬ | ПАРАМЕТРОВ | ТОЛЬКО АНГЛИЙСКИЙ | ВЫШЛА |
|---|---|---|---|
| tiny | 39 млн | есть, tiny.en | сент. 2022 |
| base | 74 млн | есть, base.en | сент. 2022 |
| small | 244 млн | есть, small.en | сент. 2022 |
| medium | 769 млн | есть, medium.en | сент. 2022 |
| large (v1) | 1,55 млрд | нет | сент. 2022 |
| large-v2 | 1,55 млрд | нет | дек. 2022 |
| large-v3 | 1,55 млрд | нет | нояб. 2023 |
| large-v3-turbo | 809 млн | нет | окт. 2024 |
По памяти: tiny и base укладываются примерно в 1 ГБ видеопамяти, large – порядка 10 ГБ. На практике для продакшна почти всегда берут либо large-v3 (когда важна максимальная точность), либо large-v3-turbo (когда важна скорость).
large-v2 и large-v3 – что изменилось
large-v2 (декабрь 2022) – та же архитектура, что у первой large, но с более долгим и аккуратным обучением: больше эпох, регуляризация против переобучения. Прироста в архитектуре нет, прирост в качестве – за счёт обучения.
large-v3 (ноябрь 2023) – два архитектурных изменения: на входе 128 mel-частотных полос вместо 80 (модель «слышит» более детальный спектр звука) и добавлен отдельный токен для кантонского языка. Ключевое – данные: 1 млн часов размеченного вручную аудио плюс 4 млн часов аудио, размеченного самим large-v2 (псевдоразметка), итого около 5 млн часов обучения. По данным OpenAI, это даёт снижение ошибок распознавания (WER) на 10–20% по языкам относительно large-v2.
large-v3-turbo – та же точность, в разы быстрее
large-v3-turbo вышла в октябре 2024 года как облегчённая версия large-v3: у декодера (часть модели, которая печатает текст токен за токеном) обрезали 32 слоя до 4. Параметров стало 809 млн вместо 1,55 млрд, а скорость выросла в 2–5 раз в зависимости от железа – при этом OpenAI описывает потерю точности как минимальную. Для задач, где счёт идёт на миллисекунды (потоковое распознавание в голосовых ботах, субтитры в реальном времени), turbo обычно предпочтительнее полной large-v3.
Лицензия и как использовать
Код и веса всех версий Whisper распространяются по лицензии MIT – это значит, что модель можно скачать, запустить на своём сервере и использовать в коммерческом проекте бесплатно, без отчислений за минуту. Отдельно OpenAI предлагает платный облачный Whisper API – это обёртка вокруг той же модели, но с оплатой по факту использования на серверах OpenAI, без необходимости держать своё железо. Вокруг открытых весов выросла экосистема ускоренных реализаций инференса (например, faster-whisper, whisper.cpp) – они не меняют саму модель, но заметно ускоряют и облегчают запуск на обычном CPU или слабой видеокарте.
Whisper и новые модели распознавания от OpenAI
В марте 2025 года OpenAI выпустила отдельные модели gpt-4o-transcribe и gpt-4o-mini-transcribe – они построены на архитектуре GPT-4o, а не на Whisper, доступны только через платный API (по данным OpenAI, около $0,006 и $0,003 за минуту соответственно) и, по собственным бенчмаркам OpenAI, точнее Whisper на чистом аудио. Веса этих моделей закрыты – самостоятельно развернуть их нельзя. Whisper при этом никуда не делся: это по-прежнему единственный вариант линейки, который можно скачать и запустить у себя бесплатно.
Вопросы и ответы
Whisper бесплатный?
Да, код и веса модели открыты по лицензии MIT – её можно использовать, дорабатывать и встраивать в коммерческие проекты бесплатно. Платный вариант – это облачный Whisper API от OpenAI, который берёт деньги за минуту обработки на своих серверах.
Какая версия Whisper самая точная?
large-v3: она обучена на порядка 5 млн часов аудио и снижает ошибки распознавания на 10–20% по сравнению с large-v2.
Чем large-v3-turbo отличается от large-v3?
У turbo урезан декодер – 4 слоя вместо 32, из-за чего модель в 2–5 раз быстрее при почти той же точности. Параметров тоже меньше: 809 млн против 1,55 млрд у large-v3.
Можно ли использовать Whisper без интернета?
Да, открытые веса можно запустить локально или на своём сервере – в этом его ключевое отличие от закрытых облачных моделей распознавания речи.
Поддерживает ли Whisper русский язык?
Да, модель мультиязычная и поддерживает около 99 языков, включая русский, хотя качество распознавания между языками отличается.
Whisper и gpt-4o-transcribe – это одно и то же?
Нет. gpt-4o-transcribe – отдельная закрытая модель OpenAI 2025 года, доступна только по платному API. Whisper остаётся открытым и бесплатным для самостоятельного запуска.