Обсудить задачу
викиии · модели

Whisper

коротко

Whisper – открытая (лицензия MIT) модель распознавания речи от OpenAI: переводит аудио в текст почти на 99 языках и умеет переводить речь сразу на английский. Вышла в сентябре 2022 года, дальше обновлялась: large-v2 (декабрь 2022), large-v3 (ноябрь 2023, точнее) и large-v3-turbo (октябрь 2024 – та же точность, но в разы быстрее за счёт урезанного декодера).

обновлено 20 июля 2026·модели · распознавание речи

Что такое Whisper

Whisper – это семейство моделей автоматического распознавания речи (ASR, automatic speech recognition), которое OpenAI выпустила осенью 2022 года и с тех пор развивает открыто: веса и код доступны на GitHub и Hugging Face под лицензией MIT. Архитектурно это encoder- decoder Transformer – та же схема, что и у больших языковых моделей, только на входе не текст, а звук, разбитый на спектрограммы.

Модель обучена на 680 000 часов размеченного аудио, собранного из открытых источников в интернете, и делает сразу три вещи: распознаёт речь на исходном языке, переводит речь на английский текст и определяет, на каком языке вообще говорят. Именно многозадачность и объём разношёрстных данных (разные акценты, фоновый шум, качество записи) – причина, почему Whisper держится устойчиво на живом, не студийном аудио, а не только на чистых дикторских записях.

Версии: от tiny до large-v3-turbo

Whisper выпускается в нескольких размерах – чем больше модель, тем точнее распознавание, но и тем больше видеопамяти и времени нужно на инференс. У всех размеров, кроме large и turbo, есть англоязычная версия с суффиксом .en – она чуть точнее на английском, потому что не тратит «внимание» модели на другие языки.

МОДЕЛЬПАРАМЕТРОВТОЛЬКО АНГЛИЙСКИЙВЫШЛА
tiny39 млнесть, tiny.enсент. 2022
base74 млнесть, base.enсент. 2022
small244 млнесть, small.enсент. 2022
medium769 млнесть, medium.enсент. 2022
large (v1)1,55 млрднетсент. 2022
large-v21,55 млрднетдек. 2022
large-v31,55 млрднетнояб. 2023
large-v3-turbo809 млннетокт. 2024

По памяти: tiny и base укладываются примерно в 1 ГБ видеопамяти, large – порядка 10 ГБ. На практике для продакшна почти всегда берут либо large-v3 (когда важна максимальная точность), либо large-v3-turbo (когда важна скорость).

large-v2 и large-v3 – что изменилось

large-v2 (декабрь 2022) – та же архитектура, что у первой large, но с более долгим и аккуратным обучением: больше эпох, регуляризация против переобучения. Прироста в архитектуре нет, прирост в качестве – за счёт обучения.

large-v3 (ноябрь 2023) – два архитектурных изменения: на входе 128 mel-частотных полос вместо 80 (модель «слышит» более детальный спектр звука) и добавлен отдельный токен для кантонского языка. Ключевое – данные: 1 млн часов размеченного вручную аудио плюс 4 млн часов аудио, размеченного самим large-v2 (псевдоразметка), итого около 5 млн часов обучения. По данным OpenAI, это даёт снижение ошибок распознавания (WER) на 10–20% по языкам относительно large-v2.

large-v3-turbo – та же точность, в разы быстрее

large-v3-turbo вышла в октябре 2024 года как облегчённая версия large-v3: у декодера (часть модели, которая печатает текст токен за токеном) обрезали 32 слоя до 4. Параметров стало 809 млн вместо 1,55 млрд, а скорость выросла в 2–5 раз в зависимости от железа – при этом OpenAI описывает потерю точности как минимальную. Для задач, где счёт идёт на миллисекунды (потоковое распознавание в голосовых ботах, субтитры в реальном времени), turbo обычно предпочтительнее полной large-v3.

Лицензия и как использовать

Код и веса всех версий Whisper распространяются по лицензии MIT – это значит, что модель можно скачать, запустить на своём сервере и использовать в коммерческом проекте бесплатно, без отчислений за минуту. Отдельно OpenAI предлагает платный облачный Whisper API – это обёртка вокруг той же модели, но с оплатой по факту использования на серверах OpenAI, без необходимости держать своё железо. Вокруг открытых весов выросла экосистема ускоренных реализаций инференса (например, faster-whisper, whisper.cpp) – они не меняют саму модель, но заметно ускоряют и облегчают запуск на обычном CPU или слабой видеокарте.

Whisper и новые модели распознавания от OpenAI

В марте 2025 года OpenAI выпустила отдельные модели gpt-4o-transcribe и gpt-4o-mini-transcribe – они построены на архитектуре GPT-4o, а не на Whisper, доступны только через платный API (по данным OpenAI, около $0,006 и $0,003 за минуту соответственно) и, по собственным бенчмаркам OpenAI, точнее Whisper на чистом аудио. Веса этих моделей закрыты – самостоятельно развернуть их нельзя. Whisper при этом никуда не делся: это по-прежнему единственный вариант линейки, который можно скачать и запустить у себя бесплатно.

связанные термины

Вопросы и ответы

Whisper бесплатный?

Да, код и веса модели открыты по лицензии MIT – её можно использовать, дорабатывать и встраивать в коммерческие проекты бесплатно. Платный вариант – это облачный Whisper API от OpenAI, который берёт деньги за минуту обработки на своих серверах.

Какая версия Whisper самая точная?

large-v3: она обучена на порядка 5 млн часов аудио и снижает ошибки распознавания на 10–20% по сравнению с large-v2.

Чем large-v3-turbo отличается от large-v3?

У turbo урезан декодер – 4 слоя вместо 32, из-за чего модель в 2–5 раз быстрее при почти той же точности. Параметров тоже меньше: 809 млн против 1,55 млрд у large-v3.

Можно ли использовать Whisper без интернета?

Да, открытые веса можно запустить локально или на своём сервере – в этом его ключевое отличие от закрытых облачных моделей распознавания речи.

Поддерживает ли Whisper русский язык?

Да, модель мультиязычная и поддерживает около 99 языков, включая русский, хотя качество распознавания между языками отличается.

Whisper и gpt-4o-transcribe – это одно и то же?

Нет. gpt-4o-transcribe – отдельная закрытая модель OpenAI 2025 года, доступна только по платному API. Whisper остаётся открытым и бесплатным для самостоятельного запуска.