Часовая запись встречи часто превращается в два часа ручной расшифровки. Whisper позволяет сделать черновой текст, субтитры и таймкоды локально: аудиофайл остаётся на компьютере, а после загрузки модели интернет для распознавания не нужен.

Но качество зависит не только от размера модели. Плохой звук, несколько говорящих одновременно, неверно выбранный язык и профессиональные термины способны испортить даже результат большой модели. Поэтому ниже есть не только команды установки, но и схема проверки готовой расшифровки.

Короткий ответ: для обычной русской речи начните с модели small или medium. Для быстрого черновика попробуйте turbo. Сохраняйте одновременно TXT и SRT: обычный текст удобен для редактирования, а субтитры позволяют быстро найти ошибку в исходной записи.

Какой способ выбрать

ЗадачаПодходОсобенности
Разовая короткая записьWhisper из командной строкиМинимум настроек
Многочасовые записиFaster-Whisper или GUI на его основеВыше скорость, больше параметров
Субтитры для видеоВывод SRT или VTTСохраняются таймкоды
Конфиденциальное интервьюЛокальный запуск без облачного APIФайл не требуется загружать на сайт
Разделение по спикерамWhisper плюс отдельная диаризацияБазовый Whisper сам не подписывает участников надёжно

Что такое Whisper

Whisper — модель распознавания речи, обученная работать с разными языками, шумом и форматами аудио. Она умеет расшифровывать речь на исходном языке, определять язык и в отдельных режимах переводить запись на английский.

Программа обрабатывает файл фрагментами и собирает результат в текст с временными отметками. Работа происходит на CPU или поддерживаемой видеокарте. Чем крупнее модель, тем обычно выше требования к памяти и дольше обработка.

Команды установки и список режимов опубликованы в официальном репозитории Whisper.

Какая модель подходит для русского языка

МодельКогда использоватьКомпромисс
tiny / baseБыстрый тест и слабый компьютерБольше ошибок в именах и сложной речи
smallЛекции, заметки, понятная речьХороший старт для CPU
mediumИнтервью и материалы, где важна точностьТребует больше времени и памяти
largeСложный звук и максимальное качествоВысокие требования к системе
turboБыстрая транскрибацияОптимизирован для скорости; перевод имеет ограничения

Для русского языка выбирайте многоязычную модель без суффикса .en. Англоязычные варианты предназначены только для английской речи.

Установка Whisper на Windows

Понадобятся Python и FFmpeg. Чтобы зависимости одной программы не смешивались с другими проектами, создадим отдельное виртуальное окружение.

Шаг 1. Проверьте Python

python --version

Если команда не найдена, установите актуальную совместимую версию Python и включите добавление в PATH. Затем заново откройте PowerShell.

Шаг 2. Установите FFmpeg

При использовании Chocolatey:

choco install ffmpeg

Либо установите FFmpeg через Scoop. После установки проверьте:

ffmpeg -version

Шаг 3. Создайте окружение

mkdir whisper-local
cd whisper-local
python -m venv .venv
.\.venv\Scripts\Activate.ps1
python -m pip install --upgrade pip

Если PowerShell запрещает активацию скрипта, можно запустить команды через обычную командную строку или изменить политику только для текущего пользователя, предварительно понимая последствия настройки.

Шаг 4. Установите Whisper

pip install -U openai-whisper

Первый запуск выбранной модели скачает её файлы. Для последующей локальной работы они должны оставаться в кэше.

Первая расшифровка аудио

Поместите файл в папку проекта и выполните:

whisper "interview.mp3" --language Russian --model small --output_format txt

Рядом появится текстовый файл. Чтобы получить субтитры:

whisper "interview.mp3" --language Russian --model small --output_format srt

Whisper также поддерживает VTT, JSON и набор всех форматов:

whisper "interview.mp3" --language Russian --model medium --output_format all --output_dir result

Как перевести видео в текст

Отдельно извлекать звук обычно не требуется: FFmpeg прочитает распространённый видеоформат, а Whisper обработает звуковую дорожку.

whisper "lecture.mp4" --language Russian --model small --output_format srt

Если в видео несколько дорожек или повреждён звук, сначала создайте нормализованный WAV:

ffmpeg -i "lecture.mp4" -ac 1 -ar 16000 "lecture.wav"

Один канал и частота 16 кГц не улучшают исходную запись магически, но упрощают дальнейшую обработку.

Как повысить точность

  • Укажите язык. Это снижает ошибки определения в коротких записях.
  • Добавьте начальную подсказку. Перечислите фамилии, компании и специальные термины.
  • Уберите длинную тишину. Так модель меньше создаёт повторяющиеся фразы.
  • Не повышайте громкость до искажения. Клиппинг хуже тихого, но чистого сигнала.
  • Разделяйте очень длинные файлы. Проще повторно обработать десятиминутный фрагмент, чем всю встречу.

Пример с подсказкой:

whisper "meeting.mp3" --language Russian --model medium --initial_prompt "Встреча команды InnovateNow. Термины: Ollama, Open WebUI, NPU, токеномика."

Реальный тест пяти вариантов одного файла

Чтобы выбрать модель честно, возьмите один фрагмент длительностью 5–10 минут. В нём должны быть имена, числа, тихая речь и хотя бы один участок с фоновым шумом.

ВариантЧто измеритьЧто записать
small на CPUВремя и число смысловых ошибокБазовый результат
medium на CPUПрирост точности к smallОправдано ли ожидание
turbo на GPUСкорость обработкиОшибки в русских именах
medium с подсказкойТермины и фамилииЭффект initial_prompt
нормализованный звукШумные и тихие участкиЭффект подготовки аудио

Не оценивайте качество по тому, насколько текст выглядит гладким. Опаснее всего уверенно записанные неверные числа, отрицания и фамилии. Сверьте минимум десять контрольных фрагментов с исходным аудио.

Как сделать текст удобным для работы

Whisper создаёт расшифровку, а не готовый протокол встречи. После распознавания:

  1. сохраните неизменённый исходный TXT;
  2. исправьте имена, числа и термины;
  3. разбейте длинные абзацы по смыслу;
  4. отдельно составьте решения и задачи;
  5. не удаляйте таймкоды до финальной проверки.

Большую расшифровку можно обработать локальной языковой моделью. Сначала настройте её по инструкции «Как запустить нейросеть на ПК», а затем попросите составить структурированный конспект. Для ноутбука полезно заранее понять, поможет ли NPU в задачах локального ИИ.

Работает ли Whisper полностью офлайн

Да, после установки зависимостей и скачивания модели распознавание может выполняться без интернета. Проверьте это новым файлом после отключения сети. Учтите, что сторонняя графическая оболочка может иметь собственную телеметрию или облачные функции.

Локальная обработка снижает риск передачи файла облачному сервису, но не защищает данные от других программ на компьютере, вредоносных расширений и нешифрованных резервных копий.

Типовые ошибки

ПроблемаПричинаЧто делать
ffmpeg не найденПуть не добавлен в PATHПереоткрыть терминал и проверить установку
CUDA out of memoryМодель не помещается в видеопамятьВыбрать small, medium или запуск на CPU
Повторяются фразыТишина, шум или сложный фрагментОбрезать запись и обработать участок отдельно
Русская речь стала английскойНеверная задача или языкУказать --language Russian и transcribe
Не различаются участникиWhisper не является полноценной диаризациейДобавить отдельный инструмент разделения спикеров

Частые вопросы

Можно ли расшифровать запись бесплатно?

Да. Локальная версия Whisper распространяется открыто, но вы используете ресурсы своего компьютера и самостоятельно устанавливаете зависимости.

Нужна ли видеокарта?

Нет, Whisper работает на CPU. Видеокарта заметно ускоряет обработку крупных моделей, но модель и вычислительный режим должны поддерживаться оборудованием.

Умеет ли Whisper разделять говорящих?

Базовый Whisper создаёт текст и таймкоды, но не выполняет надёжное именованное разделение спикеров. Для этого нужна отдельная диаризация.

Какой формат лучше для субтитров?

SRT поддерживается большинством редакторов и видеоплатформ. VTT удобен для веб-плееров. Для последующей программной обработки сохраните также JSON.

Итог

Для первого запуска достаточно Python, FFmpeg, Whisper и модели small. Не начинайте сразу с large: сравните пять вариантов на одном контрольном файле и выберите конфигурацию, которая экономит время именно на ваших записях. Финальный текст обязательно проверяйте по аудио — особенно числа, имена и отрицания.

Еще записи из этой же рубрики

Что будем искать? Например,Технология

Минуту внимания
Мы используем cookies для корректной работы сайта и понимания, как им пользуются читатели.