Часовая запись встречи часто превращается в два часа ручной расшифровки. Whisper позволяет сделать черновой текст, субтитры и таймкоды локально: аудиофайл остаётся на компьютере, а после загрузки модели интернет для распознавания не нужен.
Но качество зависит не только от размера модели. Плохой звук, несколько говорящих одновременно, неверно выбранный язык и профессиональные термины способны испортить даже результат большой модели. Поэтому ниже есть не только команды установки, но и схема проверки готовой расшифровки.
Короткий ответ: для обычной русской речи начните с модели small или medium. Для быстрого черновика попробуйте turbo. Сохраняйте одновременно TXT и SRT: обычный текст удобен для редактирования, а субтитры позволяют быстро найти ошибку в исходной записи.
Какой способ выбрать
| Задача | Подход | Особенности |
|---|---|---|
| Разовая короткая запись | Whisper из командной строки | Минимум настроек |
| Многочасовые записи | Faster-Whisper или GUI на его основе | Выше скорость, больше параметров |
| Субтитры для видео | Вывод SRT или VTT | Сохраняются таймкоды |
| Конфиденциальное интервью | Локальный запуск без облачного API | Файл не требуется загружать на сайт |
| Разделение по спикерам | Whisper плюс отдельная диаризация | Базовый Whisper сам не подписывает участников надёжно |
Что такое Whisper
Whisper — модель распознавания речи, обученная работать с разными языками, шумом и форматами аудио. Она умеет расшифровывать речь на исходном языке, определять язык и в отдельных режимах переводить запись на английский.
Программа обрабатывает файл фрагментами и собирает результат в текст с временными отметками. Работа происходит на CPU или поддерживаемой видеокарте. Чем крупнее модель, тем обычно выше требования к памяти и дольше обработка.
Команды установки и список режимов опубликованы в официальном репозитории Whisper.
Какая модель подходит для русского языка
| Модель | Когда использовать | Компромисс |
|---|---|---|
| tiny / base | Быстрый тест и слабый компьютер | Больше ошибок в именах и сложной речи |
| small | Лекции, заметки, понятная речь | Хороший старт для CPU |
| medium | Интервью и материалы, где важна точность | Требует больше времени и памяти |
| large | Сложный звук и максимальное качество | Высокие требования к системе |
| turbo | Быстрая транскрибация | Оптимизирован для скорости; перевод имеет ограничения |
Для русского языка выбирайте многоязычную модель без суффикса .en. Англоязычные варианты предназначены только для английской речи.
Установка Whisper на Windows
Понадобятся Python и FFmpeg. Чтобы зависимости одной программы не смешивались с другими проектами, создадим отдельное виртуальное окружение.
Шаг 1. Проверьте Python
python --version
Если команда не найдена, установите актуальную совместимую версию Python и включите добавление в PATH. Затем заново откройте PowerShell.
Шаг 2. Установите FFmpeg
При использовании Chocolatey:
choco install ffmpeg
Либо установите FFmpeg через Scoop. После установки проверьте:
ffmpeg -version
Шаг 3. Создайте окружение
mkdir whisper-local
cd whisper-local
python -m venv .venv
.\.venv\Scripts\Activate.ps1
python -m pip install --upgrade pip
Если PowerShell запрещает активацию скрипта, можно запустить команды через обычную командную строку или изменить политику только для текущего пользователя, предварительно понимая последствия настройки.
Шаг 4. Установите Whisper
pip install -U openai-whisper
Первый запуск выбранной модели скачает её файлы. Для последующей локальной работы они должны оставаться в кэше.
Первая расшифровка аудио
Поместите файл в папку проекта и выполните:
whisper "interview.mp3" --language Russian --model small --output_format txt
Рядом появится текстовый файл. Чтобы получить субтитры:
whisper "interview.mp3" --language Russian --model small --output_format srt
Whisper также поддерживает VTT, JSON и набор всех форматов:
whisper "interview.mp3" --language Russian --model medium --output_format all --output_dir result
Как перевести видео в текст
Отдельно извлекать звук обычно не требуется: FFmpeg прочитает распространённый видеоформат, а Whisper обработает звуковую дорожку.
whisper "lecture.mp4" --language Russian --model small --output_format srt
Если в видео несколько дорожек или повреждён звук, сначала создайте нормализованный WAV:
ffmpeg -i "lecture.mp4" -ac 1 -ar 16000 "lecture.wav"
Один канал и частота 16 кГц не улучшают исходную запись магически, но упрощают дальнейшую обработку.
Как повысить точность
- Укажите язык. Это снижает ошибки определения в коротких записях.
- Добавьте начальную подсказку. Перечислите фамилии, компании и специальные термины.
- Уберите длинную тишину. Так модель меньше создаёт повторяющиеся фразы.
- Не повышайте громкость до искажения. Клиппинг хуже тихого, но чистого сигнала.
- Разделяйте очень длинные файлы. Проще повторно обработать десятиминутный фрагмент, чем всю встречу.
Пример с подсказкой:
whisper "meeting.mp3" --language Russian --model medium --initial_prompt "Встреча команды InnovateNow. Термины: Ollama, Open WebUI, NPU, токеномика."
Реальный тест пяти вариантов одного файла
Чтобы выбрать модель честно, возьмите один фрагмент длительностью 5–10 минут. В нём должны быть имена, числа, тихая речь и хотя бы один участок с фоновым шумом.
| Вариант | Что измерить | Что записать |
|---|---|---|
| small на CPU | Время и число смысловых ошибок | Базовый результат |
| medium на CPU | Прирост точности к small | Оправдано ли ожидание |
| turbo на GPU | Скорость обработки | Ошибки в русских именах |
| medium с подсказкой | Термины и фамилии | Эффект initial_prompt |
| нормализованный звук | Шумные и тихие участки | Эффект подготовки аудио |
Не оценивайте качество по тому, насколько текст выглядит гладким. Опаснее всего уверенно записанные неверные числа, отрицания и фамилии. Сверьте минимум десять контрольных фрагментов с исходным аудио.
Как сделать текст удобным для работы
Whisper создаёт расшифровку, а не готовый протокол встречи. После распознавания:
- сохраните неизменённый исходный TXT;
- исправьте имена, числа и термины;
- разбейте длинные абзацы по смыслу;
- отдельно составьте решения и задачи;
- не удаляйте таймкоды до финальной проверки.
Большую расшифровку можно обработать локальной языковой моделью. Сначала настройте её по инструкции «Как запустить нейросеть на ПК», а затем попросите составить структурированный конспект. Для ноутбука полезно заранее понять, поможет ли NPU в задачах локального ИИ.
Работает ли Whisper полностью офлайн
Да, после установки зависимостей и скачивания модели распознавание может выполняться без интернета. Проверьте это новым файлом после отключения сети. Учтите, что сторонняя графическая оболочка может иметь собственную телеметрию или облачные функции.
Локальная обработка снижает риск передачи файла облачному сервису, но не защищает данные от других программ на компьютере, вредоносных расширений и нешифрованных резервных копий.
Типовые ошибки
| Проблема | Причина | Что делать |
|---|---|---|
| ffmpeg не найден | Путь не добавлен в PATH | Переоткрыть терминал и проверить установку |
| CUDA out of memory | Модель не помещается в видеопамять | Выбрать small, medium или запуск на CPU |
| Повторяются фразы | Тишина, шум или сложный фрагмент | Обрезать запись и обработать участок отдельно |
| Русская речь стала английской | Неверная задача или язык | Указать --language Russian и transcribe |
| Не различаются участники | Whisper не является полноценной диаризацией | Добавить отдельный инструмент разделения спикеров |
Частые вопросы
Да. Локальная версия Whisper распространяется открыто, но вы используете ресурсы своего компьютера и самостоятельно устанавливаете зависимости.
Нет, Whisper работает на CPU. Видеокарта заметно ускоряет обработку крупных моделей, но модель и вычислительный режим должны поддерживаться оборудованием.
Базовый Whisper создаёт текст и таймкоды, но не выполняет надёжное именованное разделение спикеров. Для этого нужна отдельная диаризация.
SRT поддерживается большинством редакторов и видеоплатформ. VTT удобен для веб-плееров. Для последующей программной обработки сохраните также JSON.
Итог
Для первого запуска достаточно Python, FFmpeg, Whisper и модели small. Не начинайте сразу с large: сравните пять вариантов на одном контрольном файле и выберите конфигурацию, которая экономит время именно на ваших записях. Финальный текст обязательно проверяйте по аудио — особенно числа, имена и отрицания.







