Запись встречи, лекции или интервью уже лежит на компьютере, но загружать её в неизвестный онлайн-сервис не хочется. Whisper позволяет превратить аудио в текст локально: файл обрабатывается на вашем ПК, а после первоначальной установки и загрузки модели интернет не нужен.

Главная сложность не в одной команде, а в выборе подходящего варианта. Оригинальный Whisper понятен и хорошо документирован, faster-whisper обычно экономнее использует ресурсы, а графические оболочки избавляют от терминала. Ниже — рабочая установка на Windows, выбор модели для русского языка, экспорт субтитров и проверка приватности.

Короткий ответ: для первой локальной расшифровки на Windows установите Python, FFmpeg и пакет openai-whisper, затем выполните whisper audio.mp3 --language Russian --model small. На компьютере без мощной видеокарты начните с модели small или base; для регулярной обработки больших записей рассмотрите faster-whisper.

Какой вариант выбрать

Вариант Кому подходит Преимущество Сложность
OpenAI Whisper CLI Первая установка, нужна официальная реализация Простые команды и документация Средняя
faster-whisper Много записей, важны скорость и память Оптимизированный запуск CPU/GPU Средняя
Графическая оболочка Не хочется работать в терминале Выбор файла и модели кнопками Низкая
whisper.cpp Нужен лёгкий автономный инструмент Разные платформы и квантованные модели Выше средней

Что означает «локально»

Локальная расшифровка означает, что вычисления выполняются на вашем процессоре или видеокарте. Однако для установки программ и первого скачивания модели интернет нужен. После того как модель сохранена на диске, тот же файл можно обработать с отключённой сетью.

Не каждая программа с названием Whisper работает локально. Некоторые оболочки отправляют запись в облачный API. Перед обработкой конфиденциального разговора проверьте:

  • какая именно модель используется;
  • где лежит файл модели;
  • требуется ли API-ключ;
  • работает ли новая расшифровка после отключения интернета;
  • нет ли подключённых модулей суммаризации.

Если вам важна полностью автономная работа ИИ, полезна наша отдельная инструкция как запустить нейросеть локально на компьютере.

Требования к компьютеру

Whisper способен работать только на CPU, поэтому дискретная видеокарта не обязательна. Но скорость сильно зависит от модели, длины записи и процессора. NVIDIA с совместимой CUDA ускоряет обработку, а объём видеопамяти ограничивает размер модели.

Для начала ориентируйтесь не на максимальную модель, а на задачу:

Модель Когда выбирать Компромисс
tiny Черновик, слабый компьютер, проверка установки Самая быстрая, больше ошибок
base Чистая речь и быстрые заметки Теряет сложные имена и шумную речь
small Русские лекции, встречи, обычный ПК Хороший старт по качеству и скорости
medium Важнее точность, есть запас времени и памяти Заметно тяжелее
large/turbo Производительная система, сложное аудио Высокие требования; turbo не предназначен для перевода

Для русской речи используйте многоязычную модель без суффикса .en. Англоязычные варианты обучены только для английского.

Установка Whisper на Windows

Понадобятся Python и FFmpeg. В официальном репозитории OpenAI указана совместимость пакета с Python 3.8–3.11; для беспроблемной установки выбирайте поддерживаемую 64-битную версию и не забывайте добавить Python в PATH.

Шаг 1. Проверьте Python

Откройте PowerShell:

python --version
pip --version

Если команды не найдены, установите Python с официального сайта и отметьте пункт Add Python to PATH. После установки откройте новое окно PowerShell.

Шаг 2. Создайте отдельное окружение

Так зависимости Whisper не будут конфликтовать с другими программами:

mkdir C:\whisper-local
cd C:\whisper-local
python -m venv .venv
.\.venv\Scripts\Activate.ps1

Если PowerShell запрещает активацию скрипта, можно открыть обычную командную строку и выполнить:

C:\whisper-local\.venv\Scripts\activate.bat

Шаг 3. Установите FFmpeg

По официальной инструкции Whisper на Windows FFmpeg можно установить через Chocolatey или Scoop. Например, при уже настроенном Chocolatey:

choco install ffmpeg

После установки откройте новое окно терминала и проверьте:

ffmpeg -version

Не устанавливайте пакет с похожим названием через pip вместо системной программы FFmpeg: Whisper должен находить исполняемый файл в PATH.

Шаг 4. Установите Whisper

python -m pip install --upgrade pip
pip install -U openai-whisper

Первая установка может занять время из-за PyTorch и других зависимостей. Если возникает ошибка сборки, сверяйте версию Python с текущими требованиями официального репозитория.

Первая расшифровка аудио в текст

Скопируйте файл, например interview.mp3, в C:\whisper-local и выполните:

whisper interview.mp3 --language Russian --model small

При первом запуске загрузится модель. Затем рядом с исходником появятся файлы результатов. Чтобы явно получить текст и субтитры, используйте:

whisper interview.mp3 --language Russian --model small --output_format all --output_dir result

Обычно полезны:

  • .txt — сплошной текст;
  • .srt — субтитры с временными метками;
  • .vtt — субтитры для веб-плееров;
  • .json — структурированный результат для автоматизации;
  • .tsv — сегменты в табличном виде.

Как выбрать язык и задачу

Язык можно определить автоматически, но для русской записи явный параметр уменьшает риск неверного старта:

--language Russian

По умолчанию Whisper транскрибирует речь на исходном языке. Параметр --task translate переводит поддерживаемую речь на английский, а не на произвольный язык. Модель turbo, согласно документации, не предназначена для задачи перевода; для неё используйте multilingual medium или large.

Как повысить качество расшифровки

Сначала улучшите исходник

Модель не восстановит фразу, которую заглушил шум. По возможности используйте запись без музыки, держите микрофон ближе к говорящим и избегайте перегрузки. Принудительно переводить хороший исходник в низкий битрейт не нужно: FFmpeg сам подготовит аудио для модели.

Укажите контекст

Имена людей, названия компаний и аббревиатуры чаще всего требуют правки. В CLI доступны параметры подсказки, но не превращайте её в длинный словарь: добавьте несколько действительно важных терминов и затем проверьте эффект на одном фрагменте.

Возьмите модель на один уровень больше

Если small регулярно путает слова в чистой записи, попробуйте medium на том же пятиминутном отрезке. Сравнивайте не впечатление, а число смысловых ошибок, имена и пунктуацию. Большая модель не всегда оправдывает многократное увеличение времени.

Практический тест перед обработкой часовой записи

Вырежьте один и тот же пятиминутный фрагмент: в нём должны быть два говорящих, одно имя, число и небольшой шум. Запустите base, small и medium, затем заполните таблицу:

Модель Время Ошибки в именах Смысловые ошибки Итог
base Заполнить Заполнить Заполнить Черновик/не подходит
small Заполнить Заполнить Заполнить Баланс/не подходит
medium Заполнить Заполнить Заполнить Точность/избыточно

Это честнее универсального обещания «час за десять минут»: скорость отличается на разных CPU, GPU и настройках. Вы получите оценку именно для своего компьютера и типа записи.

Установка faster-whisper

faster-whisper — реализация Whisper на CTranslate2. Она поддерживает вычисления INT8 на CPU и может использовать меньше памяти. Отдельный системный FFmpeg ей не нужен: аудио декодирует библиотека PyAV.

В активном виртуальном окружении:

pip install faster-whisper

Создайте файл transcribe.py:

from faster_whisper import WhisperModel

model = WhisperModel("small", device="cpu", compute_type="int8")
segments, info = model.transcribe(
    "interview.mp3",
    language="ru",
    vad_filter=True
)

with open("interview.txt", "w", encoding="utf-8") as file:
    for segment in segments:
        line = f"[{segment.start:.1f}–{segment.end:.1f}] {segment.text.strip()}"
        print(line)
        file.write(line + "\n")

Запустите:

python transcribe.py

Модель загрузится при первом запуске. Параметр vad_filter=True помогает пропускать участки без речи. Для NVIDIA нужны совместимые версии CUDA и cuDNN; требования меняются, поэтому сверяйте их с репозиторием faster-whisper перед установкой GPU-режима.

Можно ли обойтись без командной строки

Да. Существуют локальные оболочки для Windows, которые используют Whisper или faster-whisper. Выбирайте проект с открытым исходным кодом, понятным разработчиком и активными обновлениями. Скачивайте релиз из официального репозитория проекта, а не со случайного каталога программ.

Перед конфиденциальной работой отключите интернет и расшифруйте новый короткий файл. Если приложение требует API-ключ или перестаёт работать без сети после загрузки модели, оно не соответствует полностью локальному сценарию.

Как получить субтитры для видео

Создайте SRT:

whisper lesson.mp4 --language Russian --model small --output_format srt

Откройте результат в редакторе субтитров и проверьте разрывы фраз, имена и временные метки. Whisper создаёт сегменты, но не гарантирует удобное чтение каждой строки. Для публикации сократите слишком длинные строки и не оставляйте автоматический текст без редакторской проверки.

Разделение говорящих: важное ограничение

Обычный Whisper распознаёт речь, но не подписывает надёжно «Спикер 1» и «Спикер 2». Для диаризации используют отдельные инструменты, например WhisperX и модели определения говорящих. Это усложняет установку и может потребовать дополнительные модели или токены доступа.

Для короткого интервью иногда быстрее расставить имена вручную по временным меткам. Для регулярных многочасовых встреч стоит строить отдельный конвейер и тестировать его на пересекающейся речи.

Как проверить, что данные не уходят в облако

  1. Завершите первоначальное скачивание модели.
  2. Отключите Wi‑Fi и Ethernet.
  3. Выберите новый файл, который раньше не обрабатывался.
  4. Запустите расшифровку.
  5. Убедитесь, что результат создан полностью.

Этот тест подтверждает автономную обработку, но не проверяет весь код программы. Для особо чувствительных данных используйте известный открытый проект, отдельную учётную запись Windows и контроль сетевых соединений.

Локальная обработка не защищает от вредоносных расширений и синхронизации папки с облаком. Храните записи на зашифрованном диске и удаляйте временные копии. А если выбираете новый компьютер именно для ИИ-задач, сначала разберитесь, что такое NPU и заменяет ли он видеокарту.

Типовые ошибки

Ошибка Причина Решение
whisper не является командой Окружение не активировано или Scripts нет в PATH Активировать .venv и повторить установку
ffmpeg not found FFmpeg не установлен или не добавлен в PATH Проверить ffmpeg -version в новом терминале
Не хватает памяти Модель слишком большая Выбрать small/base или INT8 в faster-whisper
Русская речь превращается в другой язык Ошибка автоопределения Указать --language Russian
Работает очень медленно Запуск большой модели на CPU Сравнить small, faster-whisper INT8 или GPU
Нет разделения по людям Whisper не выполняет диаризацию сам Добавить отдельный инструмент или разметить вручную

Автоматизация расшифровки

Когда одиночная команда работает стабильно, её можно встроить в папку-наблюдатель или n8n: новый аудиофайл появляется в каталоге, локальная модель создаёт текст, а сценарий сохраняет результат. Начните с локальных тестовых файлов и ограниченной папки. Пошаговая основа есть в материале как установить n8n локально.

Частые вопросы

Работает ли Whisper без интернета?

Да, после установки зависимостей и скачивания модели. Проверьте это на новом файле с отключённой сетью. Некоторые сторонние оболочки могут использовать облако, даже если в названии есть Whisper.

Какая модель Whisper лучше для русского языка?

Для первого теста на обычном компьютере разумно начать со small. Затем сравните её с base и medium на одном пятиминутном фрагменте. Лучший выбор зависит от шума, терминов и оборудования.

Нужна ли видеокарта для расшифровки?

Нет, Whisper работает на процессоре, но медленнее. Совместимая NVIDIA заметно ускоряет большие модели и длинные записи.

Умеет ли Whisper различать говорящих?

Сам по себе — не надёжно. Для подписей спикеров нужна отдельная диаризация, например специальный конвейер на базе WhisperX, либо ручная разметка.

Итог

Для первой локальной расшифровки не гонитесь за самой большой моделью. Установите официальный Whisper, проверьте small на пяти минутах своей записи и только затем увеличивайте модель или переходите на faster-whisper. Так вы получите измеримый баланс скорости и качества, а тест без сети подтвердит, что аудио действительно остаётся на компьютере.

Еще записи из этой же рубрики

Что будем искать? Например,Технология

Минуту внимания
Мы используем cookies для корректной работы сайта и понимания, как им пользуются читатели.