Распознавание речи: SpeechKit, SaluteSpeech и Whisper | DarkPlay

01.06.2026

Введение

Выбор движка распознавания речи для русского языка — это всегда компромисс между ценой, качеством и законом. В этой статье мы сравним три популярных решения: облачный Yandex SpeechKit, SaluteSpeech от Сбера и локальный опенсорсный Whisper от OpenAI. Разберем реальные бенчмарки, стоимость часа аудио и подводные камни, включая требования 152-ФЗ.

Точность распознавания: кто лидирует на русском?

Yandex SpeechKit — золотой стандарт для диалогов

На реальных записях телефонных разговоров (шум, обрывы фраз) SpeechKit показывает WER (Word Error Rate) около 7–9%. Это лучший результат среди облачных сервисов РФ. Yandex отлично справляется с именами собственными и сленгом, если подключить пользовательский словарь.

SaluteSpeech — сильный конкурент для потокового аудио

Сбер заявляет WER ~10%, но на практике при чистой речи без акцентов разница с Yandex почти незаметна. SaluteSpeech выигрывает в скорости обработки длинных файлов (более 3 часов) и в стоимости, но заметно хуже справляется с фоновой музыкой и эхом.

Whisper (large-v3) — неожиданный прорыв

Модель OpenAI в тестах на русском показывает WER 11–13%, что близко к SaluteSpeech. Однако главная проблема — отсутствие оптимизации под русскую пунктуацию. Whisper часто ставит запятые хаотично и коверкает числительные («двадцать первый» вместо «21-й»). Для стенограмм сгодится, для аналитики — требует постобработки.

Практический совет: Для звонков в поддержку используйте SpeechKit или SaluteSpeech. Для расшифровки видео с YouTube (где речь медленная) — Whisper, чтобы сэкономить бюджет.

Стоимость и скорость: считаем реальные деньги

Тарифы за час аудио

Сервис Цена за 1 час (поток) Цена за 1 час (файл) Минимальный чек
Yandex SpeechKit 0,16 ₽/сек (≈576 ₽) 0,10 ₽/сек (≈360 ₽) Нет
SaluteSpeech 0,12 ₽/сек (≈432 ₽) 0,06 ₽/сек (≈216 ₽) 300 ₽/мес
Whisper (self-hosted) ~50 ₽ (электричество + GPU) ~50 ₽ Стоимость GPU

Скорость обработки

  • Yandex: потоковое распознавание с задержкой 300–500 мс. Файл на 1 час обрабатывается за 3–5 минут.
  • SaluteSpeech: задержка потока до 1 секунды. Пакетная обработка файлов — самая быстрая на рынке (час за 2 минуты).
  • Whisper: на GPU A100 час аудио обрабатывается за 8–10 минут. На CPU (обычный сервер) — 1.5–2 часа, что убивает весь смысл.

Практический совет: Если у вас объем до 50 часов в месяц — SaluteSpeech дешевле на 30%. Если больше 200 часов — поднимайте Whisper на арендованном GPU, это окупится уже через 2 месяца.

Диаризация: кто правильно разделяет спикеров

Yandex — лидер по разделению голосов

SpeechKit автоматически определяет до 10 спикеров и корректно обрабатывает перебивания. Ошибка в определении границы реплик — редкость (менее 5% на тестах). Поддерживает маскирование персональных данных (номера карт, телефоны) прямо в процессе распознавания.

SaluteSpeech — базовый функционал

Диаризация работает только в тарифах «Про» и «Бизнес». Качество ниже: при наложении голосов (два человека говорят одновременно) сервис часто склеивает фразы в одну реплику. Зато отлично различает женский и мужской голос.

Whisper — диаризация отсутствует

Модель распознает только одного говорящего. Чтобы разделить спикеров, придется использовать дополнительный инструмент (например, pyannote). Это усложняет пайплайн и добавляет 10–15% к стоимости обработки.

Практический совет: Для судебных стенограмм и переговоров берите SpeechKit — точность диаризации критична. Для интервью с одним гостем — SaluteSpeech.

152-ФЗ и хранение данных: легальный аспект

Yandex SpeechKit — сертифицирован для гостайн

Данные шифруются AES-256, серверы находятся в РФ (ЦОД «Яндекс.Облако»). Есть возможность заключить договор с обработкой персональных данных по 152-ФЗ. Подходит для банков и медицинских организаций.

SaluteSpeech — полное соответствие 152-ФЗ

Сбер гарантирует, что аудио не покидает контур Cloud.ru. Есть on-premise версия для установки в контур заказчика — это закрывает вопрос о передаче данных третьим лицам. Но стоимость лицензии on-premise начинается от 1,5 млн ₽/год.

Whisper — зона риска

Если вы используете OpenAI API — данные уходят в США, что прямо нарушает 152-ФЗ. Self-hosted версия позволяет хранить всё локально, но вы сами несете ответственность за соответствие требованиям (нужны журналы доступа, разграничение прав).

Практический совет: Если вы работаете с персональными данными россиян — исключите облачный Whisper. Выбирайте между SpeechKit (проще интеграция) и on-premise SaluteSpeech (полный контроль). Для внутренних технических задач (расшифровка совещаний без ПДн) допустим self-hosted Whisper.

Выводы

Для продакшена на русском языке оптимален Yandex SpeechKit: лучшая точность, диаризация и легальная чистота. Если бюджет ограничен — SaluteSpeech дает 80% качества за 60% цены. Whisper стоит использовать только для черновой расшифровки или в self-hosted среде с GPU, где нет требований к пунктуации и спикерам. Перед покупкой всегда прогоняйте свой тестовый корпус (10–20 минут реальных записей) — разница между бенчмарками и вашим кейсом может достигать 5–7% WER.

Другие статьи