Введение
Выбор движка распознавания речи для русского языка — это всегда компромисс между ценой, качеством и законом. В этой статье мы сравним три популярных решения: облачный Yandex SpeechKit, SaluteSpeech от Сбера и локальный опенсорсный Whisper от OpenAI. Разберем реальные бенчмарки, стоимость часа аудио и подводные камни, включая требования 152-ФЗ.
Точность распознавания: кто лидирует на русском?
Yandex SpeechKit — золотой стандарт для диалогов
На реальных записях телефонных разговоров (шум, обрывы фраз) SpeechKit показывает WER (Word Error Rate) около 7–9%. Это лучший результат среди облачных сервисов РФ. Yandex отлично справляется с именами собственными и сленгом, если подключить пользовательский словарь.
SaluteSpeech — сильный конкурент для потокового аудио
Сбер заявляет WER ~10%, но на практике при чистой речи без акцентов разница с Yandex почти незаметна. SaluteSpeech выигрывает в скорости обработки длинных файлов (более 3 часов) и в стоимости, но заметно хуже справляется с фоновой музыкой и эхом.
Whisper (large-v3) — неожиданный прорыв
Модель OpenAI в тестах на русском показывает WER 11–13%, что близко к SaluteSpeech. Однако главная проблема — отсутствие оптимизации под русскую пунктуацию. Whisper часто ставит запятые хаотично и коверкает числительные («двадцать первый» вместо «21-й»). Для стенограмм сгодится, для аналитики — требует постобработки.
Практический совет: Для звонков в поддержку используйте SpeechKit или SaluteSpeech. Для расшифровки видео с YouTube (где речь медленная) — Whisper, чтобы сэкономить бюджет.
Стоимость и скорость: считаем реальные деньги
Тарифы за час аудио
| Сервис | Цена за 1 час (поток) | Цена за 1 час (файл) | Минимальный чек |
|---|---|---|---|
| Yandex SpeechKit | 0,16 ₽/сек (≈576 ₽) | 0,10 ₽/сек (≈360 ₽) | Нет |
| SaluteSpeech | 0,12 ₽/сек (≈432 ₽) | 0,06 ₽/сек (≈216 ₽) | 300 ₽/мес |
| Whisper (self-hosted) | ~50 ₽ (электричество + GPU) | ~50 ₽ | Стоимость GPU |
Скорость обработки
- Yandex: потоковое распознавание с задержкой 300–500 мс. Файл на 1 час обрабатывается за 3–5 минут.
- SaluteSpeech: задержка потока до 1 секунды. Пакетная обработка файлов — самая быстрая на рынке (час за 2 минуты).
- Whisper: на GPU A100 час аудио обрабатывается за 8–10 минут. На CPU (обычный сервер) — 1.5–2 часа, что убивает весь смысл.
Практический совет: Если у вас объем до 50 часов в месяц — SaluteSpeech дешевле на 30%. Если больше 200 часов — поднимайте Whisper на арендованном GPU, это окупится уже через 2 месяца.
Диаризация: кто правильно разделяет спикеров
Yandex — лидер по разделению голосов
SpeechKit автоматически определяет до 10 спикеров и корректно обрабатывает перебивания. Ошибка в определении границы реплик — редкость (менее 5% на тестах). Поддерживает маскирование персональных данных (номера карт, телефоны) прямо в процессе распознавания.
SaluteSpeech — базовый функционал
Диаризация работает только в тарифах «Про» и «Бизнес». Качество ниже: при наложении голосов (два человека говорят одновременно) сервис часто склеивает фразы в одну реплику. Зато отлично различает женский и мужской голос.
Whisper — диаризация отсутствует
Модель распознает только одного говорящего. Чтобы разделить спикеров, придется использовать дополнительный инструмент (например, pyannote). Это усложняет пайплайн и добавляет 10–15% к стоимости обработки.
Практический совет: Для судебных стенограмм и переговоров берите SpeechKit — точность диаризации критична. Для интервью с одним гостем — SaluteSpeech.
152-ФЗ и хранение данных: легальный аспект
Yandex SpeechKit — сертифицирован для гостайн
Данные шифруются AES-256, серверы находятся в РФ (ЦОД «Яндекс.Облако»). Есть возможность заключить договор с обработкой персональных данных по 152-ФЗ. Подходит для банков и медицинских организаций.
SaluteSpeech — полное соответствие 152-ФЗ
Сбер гарантирует, что аудио не покидает контур Cloud.ru. Есть on-premise версия для установки в контур заказчика — это закрывает вопрос о передаче данных третьим лицам. Но стоимость лицензии on-premise начинается от 1,5 млн ₽/год.
Whisper — зона риска
Если вы используете OpenAI API — данные уходят в США, что прямо нарушает 152-ФЗ. Self-hosted версия позволяет хранить всё локально, но вы сами несете ответственность за соответствие требованиям (нужны журналы доступа, разграничение прав).
Практический совет: Если вы работаете с персональными данными россиян — исключите облачный Whisper. Выбирайте между SpeechKit (проще интеграция) и on-premise SaluteSpeech (полный контроль). Для внутренних технических задач (расшифровка совещаний без ПДн) допустим self-hosted Whisper.
Выводы
Для продакшена на русском языке оптимален Yandex SpeechKit: лучшая точность, диаризация и легальная чистота. Если бюджет ограничен — SaluteSpeech дает 80% качества за 60% цены. Whisper стоит использовать только для черновой расшифровки или в self-hosted среде с GPU, где нет требований к пунктуации и спикерам. Перед покупкой всегда прогоняйте свой тестовый корпус (10–20 минут реальных записей) — разница между бенчмарками и вашим кейсом может достигать 5–7% WER.