Аудио в текст
с точностью до слова
30 минут бесплатно каждый месяц, без карты. Регистрация за 10 секунд — или начните без неё прямо сейчас.
Пример: интервью. Так же — лекции, подкасты, встречи, голосовые.
"Мы планируем запустить продукт в следующем квартале."
Сложный звук? Не проблема.
Шум улицы, эхо или несколько голосов — не помеха. Перед распознаванием мы используем очистку звука (в т.ч. технологию разделения дорожек), чтобы голос был разборчивее.
-
Быстрее реального времени
Часовое интервью обрабатывается за минуты. Ускорение доступно на всех тарифах.
-
Умная пунктуация
Запятые, точки и вопросительные знаки по контексту и интонации.
-
Любые форматы
MP3, M4A, WAV, OGG, AAC, FLAC, MP4, MOV, WEBM и другие.
MP3 в текст M4A в текст WAV в текст AAC в текст Аудио в Word
Расшифруйте первое аудио бесплатно
30 минут в месяц, без карты · Wonder Large-v3 · точность до 99%
Для кого
Юристы
Судебные заседания, допросы, протоколы. Точность до слова.
Бизнес
Совещания, звонки, протоколы встреч. AI-саммари с задачами.
Психологи
Терапевтические сессии и супервизии. Подробнее
Подкастеры
Текстовые версии выпусков для блога и SEO.
Образование
Лекции, семинары, конспекты и субтитры к урокам.
Редактор и экспорт
Получили текст — дальше начинается удобная работа: правки, диалоги, саммари и файлы на выходе.
- Диалоги по спикерам (при включенной диаризации) — каждая реплика с новой строки.
- Словарь для имен/терминов — меньше ошибок на специфике.
- Экспорт: TXT/Word + субтитры (SRT/VTT) при работе с видео.
- Пересборка саммари после правок — протокол встречи или конспект.
Так выглядит результат: диалог по спикерам, тайм-коды, AI-саммари и экспорт в один клик
Готовы загрузить первый файл?
30 минут бесплатно, без карты. Аккуратный текст, диалоги по спикерам и экспорт в Word/SRT за несколько минут.
Связанные продукты
Часто используют вместе
Как получить максимально точный текст?
- Используйте словарь (Настройки → Словарь): добавьте имена, термины, аббревиатуры, фирменные названия. +3–7% точности на специфике — особенно для юр./мед./IT/финансов
- Включите очистку звука «Авто» или «Всегда» — снимает шум, эхо, нормализует громкость. На шумных записях даёт +5–10%
- Укажите язык вручную если в записи переключаются языки — auto-detect может ошибиться на коротких отрезках
- Запишите с расстояния <30 см от микрофона если возможно
- Избегайте одновременной речи — каждый говорит по очереди
- Для встреч в Zoom/Meet — включите запись отдельных дорожек участников (multi-channel), мы их используем для лучшей диаризации
Почему тихая речь распознаётся хуже?
Что мы делаем автоматически:
- Нормализация громкости (нормализация громкости) — приводит запись к стандартному уровню вещания, тихие участки усиливаются
- Сегментированный loudnorm — для длинных файлов с переменной громкостью каждый 60-сек кусок нормализуется отдельно
- AI-шумоподавление (AI source separation) для совсем сложных записей — извлекает речь из микса с музыкой/шумом нейросетью
- Перед загрузкой — усилить в Audacity (Эффект → Усиление → +6–12 дБ)
- Записывать ближе к источнику (петличный микрофон, recorder в кармане громко-говорящего)
- Для созвонов — попросить участников включить «Подавление эхо» в Zoom/Meet
Можно ли распознать несколько спикеров?
Что получите:
- Текст разбит на реплики с подписью «Спикер 1», «Спикер 2», …
- Автоматическое распознавание имён из самопредставлений или обращений
- Переименование одной кнопкой в редакторе — изменения везде применятся
- Multi-channel: для Zoom/Meet/Telemost с отдельными дорожками — имена берутся из метаданных встречи
- Топонимы («Москва», «Уфа») не станут именами спикеров — фильтр по 217-словарю
- Один реальный голос не разобьётся на двух — cosine similarity объединяет похожие эмбеддинги
- Перекрытия (когда говорят одновременно) обрабатываются frame-level overlap mask
Сколько длится обработка?
Ориентиры (русский, движок Wonder Speech, RTF 0.06–0.08):
- 15 мин → ~1–2 мин
- 1 час → ~4–7 мин
- 2 часа → ~10–15 мин
- 3–4 часа → 15–30 мин
Что влияет на время:
- Очередь GPU (выше нагрузка = дольше ожидание pickup'а)
- Выбранные функции (диаризация добавляет 30–60с, AI-саммари 10–30с)
- Качество записи (для шумных запускается demucs — +1–2 мин)
Какие форматы поддерживаются?
Аудио форматы:
- MP3, WAV, M4A, OGG, AAC, FLAC, WMA, AMR, OPUS
- Voice messages из WhatsApp/Telegram/Discord — работают «как есть»
- MP4, MOV, AVI, MKV, WEBM, FLV, M4V, MPEG, 3GP
- Аудио-дорожка извлекается автоматически — видео можно не конвертировать
- YouTube, VK Видео, RuTube, Дзен Видео — вставьте URL, аудио скачается автоматически
- Zoom, Google Meet, MS Teams, Telemost — recording через bot или upload вручную
- Я.Диск, Google Drive, Dropbox, Mail.ru Cloud — публичные ссылки на файлы
Не нашли ответ?
Напишите в поддержку или откройте подробную справку по всем функциям.