Перевод аудио в текст
онлайн — за минуты
Перевод аудио в текст — это автоматическая расшифровка голосовой записи в редактируемый документ. Cosmo Scribe принимает MP3, WAV, M4A, OGG, FLAC и видео, возвращает чистый текст с тайм-кодами и метками спикеров за минуты.
Загрузите MP3, WAV, M4A или другой аудиофайл — получите готовый текст с разделением по спикерам и тайм-кодами. Первая запись в сутки — без установки и без регистрации.
Перетащите аудиофайл сюда
MP3, WAV, M4A, OGG, FLAC, а также видео — MP4, MOV, MKV. В гостевом режиме: одна запись в сутки, до 10 минут и до 50 МБ.
Передаём файл…
Файл не отправляется на сервер на этой странице — он открывается в загрузчике сервиса, где вы подтверждаете расшифровку.
Что такое перевод аудио в текст
Перевод аудио в текст — он же транскрибация или расшифровка — это преобразование записанной речи в письменный документ. На входе аудиофайл: диктофонная запись, интервью, звонок, лекция или голосовое сообщение. На выходе — текст, который можно читать, искать по словам, цитировать и править.
Вручную это долгая работа: расшифровщик слушает запись фрагментами, отматывает назад, набирает текст — на час аудио уходит 4–6 часов. Автоматическое распознавание сокращает то же самое до минут, а человеку остаётся вычитка. Разница особенно заметна на регулярных задачах: еженедельные планёрки, поток входящих звонков, серия интервью.
Хорошая расшифровка — это не просто «набор текста с голоса». Реплики разных участников должны быть разделены, каждая фраза — привязана к моменту в записи, а имена и термины — написаны правильно. Всё это Cosmo Scribe делает сразу, без дополнительных настроек.
Термины, которые встретятся дальше
- Транскрибация
- Перевод звучащей речи в текст. Синонимы — расшифровка, стенограмма, транскрипция.
- Диаризация
- Разделение записи по голосам: кто из участников произнёс каждую реплику.
- Тайм-код
- Отметка времени у фрагмента текста — момент, на котором эта фраза звучит в записи.
Как перевести аудио в текст онлайн
Четыре шага, ничего устанавливать не нужно — всё происходит в браузере.
1. Загрузите аудиофайл
Перетащите MP3, WAV, M4A, OGG или FLAC в окно загрузки — или выберите файл на диске. Можно отправить несколько записей сразу, они обработаются пакетом. Видео тоже принимается: звуковую дорожку сервис извлечёт сам.
2. Выберите язык
По умолчанию стоит русский. Если запись на другом языке — переключите селектор до старта. Это важнее, чем кажется: при неверно указанном языке речь может быть не расшифрована, а переведена.
3. Дождитесь распознавания
10 минут аудио обрабатываются примерно за 1–2 минуты, часовая запись — за 5–8. Прогресс виден на экране, а уведомление придёт, даже если вкладка свёрнута — ждать у монитора не нужно.
4. Получите текст
Расшифровку можно скопировать, скачать в TXT, DOC, SRT или VTT, отправить коллеге публичной ссылкой либо сразу открыть в редакторе и поправить формулировки.
Какое аудио можно перевести в текст
Пять самых частых контейнеров загружаются напрямую, конвертировать ничего не нужно. У каждого — своя страница с деталями и типичными источниками файлов.
MP3 в текст
Самый массовый формат: диктофоны, подкасты, аудиокниги, голосовые WhatsApp на Android. Минута записи весит около 1 МБ, поэтому MP3 загружается быстрее остальных. На распознавание сжатие почти не влияет, если битрейт от 128 кбит/с.
Подробнее про MP3 →WAV в текст
Несжатый звук с профессиональных диктофонов, студийного оборудования и конференц-систем. Минута занимает около 10 МБ — файлы тяжёлые, зато сигнал сохранён без потерь.
Подробнее про WAV →M4A в текст
Формат диктофона iPhone и iPad, приложения «Заметки» и GarageBand. Загружается как есть — перегонять в MP3 перед расшифровкой не нужно.
Подробнее про M4A →OGG в текст
Контейнер голосовых сообщений Telegram и веб-аудио. Голосовое из Telegram можно вообще не сохранять на диск — перешлите его боту, текст придёт ответным сообщением.
Подробнее про OGG →FLAC в текст
Сжатие без потерь: архивные записи, мастеринг, аудиофильские копии. Качество как у WAV при примерно вдвое меньшем размере файла.
Кроме этих пяти принимаются AAC, WMA, WEBM и видеофайлы MP4, MOV, MKV, AVI — из видео сервис достаёт звуковую дорожку сам. Все форматы аудио и видео →
Какие записи можно расшифровать
Формат файла — это половина вопроса. Вторая половина — что именно записано: от этого зависит, как удобнее читать результат.
Интервью
Вопросы и ответы разделяются по голосам, каждая цитата привязана к тайм-коду. Перед публикацией достаточно кликнуть по фразе, чтобы услышать оригинал и убедиться, что цитата точная.
Расшифровка интервью →Лекции
Часовая лекция превращается в конспект, по которому работает поиск. Термины и фамилии можно один раз внести в личный словарь — дальше они будут писаться правильно во всех записях курса.
Расшифровка лекций →Подкасты
Из расшифровки выпуска собираются шоуноты, цитаты для соцсетей и текстовая версия для сайта. Субтитры SRT и VTT выгружаются тем же кликом.
Транскрипция подкаста →Записи разговоров
Телефонные звонки и переговоры читаются как диалог: видно, кто задавал вопросы, кто говорил дольше, где были паузы. По расшифровке удобно сверять договорённости.
Разбор звонков →Голосовые сообщения
Telegram, WhatsApp, Viber, ВКонтакте — у каждого мессенджера свой способ выгрузить голосовое в файл. Инструкции по платформам собраны на отдельной странице.
Голосовые в текст →Диктофонные записи
Записи с телефона, планшета или отдельного диктофона. Если записывать ещё только предстоит — в браузере есть диктофон, файл из него попадает на расшифровку без сохранения на диск.
Диктофон онлайн →Совещания и звонки
Запись встречи из Телемоста, SberJazz, VK Звонков, МТС Линк, Контур.Толка, Zoom или Google Meet загружается как обычный файл. Либо на встречу приходит бот-участник и приносит запись сам.
Бот для встреч →Перевод аудио в текст бесплатно
Попробовать можно без карты и без установки — сначала в гостевом режиме, потом на бесплатном аккаунте.
- Без регистрации
- Одна запись в сутки длительностью до 10 минут и размером до 50 МБ. Текст показывается на экране целиком — его видно весь, без обрезки. Копирование, скачивание файлов и история открываются после регистрации.
- После бесплатной регистрации
- 60 минут аудио в месяц и до 30 записей, файл до 100 МБ и до 30 минут. Расшифровки хранятся в личном кабинете 30 дней, экспорт доступен во всех форматах — TXT, DOC, SRT, VTT.
- Когда объёма перестаёт хватать
- Тарифы начинаются с 490 ₽ в месяц. Если нагрузка неровная, есть разовые пакеты минут без подписки — от 129 ₽ за 60 минут; минуты не сгорают и расходуются после минут тарифа.
Перевод аудио в текст с телефона
Отдельное приложение ставить не нужно — есть два рабочих способа прямо с телефона.
- В мобильном браузере
- Сайт открывается на телефоне так же, как на компьютере: загрузка файла, выбор языка, чтение и правка текста работают с тачскрина. Диктофон iPhone отдаёт M4A, Android — M4A или MP3; оба формата принимаются как есть, конвертировать не нужно.
- Через Telegram-бот
- Перешлите голосовое или аудиофайл боту @cosmoscribe_bot — расшифровка придёт ответным сообщением. Там же по кнопке доступны краткое содержание и перевод, а аккаунт с сайта можно привязать, чтобы записи попадали в общую историю.
- Записать прямо сейчас
- Если запись ещё не сделана, откройте браузерный диктофон: он пишет с микрофона телефона и передаёт файл на расшифровку одним нажатием, не сохраняя его в галерею.
Распознавание нескольких спикеров
Если в записи говорят несколько человек, текст не сливается в сплошной поток.
Реплики автоматически размечаются по голосам: Спикер 1, Спикер 2 и так далее. После обработки спикеров можно переименовать — например, в «Иван» и «Мария», — и новые имена подставятся по всей расшифровке разом, включая экспорт в субтитры.
На диалогах текст показывается репликами, как переписка: видно, кто говорил, сколько и в какой момент. Это главное отличие от обычного «набора текста с голоса» — расшифровку интервью или звонка можно читать, не сверяясь с аудио.
Качество разделения зависит от записи: чем меньше перебиваний, эха и фонового шума, тем чище границы между голосами. Если два участника постоянно говорят одновременно, часть реплик может достаться соседнему спикеру — такие места видно сразу, и они правятся в редакторе.
Разделение по голосам доступно в гостевом режиме, на тарифах Лайт, Профессионал и Бизнес, а также при активном остатке купленных минут. На бесплатном аккаунте расшифровка приходит сплошным текстом.
Тайм-коды и редактирование текста
Расшифровка приходит не «плоским» файлом, а связанной с аудио — по ней можно работать, а не только читать.
- 01 Клик по фразе перематывает плеер
- Каждый сегмент привязан к моменту в записи. Нашли сомнительное место в тексте — кликнули и сразу слушаете оригинал.
- 02 Подсветка по словам
- Во время воспроизведения текущее слово подсвечивается, а клик по конкретному слову перематывает именно на него — удобно снимать точные цитаты.
- 03 Правка прямо на странице
- Текст редактируется без выгрузки в Word. Горячие клавиши под рукой: пробел — пауза, стрелки — перемотка на 5 секунд, Ctrl+S — сохранить, Ctrl+D — скачать.
- 04 Закладки на фрагментах
- Отмечайте важные моменты и добавляйте короткие заметки. Из закладок собирается отдельный файл — выгрузка только нужных цитат, без всей расшифровки.
- 05 Личный словарь замен
- Имена, бренды и термины распознаются по-разному. Задайте «было → стало» один раз — правильное написание подставится во всех будущих расшифровках.
- 06 Субтитры из тех же тайм-кодов
- SRT и VTT собираются из пословных отметок: карточки не рвут фразы посередине, а метки спикеров подставляются автоматически.
Как повысить точность распознавания аудио
Больше всего на результат влияет исходная запись, а не настройки. Несколько вещей заметно поднимают качество.
- Пишите ближе к говорящему
- Метр вместо трёх метров до микрофона даёт больше разницы, чем любые параметры обработки. На совещании лучше поставить телефон в центр стола, чем держать его у себя.
- Уберите фоновую музыку
- Речь на фоне музыки распознаётся хуже всего — модель слышит два конкурирующих сигнала. Ровный шум вроде кондиционера мешает намного меньше.
- Указывайте язык явно
- Режим «Авто» определяет язык по началу записи. Если первая минута — тишина, гудки или музыкальная заставка, определение может ошибиться. Выбранный вручную язык такой ошибки не допускает.
- Заполните словарь замен
- Фамилии, названия компаний и профессиональные термины — самая частая причина «неточной» расшифровки. Один раз внесённая пара «было → стало» решает это навсегда.
- Включите шумоподавление для шумных записей
- Опция подавляет ровный фоновый шум — гул улицы, вентиляцию, шипение дешёвого микрофона. Эхо, музыку и посторонние голоса она не убирает. Доступна на тарифах Лайт и выше.
- Не гонитесь за форматом
- MP3 от 128 кбит/с распознаётся практически так же, как WAV. Формат без потерь не исправит запись, сделанную в шумном помещении с дальнего расстояния.
Чем автоматическая транскрибация отличается от ручной расшифровки
Час записи руками расшифровывается за 4–6 часов. Cosmo Scribe делает это за минуты — а вам остаётся только вычитка.
Частые вопросы
Сколько стоит перевод аудио в текст?
Какие форматы аудио поддерживаются?
Сколько времени занимает обработка?
Распознаются ли голоса разных людей?
В каком формате я получу текст?
Что с конфиденциальностью записей?
Можно ли перевести аудио в текст без компьютера?
Почему в расшифровке неправильно написаны фамилии и термины?
Похожие задачи
Попробуйте прямо сейчас
Загрузите файл — текст будет готов через минуту. Регистрация не нужна.
Перевести аудио в текст