COSMOSCRIBE
Бесплатно — первая запись без регистрации

Перевод аудио в текст
онлайн — за минуты

Перевод аудио в текст — это автоматическая расшифровка голосовой записи в редактируемый документ. Cosmo Scribe принимает MP3, WAV, M4A, OGG, FLAC и видео, возвращает чистый текст с тайм-кодами и метками спикеров за минуты.

Загрузите MP3, WAV, M4A или другой аудиофайл — получите готовый текст с разделением по спикерам и тайм-кодами. Первая запись в сутки — без установки и без регистрации.

Перетащите аудиофайл сюда

MP3, WAV, M4A, OGG, FLAC, а также видео — MP4, MOV, MKV. В гостевом режиме: одна запись в сутки, до 10 минут и до 50 МБ.

Передаём файл…

Файл не отправляется на сервер на этой странице — он открывается в загрузчике сервиса, где вы подтверждаете расшифровку.

Что такое перевод аудио в текст

Перевод аудио в текст — он же транскрибация или расшифровка — это преобразование записанной речи в письменный документ. На входе аудиофайл: диктофонная запись, интервью, звонок, лекция или голосовое сообщение. На выходе — текст, который можно читать, искать по словам, цитировать и править.

Вручную это долгая работа: расшифровщик слушает запись фрагментами, отматывает назад, набирает текст — на час аудио уходит 4–6 часов. Автоматическое распознавание сокращает то же самое до минут, а человеку остаётся вычитка. Разница особенно заметна на регулярных задачах: еженедельные планёрки, поток входящих звонков, серия интервью.

Хорошая расшифровка — это не просто «набор текста с голоса». Реплики разных участников должны быть разделены, каждая фраза — привязана к моменту в записи, а имена и термины — написаны правильно. Всё это Cosmo Scribe делает сразу, без дополнительных настроек.

Термины, которые встретятся дальше

Транскрибация
Перевод звучащей речи в текст. Синонимы — расшифровка, стенограмма, транскрипция.
Диаризация
Разделение записи по голосам: кто из участников произнёс каждую реплику.
Тайм-код
Отметка времени у фрагмента текста — момент, на котором эта фраза звучит в записи.

Как перевести аудио в текст онлайн

Четыре шага, ничего устанавливать не нужно — всё происходит в браузере.

1. Загрузите аудиофайл

Перетащите MP3, WAV, M4A, OGG или FLAC в окно загрузки — или выберите файл на диске. Можно отправить несколько записей сразу, они обработаются пакетом. Видео тоже принимается: звуковую дорожку сервис извлечёт сам.

2. Выберите язык

По умолчанию стоит русский. Если запись на другом языке — переключите селектор до старта. Это важнее, чем кажется: при неверно указанном языке речь может быть не расшифрована, а переведена.

3. Дождитесь распознавания

10 минут аудио обрабатываются примерно за 1–2 минуты, часовая запись — за 5–8. Прогресс виден на экране, а уведомление придёт, даже если вкладка свёрнута — ждать у монитора не нужно.

4. Получите текст

Расшифровку можно скопировать, скачать в TXT, DOC, SRT или VTT, отправить коллеге публичной ссылкой либо сразу открыть в редакторе и поправить формулировки.

Какое аудио можно перевести в текст

Пять самых частых контейнеров загружаются напрямую, конвертировать ничего не нужно. У каждого — своя страница с деталями и типичными источниками файлов.

MP3 в текст

Самый массовый формат: диктофоны, подкасты, аудиокниги, голосовые WhatsApp на Android. Минута записи весит около 1 МБ, поэтому MP3 загружается быстрее остальных. На распознавание сжатие почти не влияет, если битрейт от 128 кбит/с.

Подробнее про MP3 →

WAV в текст

Несжатый звук с профессиональных диктофонов, студийного оборудования и конференц-систем. Минута занимает около 10 МБ — файлы тяжёлые, зато сигнал сохранён без потерь.

Подробнее про WAV →

M4A в текст

Формат диктофона iPhone и iPad, приложения «Заметки» и GarageBand. Загружается как есть — перегонять в MP3 перед расшифровкой не нужно.

Подробнее про M4A →

OGG в текст

Контейнер голосовых сообщений Telegram и веб-аудио. Голосовое из Telegram можно вообще не сохранять на диск — перешлите его боту, текст придёт ответным сообщением.

Подробнее про OGG →

FLAC в текст

Сжатие без потерь: архивные записи, мастеринг, аудиофильские копии. Качество как у WAV при примерно вдвое меньшем размере файла.

Кроме этих пяти принимаются AAC, WMA, WEBM и видеофайлы MP4, MOV, MKV, AVI — из видео сервис достаёт звуковую дорожку сам. Все форматы аудио и видео →

Какие записи можно расшифровать

Формат файла — это половина вопроса. Вторая половина — что именно записано: от этого зависит, как удобнее читать результат.

Интервью

Вопросы и ответы разделяются по голосам, каждая цитата привязана к тайм-коду. Перед публикацией достаточно кликнуть по фразе, чтобы услышать оригинал и убедиться, что цитата точная.

Расшифровка интервью →

Лекции

Часовая лекция превращается в конспект, по которому работает поиск. Термины и фамилии можно один раз внести в личный словарь — дальше они будут писаться правильно во всех записях курса.

Расшифровка лекций →

Подкасты

Из расшифровки выпуска собираются шоуноты, цитаты для соцсетей и текстовая версия для сайта. Субтитры SRT и VTT выгружаются тем же кликом.

Транскрипция подкаста →

Записи разговоров

Телефонные звонки и переговоры читаются как диалог: видно, кто задавал вопросы, кто говорил дольше, где были паузы. По расшифровке удобно сверять договорённости.

Разбор звонков →

Голосовые сообщения

Telegram, WhatsApp, Viber, ВКонтакте — у каждого мессенджера свой способ выгрузить голосовое в файл. Инструкции по платформам собраны на отдельной странице.

Голосовые в текст →

Диктофонные записи

Записи с телефона, планшета или отдельного диктофона. Если записывать ещё только предстоит — в браузере есть диктофон, файл из него попадает на расшифровку без сохранения на диск.

Диктофон онлайн →

Совещания и звонки

Запись встречи из Телемоста, SberJazz, VK Звонков, МТС Линк, Контур.Толка, Zoom или Google Meet загружается как обычный файл. Либо на встречу приходит бот-участник и приносит запись сам.

Бот для встреч →

Перевод аудио в текст бесплатно

Попробовать можно без карты и без установки — сначала в гостевом режиме, потом на бесплатном аккаунте.

Без регистрации
Одна запись в сутки длительностью до 10 минут и размером до 50 МБ. Текст показывается на экране целиком — его видно весь, без обрезки. Копирование, скачивание файлов и история открываются после регистрации.
После бесплатной регистрации
60 минут аудио в месяц и до 30 записей, файл до 100 МБ и до 30 минут. Расшифровки хранятся в личном кабинете 30 дней, экспорт доступен во всех форматах — TXT, DOC, SRT, VTT.
Когда объёма перестаёт хватать
Тарифы начинаются с 490 ₽ в месяц. Если нагрузка неровная, есть разовые пакеты минут без подписки — от 129 ₽ за 60 минут; минуты не сгорают и расходуются после минут тарифа.

Тарифы и пакеты минут →

Перевод аудио в текст с телефона

Отдельное приложение ставить не нужно — есть два рабочих способа прямо с телефона.

В мобильном браузере
Сайт открывается на телефоне так же, как на компьютере: загрузка файла, выбор языка, чтение и правка текста работают с тачскрина. Диктофон iPhone отдаёт M4A, Android — M4A или MP3; оба формата принимаются как есть, конвертировать не нужно.
Через Telegram-бот
Перешлите голосовое или аудиофайл боту @cosmoscribe_bot — расшифровка придёт ответным сообщением. Там же по кнопке доступны краткое содержание и перевод, а аккаунт с сайта можно привязать, чтобы записи попадали в общую историю.
Записать прямо сейчас
Если запись ещё не сделана, откройте браузерный диктофон: он пишет с микрофона телефона и передаёт файл на расшифровку одним нажатием, не сохраняя его в галерею.

Подробнее про Telegram-бот →

Распознавание нескольких спикеров

Если в записи говорят несколько человек, текст не сливается в сплошной поток.

Реплики автоматически размечаются по голосам: Спикер 1, Спикер 2 и так далее. После обработки спикеров можно переименовать — например, в «Иван» и «Мария», — и новые имена подставятся по всей расшифровке разом, включая экспорт в субтитры.

На диалогах текст показывается репликами, как переписка: видно, кто говорил, сколько и в какой момент. Это главное отличие от обычного «набора текста с голоса» — расшифровку интервью или звонка можно читать, не сверяясь с аудио.

Качество разделения зависит от записи: чем меньше перебиваний, эха и фонового шума, тем чище границы между голосами. Если два участника постоянно говорят одновременно, часть реплик может достаться соседнему спикеру — такие места видно сразу, и они правятся в редакторе.

Разделение по голосам доступно в гостевом режиме, на тарифах Лайт, Профессионал и Бизнес, а также при активном остатке купленных минут. На бесплатном аккаунте расшифровка приходит сплошным текстом.

Тайм-коды и редактирование текста

Расшифровка приходит не «плоским» файлом, а связанной с аудио — по ней можно работать, а не только читать.

01 Клик по фразе перематывает плеер
Каждый сегмент привязан к моменту в записи. Нашли сомнительное место в тексте — кликнули и сразу слушаете оригинал.
02 Подсветка по словам
Во время воспроизведения текущее слово подсвечивается, а клик по конкретному слову перематывает именно на него — удобно снимать точные цитаты.
03 Правка прямо на странице
Текст редактируется без выгрузки в Word. Горячие клавиши под рукой: пробел — пауза, стрелки — перемотка на 5 секунд, Ctrl+S — сохранить, Ctrl+D — скачать.
04 Закладки на фрагментах
Отмечайте важные моменты и добавляйте короткие заметки. Из закладок собирается отдельный файл — выгрузка только нужных цитат, без всей расшифровки.
05 Личный словарь замен
Имена, бренды и термины распознаются по-разному. Задайте «было → стало» один раз — правильное написание подставится во всех будущих расшифровках.
06 Субтитры из тех же тайм-кодов
SRT и VTT собираются из пословных отметок: карточки не рвут фразы посередине, а метки спикеров подставляются автоматически.

Как повысить точность распознавания аудио

Больше всего на результат влияет исходная запись, а не настройки. Несколько вещей заметно поднимают качество.

Пишите ближе к говорящему
Метр вместо трёх метров до микрофона даёт больше разницы, чем любые параметры обработки. На совещании лучше поставить телефон в центр стола, чем держать его у себя.
Уберите фоновую музыку
Речь на фоне музыки распознаётся хуже всего — модель слышит два конкурирующих сигнала. Ровный шум вроде кондиционера мешает намного меньше.
Указывайте язык явно
Режим «Авто» определяет язык по началу записи. Если первая минута — тишина, гудки или музыкальная заставка, определение может ошибиться. Выбранный вручную язык такой ошибки не допускает.
Заполните словарь замен
Фамилии, названия компаний и профессиональные термины — самая частая причина «неточной» расшифровки. Один раз внесённая пара «было → стало» решает это навсегда.
Включите шумоподавление для шумных записей
Опция подавляет ровный фоновый шум — гул улицы, вентиляцию, шипение дешёвого микрофона. Эхо, музыку и посторонние голоса она не убирает. Доступна на тарифах Лайт и выше.
Не гонитесь за форматом
MP3 от 128 кбит/с распознаётся практически так же, как WAV. Формат без потерь не исправит запись, сделанную в шумном помещении с дальнего расстояния.

Чем автоматическая транскрибация отличается от ручной расшифровки

Час записи руками расшифровывается за 4–6 часов. Cosmo Scribe делает это за минуты — а вам остаётся только вычитка.

Параметр
Вручную
Cosmo Scribe
Время на 1 час аудио
4–6 часов
5–8 минут
Стоимость
От 1500 ₽ за час
Бесплатно — 1 запись в сутки
Спикеры
Размечать вручную
Автоматически
Тайм-коды
Расставлять руками
На каждом сегменте
Субтитры (SRT/VTT)
Отдельно конвертировать
Готово в один клик
Поправки терминов
Каждый раз заново
Один раз в словаре
Что остаётся человеку
Всё
Вычитка и правка формулировок

Частые вопросы

Сколько стоит перевод аудио в текст?
Гостям — бесплатно: одна запись в сутки длительностью до 10 минут и размером до 50 МБ, без карты и без регистрации. После бесплатной регистрации доступны 60 минут аудио в месяц, скачивание во всех форматах и хранение истории. Платные тарифы начинаются с 490 ₽ в месяц, есть и разовые пакеты минут без подписки.
Какие форматы аудио поддерживаются?
MP3, WAV, OGG, M4A, FLAC, AAC, WMA, WEBM, а также видеофайлы MP4, MOV, MKV, AVI — звуковую дорожку из видео сервис извлечёт сам. Размер одного файла для гостей — до 50 МБ, на тарифах больше.
Сколько времени занимает обработка?
От 30 секунд до нескольких минут — зависит от длительности записи. 10-минутное интервью в среднем обрабатывается за 1–2 минуты, часовая запись — за 5–8 минут.
Распознаются ли голоса разных людей?
Да, если запись обрабатывается в гостевом режиме, на тарифе Лайт и выше или при активном остатке купленных минут: текст делится по спикерам, а после обработки их можно переименовать в «Иван», «Мария» и любые другие имена. На бесплатном аккаунте расшифровка приходит сплошным текстом.
В каком формате я получу текст?
Готовый текст можно скопировать в буфер, скачать в TXT, DOC (Word), SRT или VTT (для субтитров). Также доступен экспорт только отмеченных закладками фрагментов с суффиксом -bookmarks в имени файла.
Что с конфиденциальностью записей?
Гостевые файлы обрабатываются и не сохраняются — после получения текста аудио удаляется. Зарегистрированным пользователям записи хранятся в личном кабинете и доступны только им.
Можно ли перевести аудио в текст без компьютера?
Да — в Telegram: отправьте голосовое или аудиофайл боту @cosmoscribe_bot, и текст придёт ответным сообщением. Сайт удобнее для длинных записей, пакетной загрузки и правки текста в редакторе.
Почему в расшифровке неправильно написаны фамилии и термины?
Редкие имена собственные — самая частая причина неточностей: модель подбирает похожее по звучанию слово. Внесите пару «было → стало» в личный словарь замен, и правильное написание подставится во всех будущих расшифровках автоматически.

Похожие задачи

Попробуйте прямо сейчас

Загрузите файл — текст будет готов через минуту. Регистрация не нужна.

Перевести аудио в текст