Знакомая ситуация: запись чистая, голоса разборчивые, а в расшифровке нет последней фразы, потерялась тихая реплика коллеги с дальнего конца стола и превратился в кашу момент, где двое заговорили одновременно. Хочется списать на «плохой сервис», но у этих потерь общая механика — и понимание её помогает получать заметно более полный текст.
Кто решает, что в записи — речь
Перед тем как модель распознавания начнёт превращать звук в слова, отдельный алгоритм — детектор речевой активности, VAD — размечает запись: вот здесь речь, здесь тишина, здесь шум. В распознавание уходят только «речевые» отрезки. Это разумная экономия: без детектора модель пыталась бы расшифровать гул кондиционера и выдумывала бы на нём несуществующие фразы.
Но у экономии есть цена. Всё, что детектор посчитал не-речью, модель даже не увидит. И главные жертвы предсказуемы.
Четыре типичные потери
1. Затихающие концы фраз
Люди естественно понижают громкость к концу предложения. Если фраза ушла в полушёпот на фоне шума, детектор закрывает «речевое окно» раньше времени — и последние слова отрезаются. В Cosmo Scribe пороги детектора настроены заметно мягче стандартных именно из-за этого: мы предпочитаем захватить лишний шум, чем потерять речь.
2. Тихие реплики издалека
Громкость падает пропорционально квадрату расстояния до микрофона: голос с дальнего конца переговорки приходит в разы тише ближнего и по уровню сравнивается с фоном. Часть таких реплик детектор пропускает целиком. Лечится это на этапе записи — устройство в центр стола — и частично компенсируется автоматической нормализацией громкости, которую сервис применяет ко всем записям.
3. Наложения голосов
Модели распознавания обучены на одном голосе в каждый момент времени. Когда двое говорят одновременно, модель следует за более громким, а второй теряется или подмешивается обрывками. Разметка по говорящим тут тоже страдает: диаризация делит запись по голосам, но перебивания — самое сложное для неё место. Единственное надёжное средство — дисциплина разговора в важных местах.
4. Речь под музыкой и пение
Музыка маскирует голос по всему частотному диапазону, а вокал детектор нередко вообще не помечает как речь. Чистое пение распознаётся приемлемо, плотный микс — фрагментами. Это потолок современных речевых моделей в целом, честнее это знать заранее.
Что сервис делает сам
- Мягкие пороги детектора речи — меньше отрезанных окончаний по сравнению со стандартными настройками.
- Нормализация громкости на каждой записи — тихие фрагменты подтягиваются до рабочего уровня ещё до распознавания.
- Фильтр низкочастотного гула — убирает рокот вентиляции и дороги, на фоне которого тонут тихие реплики.
- Шумоподавление по желанию (платные тарифы) — для стабильно шумных записей. Включать его стоит осознанно: на чистых записях агрессивная фильтрация способна навредить.
Что можете сделать вы
- Пишите ближе. Расстояние до микрофона влияет на полноту текста сильнее любого другого фактора.
- Договаривайте фразы в голос — привычка «проглатывать» окончания стоит ровно тех слов, которых потом не хватает в тексте.
- Проверяйте потери по тайм-кодам. Каждый фрагмент расшифровки привязан к месту в записи: подозрительный стык — клик — и вы слушаете именно это место, а не перематываете вслепую.
- Помните про докрутку. Пропущенное слово в цитате для публикации быстрее поправить в редакторе руками, чем добиваться идеала от любого алгоритма.
Резюме
Слова пропадают не случайно: их отбрасывает детектор речи на тихих местах, съедают наложения голосов и маскирует музыка. Половину этих потерь предотвращает правильная запись, ещё часть закрывает предобработка сервиса, а оставшееся быстро находится по тайм-кодам. Как записывать, чтобы терять минимум, — в соседнем разборе про подготовку записи.