Большинство ошибок распознавания речи начинаются в записи, а не в программе. Сильнее всего помогают четыре вещи: микрофон близко к говорящему, мало фонового шума, говорит один человек и правильный язык в настройках. Дальше: говорите законченными фразами в ровном темпе, четко произносите имена и числа и прочитайте текст один раз, прежде чем им пользоваться. Переписывание ИИ потом уберет лишнее и расставит запятые, но слово, которое распознали неверно, оно не восстановит.
| Проблема в тексте | Вероятная причина | Что изменить |
|---|---|---|
| Слова пропущены или искажены | Микрофон далеко или шумно | Поднести телефон ближе, уйти в тихое место |
| Целые фрагменты неверны | Не тот язык в настройках или смешаны два языка | Выбрать язык речи; один язык на запись |
| Имена и названия неверны | Редкие слова, которых система не ждет | Произнести четко, один раз по буквам, потом исправить |
| Два голоса слились | Люди говорят одновременно | Говорить по очереди, делать паузу перед ответом |
| Текста нет вообще | Тишина или очень тихая запись | Проверить уровень записи, сначала сделать короткий пробный фрагмент |
Микрофон и помещение
В рекомендациях Google для сервиса Cloud Speech-to-Text сказано прямо: располагайте микрофон как можно ближе к говорящему, особенно если есть фоновый шум. На практике:
- Держите телефон близко ко рту, когда диктуете, примерно как при звонке, и не закрывайте отверстие микрофона пальцами или чехлом.
- Выберите тихое помещение. Выключите музыку, телевизор и вентилятор. В небольшой комнате с мягкой мебелью эхо меньше, чем на кухне или в подъезде.
- Избегайте ветра. На улице встаньте спиной к ветру или используйте гарнитуру.
- Не кричите. Google также советует избегать перегрузки сигнала (клиппинга). Громкая речь близко к микрофону искажает звук.
- Записывайте совещание с середины стола, а не с края, чтобы все голоса доходили до телефона примерно одинаково.
Как говорить
- Законченными фразами в ровном темпе. Говорить медленно не обязательно, но ровная речь с короткими паузами между мыслями распознается лучше, чем рывками.
- Один язык на запись. Переход на другой язык посреди фразы сбивает многие системы. Если нужно процитировать английский, пусть цитата будет короткой.
- Четко называйте имена и числа. Редкую фамилию скажите один раз медленно или по буквам: «Гвоздецкий, Г В О З Д Е Ц К И Й». Число 15 скажите «пятнадцать, один пять», чтобы его не услышали как «пятьдесят».
- Говорите по очереди. Когда двое говорят одновременно, обычно неверно выходят оба.
- Сделайте паузу после начала записи и перед остановкой, чтобы первые и последние слова не обрезались.
Настройки, которые важны
- Выберите язык речи, если инструмент его спрашивает. У голосового ввода Gboard, расшифровки WhatsApp и диктофонов телефонов свои настройки языка, и неверный язык портит результат. Настройку WhatsApp мы показали в статье о языках расшифровки голосовых в WhatsApp.
- Добавьте имена и термины, если у инструмента есть словарь или список фраз. Документация Google советует подсказки слов и фраз, чтобы добавить имена и термины в словарь.
- Сохраните исходный файл. Каждая перезапись и повторное сжатие теряют детали. Расшифровывайте файл, который сделал диктофон, а не копию, проигранную через динамик. Для своего сервиса Google рекомендует форматы без потерь (FLAC или LINEAR16) и частоту дискретизации 16 000 Гц.
- Не добавляйте шумоподавление потом. Google не советует автоматическую регулировку усиления и шумоподавление для своего сервиса и пишет, что его распознаватель рассчитан на то, чтобы игнорировать фоновые голоса и шум без дополнительного шумоподавления.
Плохо слышная запись
Если запись уже сделана и ее трудно разобрать:
- Расшифруйте весь файл один раз и посмотрите, какие части не получились.
- Переслушайте эти части на замедленной скорости в наушниках и наберите их сами.
- Помечайте то, что не слышно, как [неразборчиво], а не угадывайте. Угаданное слово в цитате или протоколе хуже пропуска.
- Не ждите чудес от очень далекой речи. Если вы сами едва слышите голос, программа тоже не восстановит его надежно.
Как проверить точность самому
Точность распознавания речи обычно измеряют через долю ошибочных слов (WER, word error rate): WER = (S + D + I) / N, где S число замененных слов, D пропущенных, I вставленных, а N число слов в правильном эталонном тексте. Чем меньше, тем лучше.
Домашняя версия занимает пять минут:
- Возьмите абзац примерно в 100 слов, с парой имен и чисел.
- Прочитайте его вслух в свой инструмент, в обычной обстановке.
- Посчитайте неверные, пропущенные и лишние слова и разделите на число слов в абзаце.
- Измените одну вещь (расстояние, комнату, язык в настройках) и повторите.
Результат покажет, что помогает именно с вашим голосом, телефоном и комнатой. Сравнивать по нему инструменты вообще нельзя: опубликованный показатель точности верен только для той записи, на которой его измеряли.
Что исправит переписывание ИИ, а что нет
Retexta, облачное приложение для Android, которое переводит голос в текст и пишет с помощью ИИ, сначала расшифровывает запись, а потом может переписать текст. Переписывание надежно справляется с тем, из-за чего сырую расшифровку трудно читать:
- знаки препинания, заглавные буквы и абзацы;
- слова-паразиты и фальстарты («ну, это, короче»);
- повторы и оборванные фразы.
Если нужно только привести расшифровку в порядок, подходит цель Clean up a text (в More templates). Приложение описывает ее так: сохранить ваш текст и исправить грамматику, пунктуацию и связность. Цели с написанием текста, например Write a message или Take notes, идут дальше и перестраивают сказанное. Меню Retexta на английском, поэтому названия целей даны так, как в приложении.
Чего переписывание не может, так это знать, что фамилию «Гвоздецкий» услышали как «Гвоздевский» или что «пятнадцать» должно было быть «пятьдесят». Оно может даже превратить ослышку в гладкую фразу, которая выглядит правильно. Поэтому имена, числа, даты и суммы сверяйте с записью. Retexta помечает результаты строкой «AI-generated. Check important details.»
Две детали приложения, которые влияют на точность: Retexta определяет язык речи автоматически, поэтому короткой записи с законченной первой фразой ему хватает лучше, чем одного слова. А если запись беззвучная или очень тихая, приложение так и сообщает, а не выдает текст («Transcription finished, but no text was produced»).
Retexta можно попробовать бесплатно: новые пользователи получают несколько бесплатных результатов Pro для просмотра в приложении, а после них и Transcript only требует Retexta Pro или кредитов. Цели с переписыванием и Import audio входят в Retexta Pro, а копирование, отправка и экспорт результатов требуют Retexta Pro или кредитов.
Что почитать дальше
Записываете голосовые заметки? Смотрите, как расшифровать голосовую заметку на Android. Диктуете вместо набора? Прочитайте, как надиктовать письмо на Android. Два голоса на одной записи: как расшифровать интервью. Форматы файлов: MP3 в текст. Подробнее о приложении: Retexta, голос в текст для Android.
Источники
Проверено FLAME Apps 25 сентября 2026 года.
- Google Cloud, Best practices, Cloud Speech-to-Text (на английском, обновлено 18 сентября 2026 года): положение микрофона, клиппинг, частота дискретизации, кодеки без потерь, без регулировки усиления и шумоподавления, подсказки слов и фраз. Это рекомендации для собственного сервиса Google.
- Wikipedia, Word error rate (на английском): определение WER = (S + D + I) / N.
- Код приложения Retexta (Android, версия 2026.1.23): автоматическое определение языка (
RecordScreen.kt,TranscriptionLanguageCatalog.kt), описание цели Clean up a text и сообщения об ошибках (строки приложения).
