Sebagian besar kesalahan suara ke teks berasal dari audionya, bukan dari aplikasinya. Perbaikan terbesar datang dari empat hal: mikrofon dekat dengan orang yang bicara, sedikit suara bising, satu orang bicara dalam satu waktu, dan pengaturan bahasa yang benar. Setelah itu, bicara dalam kalimat lengkap dengan tempo stabil, ucapkan nama dan angka dengan jelas, dan baca teksnya sekali sebelum dipakai. Penulisan ulang oleh AI bisa merapikan tanda baca dan kata pengisi, tetapi tidak bisa memperbaiki kata yang salah ditranskripsi.
| Masalah di teks | Penyebab paling mungkin | Yang diubah |
|---|---|---|
| Kata hilang atau kacau | Mikrofon terlalu jauh, atau bising | Dekatkan HP, pindah ke tempat lebih tenang |
| Seluruh bagian salah | Pengaturan bahasa salah, atau bahasa bercampur | Atur bahasa ucapan; satu bahasa per rekaman |
| Nama dan merek salah | Kata langka yang tidak diduga sistem | Ucapkan jelas, eja sekali, perbaiki sesudahnya |
| Dua suara bercampur | Orang bicara bersamaan | Bergantian; beri jeda sebelum menjawab |
| Tidak ada teks sama sekali | Rekaman hening atau sangat pelan | Cek level suara; tes dulu dengan klip pendek |
Mikrofon dan ruangan
Panduan praktik terbaik Google untuk layanan Cloud Speech-to-Text (bahasa Inggris) menulis: “Position the microphone as close as possible to the person that is speaking, particularly when background noise is present.” Dalam praktiknya:
- Dekatkan HP ke mulut saat mendikte, kira-kira sedekat saat menelepon, dan jangan tutup lubang mikrofon dengan jari atau casing.
- Pilih ruangan tenang. Matikan musik, TV, dan kipas angin. Ruangan kecil dengan banyak kain lebih sedikit gemanya daripada dapur atau tangga.
- Hindari angin dan suara jalan. Di luar, membelakangi angin atau pakai headset. Suara motor dan klakson menenggelamkan kata.
- Jangan berteriak. Google juga menyarankan “avoid audio clipping”. Bicara terlalu keras di dekat mikrofon merusak sinyal.
- Rekam rapat dari tengah meja, bukan dari ujung, supaya semua suara sampai ke HP dengan level yang mirip.
Cara bicara
- Kalimat lengkap dengan tempo stabil. Tidak perlu bicara pelan, tetapi ucapan yang stabil dengan jeda pendek antarpikiran lebih mudah ditranskripsi daripada ucapan yang meledak-ledak.
- Satu bahasa per rekaman. Berganti bahasa di tengah kalimat membingungkan banyak sistem. Kebiasaan menyisipkan kata bahasa Inggris (“meeting-nya di-reschedule”) atau bahasa daerah bisa membuat bagian itu salah tulis. Kalau harus mengutip bahasa lain, buat singkat.
- Ucapkan nama dan angka dengan jelas. Untuk nama yang tidak umum, ucapkan sekali dengan pelan atau eja: “Nyoman, N Y O M A N”. Ucapkan “lima belas” dengan jelas supaya tidak terdengar seperti “lima puluh”.
- Bergantian bicara. Kalau dua orang bicara bersamaan, keduanya biasanya salah.
- Beri jeda singkat setelah menekan rekam dan sebelum berhenti, supaya kata pertama dan terakhir tidak terpotong.
Pengaturan yang berpengaruh
- Pilih bahasa ucapan di alat yang memintanya. Mengetik dengan suara di Gboard, transkrip WhatsApp, dan aplikasi perekam HP masing-masing punya pengaturan bahasa, dan pengaturan yang salah merusak hasilnya. Transkrip WhatsApp di Android tidak mendukung bahasa Indonesia sama sekali; lihat transkripsi WhatsApp tanpa bahasa Indonesia.
- Tambahkan nama dan istilah kalau alatmu punya daftar kosakata. Dokumentasi Google menyarankan petunjuk kata dan frasa “to add names and terms to the vocabulary”.
- Simpan file aslinya. Setiap rekam ulang atau kompresi ulang menghilangkan detail. Transkripsi file dari perekammu, bukan salinan yang diputar lewat speaker. Untuk layanannya sendiri, Google menyarankan format lossless (FLAC atau LINEAR16) dan sample rate 16.000 Hz.
- Jangan tambahkan peredam bising sesudahnya. Google menyarankan tidak memakai automatic gain control dan noise reduction untuk layanannya, dan menyebut pengenalnya dirancang untuk mengabaikan suara latar tanpa peredam tambahan.
Audio yang sulit didengar
Kalau rekamannya sudah jadi dan sulit dipahami:
- Transkripsi seluruh file sekali dan lihat bagian mana yang gagal.
- Dengarkan bagian yang gagal dengan kecepatan lebih lambat memakai headphone dan ketik sendiri.
- Tandai yang tidak terdengar dengan [tidak jelas], jangan ditebak. Kata tebakan di kutipan atau notulen lebih buruk daripada celah kosong.
- Jangan berharap keajaiban dari suara yang sangat jauh. Kalau suaranya hampir tidak terdengar olehmu, software juga tidak akan bisa memulihkannya dengan andal.
Cara menguji akurasi sendiri
Akurasi suara ke teks biasanya diukur dengan word error rate (WER): WER = (S + D + I) / N, dengan S jumlah kata yang tertukar, D kata yang hilang, I kata yang tersisip, dan N jumlah kata dalam teks acuan yang benar. Makin kecil makin baik.
Versi rumahannya butuh lima menit:
- Pilih paragraf sekitar 100 kata yang berisi beberapa nama dan angka.
- Bacakan ke alatmu dalam kondisi biasa.
- Hitung kata yang salah, hilang, atau bertambah, lalu bagi dengan jumlah kata di paragraf.
- Ubah satu hal (jarak, ruangan, pengaturan bahasa) dan ulangi.
Hasilnya menunjukkan apa yang membantu untuk suaramu, HP-mu, dan ruanganmu. Hasil itu tidak membandingkan alat secara umum: angka akurasi yang dipublikasikan hanya berlaku untuk audio tempat angka itu diukur.
Yang diperbaiki AI, dan yang tidak
Retexta, aplikasi suara ke teks dan penulisan AI berbasis cloud untuk Android, mentranskripsi dulu lalu bisa menulis ulang teksnya. Penulisan ulang menangani hal yang membuat transkrip mentah sulit dibaca:
- tanda baca, huruf kapital, dan paragraf;
- kata pengisi dan awal kalimat yang salah (“jadi, eh, maksudnya”);
- frasa yang diulang dan kalimat yang terputus.
Kalau kamu hanya ingin transkrip dirapikan, tujuan Clean up a text (di More templates) dijelaskan di aplikasi sebagai: pertahankan teksmu, perbaiki tata bahasa, tanda baca, dan alurnya. Tujuan menulis seperti Write a message atau Take notes bertindak lebih jauh dan menyusun ulang isi ucapanmu. Menu Retexta berbahasa Inggris; labelnya kami tulis seperti di aplikasi.
Yang tidak bisa dilakukan penulisan ulang: mengetahui bahwa “Nyoman” terdengar sebagai “nyaman”, atau bahwa “lima belas” seharusnya “lima puluh”. AI bahkan bisa mengubah kata salah dengar jadi kalimat lancar yang terlihat benar. Jadi cek nama, angka, tanggal, dan jumlah uang dengan rekamannya. Retexta memberi label hasil “AI-generated. Check important details.”
Dua detail aplikasi yang membantu akurasi: Retexta mengenali bahasa ucapan secara otomatis (tidak ada pilihan bahasa ucapan), jadi klip pendek yang diawali satu kalimat lengkap memberi bahan lebih banyak daripada satu kata saja. Bahasa Indonesia ada di daftar bahasanya. Dan kalau rekaman hening atau sangat pelan, Retexta memberi tahu, bukan mengembalikan teks (“Transcription finished, but no text was produced”).
Retexta gratis untuk dicoba: pengguna baru mendapat beberapa hasil Pro gratis untuk dilihat di aplikasi, dan setelah itu Transcript only pun memerlukan Retexta Pro atau kredit. Tujuan menulis ulang dan Import audio termasuk Retexta Pro, dan menyalin, membagikan, atau mengekspor hasil memerlukan Retexta Pro atau kredit.
Baca juga
Merekam memo suara? Lihat cara ubah rekaman suara jadi teks. Mendikte, bukan mengetik? Baca cara menulis email dengan suara. Dua suara dalam satu rekaman: cara membuat transkrip wawancara. Format file: ubah MP3 jadi teks. Tentang aplikasinya: Retexta, suara ke teks untuk Android.
Sumber
Dicek oleh FLAME Apps pada 25 September 2026.
- Google Cloud, Best practices, Cloud Speech-to-Text (bahasa Inggris, terakhir diperbarui 18 September 2026): posisi mikrofon, clipping, sample rate, codec lossless, tanpa gain control atau noise reduction, petunjuk kata dan frasa. Ini rekomendasi untuk layanan Google sendiri.
- Wikipedia, Word error rate (bahasa Inggris): definisi WER = (S + D + I) / N.
- WhatsApp Help Center, How to turn voice message transcripts on or off (bahasa Inggris): bahasa transkrip di Android.
- Kode aplikasi Retexta (Android, versi 2026.1.23): deteksi bahasa otomatis dan daftar bahasa (
RecordScreen.kt,TranscriptionLanguageCatalog.kt), deskripsi tujuan Clean up a text dan pesan galat (string aplikasi).
