רוב הטעויות בדיבור לטקסט מתחילות בשמע, לא בתוכנה. השיפור הגדול מגיע מארבעה דברים: מיקרופון קרוב למי שמדבר, מעט רעשי רקע, אדם אחד מדבר בכל פעם והגדרת השפה הנכונה. אחרי זה: לדבר במשפטים מלאים ובקצב קבוע, לומר שמות ומספרים בבירור, ולקרוא את הטקסט פעם אחת לפני שמשתמשים בו. ניסוח מחדש עם AI יכול אחר כך לסדר פיסוק ומילות מילוי, אבל הוא לא יכול לתקן מילה שהתמלול טעה בה.
| הבעיה בטקסט | הסיבה הסבירה | מה משנים |
|---|---|---|
| מילים חסרות או משובשות | מיקרופון רחוק מדי, או רעש | מקרבים את הטלפון, עוברים למקום שקט |
| קטעים שלמים שגויים | הגדרת שפה לא נכונה, או ערבוב של שתי שפות | מגדירים את שפת הדיבור; שפה אחת בכל הקלטה |
| שמות ומותגים שגויים | מילים נדירות שהמערכת לא מצפה להן | אומרים אותם בבירור, מאייתים פעם אחת, מתקנים אחר כך |
| שני קולות מתערבבים | אנשים מדברים זה על זה | מדברים בתורות; עוצרים רגע לפני שעונים |
| אין טקסט בכלל | הקלטה שקטה או חלשה מאוד | בודקים את עוצמת הקלט; מנסים קודם קטע קצר |
המיקרופון והחדר
ההמלצות של Google לשירות Cloud Speech-to-Text שלה אומרות את זה בפשטות: "Position the microphone as close as possible to the person that is speaking, particularly when background noise is present" (למקם את המיקרופון קרוב ככל האפשר לדובר, במיוחד כשיש רעשי רקע). בפועל:
- מחזיקים את הטלפון קרוב לפה כשמכתיבים, בערך כמו בשיחת טלפון, ולא מכסים את פתח המיקרופון באצבעות או בכיסוי.
- בוחרים חדר שקט. מכבים מוזיקה, טלוויזיה ומאוורר. חדר קטן עם ריהוט רך מהדהד פחות ממטבח או מחדר מדרגות.
- נזהרים מרוח. בחוץ, מסובבים את הגב לרוח או משתמשים במיקרופון של אוזניות.
- לא צועקים. Google ממליצה גם להימנע מעיוות של השמע (clipping). דיבור חזק מהרגיל קרוב למיקרופון מעוות את האות.
- מקליטים ישיבה מאמצע השולחן, לא מקצה אחד, כדי שכל הקולות יגיעו לטלפון בעוצמה דומה.
איך מדברים
- משפטים מלאים בקצב קבוע. לא צריך לדבר לאט, אבל דיבור רציף עם הפסקות קצרות בין מחשבות מתומלל טוב יותר מפרצי דיבור.
- שפה אחת בכל הקלטה. מעבר בין עברית לאנגלית באמצע משפט מבלבל מערכות רבות. אם חייבים מונח באנגלית, אומרים אותו בבירור ובודקים אותו אחר כך בטקסט.
- אומרים שמות ומספרים בבירור. שם לא נפוץ אומרים פעם אחת לאט, ואם צריך, מאייתים אותו אות אחרי אות. במספרים כדאי לבדוק בטקסט שיצא "חמש עשרה" ולא "חמישים".
- שימו לב למילים דו משמעיות. בעברית בלי ניקוד יש מילים שנכתבות אותו דבר ונקראות אחרת. אם משמעות של משפט תלויה במילה כזו, קראו אותו שוב בטקסט.
- מדברים בתורות. כששני אנשים מדברים בבת אחת, בדרך כלל שניהם יוצאים משובשים.
- עוצרים רגע אחרי שלוחצים על הקלטה ולפני שעוצרים, כדי שהמילים הראשונות והאחרונות לא ייחתכו.
הגדרות שמשנות
- בוחרים את שפת הדיבור איפה שהכלי שואל. להקלדה הקולית ב-Gboard, לתמלילים של וואטסאפ ולאפליקציות ההקלטה בטלפון יש הגדרת שפה משלהן, והגדרה שגויה הורסת את התוצאה. שימו לב שחלק מהכלים המובנים לא תומכים בעברית בכלל: התמלול של וואטסאפ באנדרואיד, אפליקציית ההקלטה של Pixel והתכונות המתקדמות של ההכתבה ב-Gboard. ראו אין עברית בתמלול הודעות קוליות בוואטסאפ? ותמלול הקלטה לטקסט באנדרואיד.
- מוסיפים שמות ומונחים אם יש לכלי רשימת אוצר מילים או ביטויים. התיעוד של Google ממליץ על רמזי מילים וביטויים כדי להוסיף שמות ומונחים לאוצר המילים.
- שומרים את הקובץ המקורי. כל הקלטה מחדש או דחיסה מחדש מאבדת פרטים. מתמללים את הקובץ שהמקליט יצר, לא עותק שהושמע ברמקול. לשירות שלה, Google ממליצה על פורמטים בלי אובדן (FLAC או LINEAR16) ועל קצב דגימה של 16,000 הרץ.
- לא מוסיפים הפחתת רעשים אחר כך. Google ממליצה לא להשתמש בבקרת עוצמה אוטומטית ובהפחתת רעשים בשירות שלה, וכותבת שהמזהה שלה בנוי להתעלם מקולות ורעשים ברקע בלי ביטול רעשים נוסף.
שמע שקשה לשמוע
אם ההקלטה כבר נעשתה וקשה להבין אותה:
- מתמללים את כל הקובץ פעם אחת ורואים אילו חלקים נכשלו.
- מקשיבים לחלקים שנכשלו במהירות איטית יותר עם אוזניות ומקלידים אותם בעצמכם.
- מסמנים את מה שלא שומעים כ-[לא ברור] במקום לנחש. מילה מנוחשת בציטוט או בפרוטוקול גרועה יותר מרווח.
- לא מצפים לנסים מדיבור רחוק מאוד. אם אתם בקושי שומעים קול, גם תוכנה לא תשחזר אותו באופן אמין.
איך בודקים את הדיוק בעצמכם
הדיוק של דיבור לטקסט נמדד בדרך כלל כשיעור שגיאות המילים (WER): WER = (S + D + I) / N, כאשר S הוא מספר המילים שהוחלפו, D המילים שנמחקו, I המילים שנוספו ו-N מספר המילים בטקסט עיון נכון. נמוך יותר זה טוב יותר.
גרסה ביתית לוקחת חמש דקות:
- בוחרים פסקה של כ-100 מילים עם כמה שמות ומספרים.
- מקריאים אותה לכלי שלכם, בתנאים הרגילים שלכם.
- סופרים את המילים השגויות, החסרות והמיותרות, ומחלקים במספר המילים בפסקה.
- משנים דבר אחד (מרחק, חדר, הגדרת שפה) וחוזרים על הבדיקה.
התוצאה אומרת מה עוזר עם הקול שלכם, הטלפון שלכם והחדר שלכם. היא לא משווה בין כלים באופן כללי: נתון דיוק שפורסם תקף רק לשמע שעליו הוא נמדד.
מה ניסוח מחדש עם AI מתקן, ומה לא
Retexta, אפליקציית ענן לאנדרואיד שממירה דיבור לטקסט וכותבת בעזרת AI, מתמללת קודם ויכולה אחר כך לנסח את הטקסט מחדש. הניסוח מחדש מטפל היטב בדברים שהופכים תמליל גולמי לקשה לקריאה:
- פיסוק ופסקאות;
- מילות מילוי והתחלות שגויות ("אז, אממ, כאילו");
- ביטויים שחוזרים על עצמם ומשפטים שבורים.
אם רוצים רק לסדר את התמליל, המטרה Clean up a text (תחת More templates) מתוארת באפליקציה כך: שומרת על הטקסט שלכם, מתקנת דקדוק, פיסוק ורצף. מטרות הכתיבה, כמו Write a message או Take notes, הולכות רחוק יותר ובונות מחדש את מה שאמרתם. תפריטי האפליקציה באנגלית, ולכן שמות הכפתורים מופיעים כאן באנגלית.
מה שניסוח מחדש לא יכול לעשות הוא לדעת שהשם "טליה" נשמע "תליה", או ש"חמש עשרה" היה צריך להיות "חמישים". הוא עלול אפילו להפוך מילה ששמעו לא נכון למשפט רהוט שנראה נכון. לכן בודקים שמות, מספרים, תאריכים וסכומים מול ההקלטה. Retexta מסמנת את התוצאות בכיתוב "AI-generated. Check important details."
שני פרטים באפליקציה שעוזרים לדיוק: Retexta מזהה את השפה המדוברת לבד, ועברית ברשימת השפות שלה, כך שקטע קצר שמתחיל במשפט מלא נותן לה יותר עם מה לעבוד מאשר מילה אחת. ואם ההקלטה שקטה או חלשה מאוד, היא אומרת את זה במקום להחזיר טקסט ("Transcription finished, but no text was produced").
אפשר לנסות את Retexta בחינם: משתמשים חדשים מקבלים כמה תוצאות Pro בחינם לצפייה באפליקציה, ואחריהן גם Transcript only דורשת Retexta Pro או קרדיטים. מטרות הניסוח ו-Import audio הם חלק מ-Retexta Pro, ולהעתקה, לשיתוף או לייצוא של תוצאות צריך Retexta Pro או קרדיטים.
להמשך
מקליטים תזכיר קולי? ראו תמלול הקלטה לטקסט באנדרואיד. מכתיבים במקום להקליד? קראו הכתבת מייל בקול באנדרואיד. שני קולות בהקלטה אחת: איך מתמללים ראיון. פורמטים של קבצים: המרת קובץ MP3 לטקסט. עוד על האפליקציה: Retexta, דיבור לטקסט לאנדרואיד.
מקורות
נבדקו על ידי FLAME Apps ב-25 בספטמבר 2026 (Google Cloud, WER) וב-28 בספטמבר 2026 (דפי העזרה בעברית, Retexta).
- Google Cloud, Best practices, Cloud Speech-to-Text (באנגלית, עודכן לאחרונה ב-18 בספטמבר 2026): מיקום המיקרופון, עיוות, קצב דגימה, קידוד בלי אובדן, בלי בקרת עוצמה והפחתת רעשים, רמזי מילים וביטויים. אלה המלצות לשירות של Google עצמה.
- Wikipedia, Word error rate (באנגלית): ההגדרה WER = (S + D + I) / N.
- העזרה של טלפון Pixel, יצירה, עריכה וניהול של תמלילים, ומרכז העזרה של Gboard, איך להשתמש בתכונות המתקדמות של ההכתבה: רשימות השפות, בלי עברית.
- Retexta, קוד האפליקציה לאנדרואיד (גרסה 2026.1.23): זיהוי שפה אוטומטי (
RecordScreen.kt,TranscriptionLanguageCatalog.kt), תיאור המטרה Clean up a text והודעות השגיאה (מחרוזות האפליקציה).
