Spracherkennung verbessern: praktische Tipps

Bessere Spracherkennung: Abstand zum Mikrofon, Lärm, Sprechtempo, Namen und Einstellungen, ein Selbsttest und was eine KI-Überarbeitung behebt.

Aktualisiert am 25.09.2026 · 5 Min. Lesezeit

Die meisten Fehler bei der Spracherkennung entstehen in der Aufnahme, nicht in der Software. Am meisten bringen vier Dinge: das Mikrofon nah an der sprechenden Person, wenig Hintergrundgeräusche, immer nur eine Person spricht und die richtige Spracheinstellung. Danach hilft es, in ganzen Sätzen in gleichmäßigem Tempo zu sprechen, Namen und Zahlen deutlich zu sagen und den Text einmal zu lesen, bevor du ihn verwendest. Eine KI-Überarbeitung räumt dann Satzzeichen und Füllwörter auf. Ein falsch erkanntes Wort kann sie aber nicht reparieren.

Problem im Text Wahrscheinliche Ursache Was du änderst
Wörter fehlen oder sind verstümmelt Mikrofon zu weit weg oder Lärm Handy näher halten, ruhigeren Ort suchen
Ganze Passagen falsch Falsche Spracheinstellung oder zwei Sprachen gemischt Gesprochene Sprache einstellen; eine Sprache pro Aufnahme
Namen und Fachwörter falsch Seltene Wörter, mit denen das System nicht rechnet Deutlich sagen, einmal buchstabieren, danach korrigieren
Zwei Stimmen vermischt Menschen reden durcheinander Nacheinander sprechen; vor der Antwort kurz warten
Gar kein Text Stumme oder extrem leise Aufnahme Pegel prüfen; erst einen kurzen Test aufnehmen

Mikrofon und Raum

Google schreibt in seinen Empfehlungen für den Dienst Cloud Speech-to-Text: Das Mikrofon soll so nah wie möglich an der sprechenden Person sein, „particularly when background noise is present“, also vor allem bei Hintergrundgeräuschen. Im Alltag heißt das:

  • Halt das Handy beim Diktieren nah an den Mund, etwa so nah wie beim Telefonieren, und verdeck die Mikrofonöffnung nicht mit Fingern oder Hülle.
  • Such dir einen ruhigen Raum. Musik, Fernseher und Ventilator aus. Ein kleiner Raum mit Teppich und Polstermöbeln hallt weniger als Küche oder Treppenhaus.
  • Vermeide Wind. Draußen drehst du dem Wind den Rücken zu oder nimmst ein Headset.
  • Nicht schreien. Google rät auch, Übersteuerung zu vermeiden („avoid audio clipping“). Lauter als normal direkt ins Mikrofon zu sprechen verzerrt das Signal.
  • Leg das Handy bei einem Meeting in die Mitte des Tisches, nicht an ein Ende, damit jede Stimme ähnlich laut ankommt.

Wie du sprichst

  • Ganze Sätze in gleichmäßigem Tempo. Du musst nicht langsam sprechen. Gleichmäßiges Sprechen mit kurzen Pausen zwischen den Gedanken klappt aber besser als hastige Wortschwalle.
  • Eine Sprache pro Aufnahme. Mitten im Satz die Sprache zu wechseln, bringt viele Systeme durcheinander. Musst du etwas in einer anderen Sprache zitieren, halt es kurz.
  • Namen und Zahlen deutlich. Einen ungewöhnlichen Namen sagst du einmal langsam oder buchstabierst ihn: „Szczepanski, S Z C Z E P A N S K I“. Bei Zahlen hilft „fünfzehn, eins fünf“, damit daraus nicht „fünfzig“ wird.
  • Nacheinander sprechen. Reden zwei Menschen gleichzeitig, kommen meist beide falsch heraus.
  • Kurz warten nach dem Start der Aufnahme und vor dem Stoppen, damit das erste und das letzte Wort nicht abgeschnitten werden.

Einstellungen, die zählen

  • Stell die gesprochene Sprache ein, wo das Tool danach fragt. Gboard, die WhatsApp-Transkription und Aufnahme-Apps haben jeweils eine eigene Spracheinstellung, und eine falsche Einstellung verdirbt das Ergebnis. Wie das bei WhatsApp aussieht und warum Deutsch dort auf Android fehlt, steht in unserem Ratgeber WhatsApp-Transkription: kein Deutsch?.
  • Namen und Fachbegriffe hinzufügen, wenn dein Tool eine Wortliste hat. Google empfiehlt dafür Wort- und Phrasenhinweise („word and phrase hints“).
  • Die Originaldatei behalten. Jede neue Aufnahme und jede neue Komprimierung kostet Details. Transkribier die Datei, die dein Rekorder gemacht hat, nicht eine Kopie, die über einen Lautsprecher abgespielt wurde. Für seinen eigenen Dienst empfiehlt Google verlustfreie Formate (FLAC oder LINEAR16) und eine Abtastrate von 16.000 Hz.
  • Keine Rauschunterdrückung nachträglich. Google rät bei seinem Dienst von automatischer Pegelanpassung und Rauschunterdrückung ab und schreibt, die Erkennung sei darauf ausgelegt, Hintergrundstimmen und Geräusche ohne zusätzliche Rauschunterdrückung zu ignorieren.

Schwer verständliche Aufnahmen

Wenn die Aufnahme schon gemacht ist und schlecht zu verstehen:

  1. Transkribier die ganze Datei einmal und schau, welche Stellen scheitern.
  2. Hör diese Stellen langsamer mit Kopfhörern an und tipp sie selbst ab.
  3. Markier, was du nicht verstehst, als [unverständlich], statt zu raten. Ein geratenes Wort in einem Zitat oder Protokoll ist schlimmer als eine Lücke.
  4. Erwarte bei sehr weit entfernter Sprache keine Wunder. Was du selbst kaum hörst, erkennt auch eine Software nicht zuverlässig.

Die Genauigkeit selbst testen

Gemessen wird die Genauigkeit der Spracherkennung meist mit der Wortfehlerrate (englisch word error rate, WER): WER = (S + D + I) / N. Dabei ist S die Zahl der ersetzten Wörter, D die der ausgelassenen, I die der eingefügten und N die Zahl der Wörter im korrekten Vergleichstext. Je niedriger, desto besser.

Zu Hause dauert das fünf Minuten:

  1. Nimm einen Absatz mit etwa 100 Wörtern, ein paar Namen und Zahlen.
  2. Lies ihn so in dein Tool, wie du es sonst auch nutzt.
  3. Zähl die falschen, fehlenden und zusätzlichen Wörter und teil sie durch die Zahl der Wörter im Absatz.
  4. Ändere eine Sache (Abstand, Raum, Spracheinstellung) und wiederhole den Test.

Das Ergebnis zeigt dir, was bei deiner Stimme, deinem Handy und deinem Raum hilft. Es vergleicht keine Tools allgemein: Eine veröffentlichte Genauigkeitszahl gilt nur für die Aufnahmen, mit denen sie gemessen wurde.

Was eine KI-Überarbeitung behebt und was nicht

Retexta, eine Cloud-App für Sprache zu Text und KI-Schreiben auf Android, transkribiert zuerst und kann den Text danach überarbeiten. Zuverlässig klappt das bei allem, was rohe Transkripte schwer lesbar macht:

  • Satzzeichen, Groß- und Kleinschreibung und Absätze;
  • Füllwörter und Neuansätze („also, ähm, ich mein“);
  • Wiederholungen und abgebrochene Sätze.

Willst du das Transkript nur aufgeräumt haben, nimm das Ziel Text aufräumen (unter Weitere Vorlagen). Die App beschreibt es so: Text behalten, Grammatik, Zeichensetzung und Lesefluss korrigieren. Die Schreibziele wie Nachricht schreiben oder Notizen machen gehen weiter und bauen das Gesagte neu auf.

Was eine Überarbeitung nicht kann: wissen, dass „Szczepanski“ als „Schepanski“ erkannt wurde oder dass „fünfzehn“ eigentlich „fünfzig“ hätte sein sollen. Sie macht aus einem falsch verstandenen Wort vielleicht sogar einen flüssigen Satz, der richtig aussieht. Prüf deshalb Namen, Zahlen, Daten und Beträge mit der Aufnahme. Retexta kennzeichnet Ergebnisse mit „KI-generiert. Wichtige Angaben prüfen.“

Zwei Details der App helfen bei der Genauigkeit: Retexta erkennt die gesprochene Sprache automatisch. Ein kurzer Clip mit einem ganzen ersten Satz gibt ihr also mehr Anhaltspunkte als ein einzelnes Wort. Und ist eine Aufnahme stumm oder extrem leise, sagt die App das, statt Text zu liefern.

Retexta kannst du mit ein paar kostenlosen Pro-Ergebnissen zum Start ausprobieren; danach braucht auch Nur Transkript Retexta Pro oder Credits. Schreibziele und Audio importieren gehören zu Retexta Pro, und Kopieren, Teilen oder Exportieren von Ergebnissen brauchen Retexta Pro oder Credits.

Weiterlesen

Ein Sprachmemo aufgenommen? Siehe Sprachmemo in Text umwandeln. Diktieren statt tippen: E-Mail diktieren und formulieren lassen. Zwei Stimmen in einer Aufnahme: Interview transkribieren. Dateiformate: MP3 in Text umwandeln. Mehr zur App: Retexta, Sprache zu Text für Android.

Quellen

Geprüft von FLAME Apps am 25.09.2026.

  • Google Cloud, Best practices, Cloud Speech-to-Text (englisch, zuletzt aktualisiert am 18.09.2026): Position des Mikrofons, Übersteuerung, Abtastrate, verlustfreie Formate, keine Pegelanpassung oder Rauschunterdrückung, Wort- und Phrasenhinweise. Das sind Empfehlungen für Googles eigenen Dienst.
  • Wikipedia, Word error rate (englisch): Definition WER = (S + D + I) / N.
  • Code der Retexta-App (Android, Version 2026.1.23): automatische Spracherkennung (RecordScreen.kt, TranscriptionLanguageCatalog.kt), Beschreibung des Ziels Text aufräumen und Fehlermeldungen (Texte der App).
Fragen

Gut zu wissen

Wie wird die Spracherkennung genauer?

Fang bei der Aufnahme an: Mikrofon nah an die sprechende Person, weg von Lärm, und immer nur eine Person spricht. Sprich in ganzen Sätzen in gleichmäßigem Tempo, sag Namen deutlich und prüf, ob das Tool auf die Sprache eingestellt ist, die du sprichst.

Gelten die Tipps auch für die Windows-Spracherkennung?

Die Tipps zu Mikrofon, Raum und Sprechweise gelten für jede Spracherkennung, auch unter Windows. Die Einstellungen von Windows selbst behandeln wir hier nicht. Schau dafür in die Hilfe von Microsoft.

Wie misst man, wie gut eine Spracherkennung ist?

Üblich ist die Wortfehlerrate: Ersetzungen, Auslassungen und Einfügungen geteilt durch die Zahl der Wörter in einem korrekten Vergleichstext. Eine kleine Version machst du selbst, indem du einen bekannten Absatz vorliest und die Fehler zählst.

Kann KI Fehler der Spracherkennung korrigieren?

Eine KI-Überarbeitung behebt Satzzeichen, Füllwörter und abgebrochene Sätze gut. Dass ein Name oder eine Zahl falsch verstanden wurde, weiß sie aber nicht, und sie kann einen Fehler so glätten, dass er richtig aussieht. Prüf Namen, Zahlen und Daten mit der Aufnahme.

App holen

Retexta: KI Diktat

Sprich einfach drauflos und bekomme fertige E-Mails, Protokolle und Nachrichten.

Für Android-Smartphones und -Tablets.

Jetzt bei Google Play
Scannen und auf dem Android-Handy installieren

Kostenloser DownloadÜber 50 Sprachen