ChatGPT sprechen: der Sprachmodus und seine Grenzen
Mit ChatGPT sprechen statt tippen: wofür sich der Sprachmodus eignet, ein Ablauf mit Beispiel und wo er dich falsch versteht, ohne es zu sagen.
Mit ChatGPT sprechen heißt: Mikrofonsymbol tippen, reden, Antwort hören — ohne eine Zeile zu schreiben. Das funktioniert für ein kurzes Gespräch tatsächlich gut. Für eine längere Aufgabe, bei der es auf jedes Wort ankommt, bringt genau dieselbe Bequemlichkeit ein Problem mit sich, das beim Tippen gar nicht erst entsteht.
Beim Tippen siehst du sofort, was tatsächlich ankommt. Beim Sprechen hörst du nur die Antwort — nicht, was das Modell aus deiner Stimme herausgehört hat. Ein falsch verstandener Name oder eine falsch verstandene Zahl fällt deshalb oft erst auf, wenn die Antwort schon daneben liegt.
Was du vorher festlegst, bevor du zu sprechen anfängst
- Der Zweck in einem Satz zuerst: „Ich diktiere eine E-Mail" klingt für das Modell anders als „Ich denke laut über ein Problem nach" — das bestimmt, ob es dich unterbrechen oder durchlaufen lassen soll.
- Die Sprache ausdrücklich, wenn du zwischen zwei Sprachen wechselst. Ohne diese Vorgabe wechselt der Sprachmodus mitten im Satz die Erkennungssprache, sobald ein einzelnes Wort aus der anderen Sprache fällt.
- Fachbegriffe, Eigennamen oder Zahlen, die im Gespräch wichtig werden, einmal vorab buchstabieren oder schreiben lassen — das senkt die Fehlerquote bei genau den Wörtern, bei denen ein Fehler am teuersten ist.
- Eine ruhige Umgebung, wenn es auf Genauigkeit ankommt. Hintergrundgeräusche wirken sich auf die Erkennung stärker aus als auf ein menschliches Ohr, das Kontext mitdenkt.
Ein Beispiel von Anfang bis Ende
Ohne Vorgabe: Du sprichst direkt eine E-Mail an einen Kunden namens „Dr. Kohlhase" diktiert. Das Modell hört „Dr. Kolhase" oder „Dr. Colhase", schreibt die Mail trotzdem flüssig weiter — und der falsche Name fällt erst auf, wenn du den Text am Bildschirm liest, oder gar nicht, wenn du ihn direkt absendest.
Mit Vorgabe: „Ich diktiere gleich eine E-Mail. Der Empfänger heißt Dr. Kohlhase, K-O-H-L-H-A-S-E. Lies mir am Ende den ganzen Text noch einmal vor, bevor ich ihn abschicke." Das Modell hat den Namen jetzt als Text, nicht nur als gehörtes Wort, und der Vorlesen-Schritt gibt dir eine zweite Gelegenheit, einen Fehler zu hören, bevor die Mail rausgeht.
Beim Tippen prüfst du automatisch mit, weil du es siehst. Beim Sprechen musst du den Prüfschritt selbst einbauen, weil sonst keiner da ist.
Wo der Sprachmodus an seine Grenzen kommt
- Falsch verstandene Eigennamen, Fachbegriffe und Zahlen: Je seltener ein Wort, desto häufiger ersetzt die Spracherkennung es durch ein ähnlich klingendes, geläufigeres Wort — ohne das kenntlich zu machen.
- Zu frühes Unterbrechen: Eine normale Sprechpause zum Nachdenken wird manchmal als Satzende gewertet, und das Modell antwortet mitten in deinem eigentlichen Gedanken.
- Keine Tonfall-Bewertung: Der Sprachmodus reagiert auf den erkannten Text, nicht verlässlich auf Betonung oder Aussprache. Für eine echte Ausspracheübung in einer Fremdsprache ist er deshalb kein Ersatz für gezieltes Aussprachetraining.
Der erste Punkt lässt sich mit einem einfachen Schritt entschärfen: Bitte das Modell am Ende eines wichtigen Diktats, dir den kompletten Text vorzulesen, statt ihn stumm zu übernehmen. Weicht das Vorgelesene von dem ab, was du gesagt hast, hast du den Fehler gefunden, bevor er irgendwo ankommt.
Gegen das zu frühe Unterbrechen hilft ein kurzer Hinweis vorab: „Lass mich erst ganz ausreden, auch wenn ich mal kurz pausiere." Das ändert nichts an der Technik dahinter, verschiebt aber die Schwelle, ab der eine Pause als Satzende gewertet wird, deutlich genug, um einen zusammenhängenden Gedanken durchzubringen.
Warum das Ergebnis trotzdem geprüft werden muss
Wie schnell sich Spracherkennung und Sprachmodelle gemeinsam weiterentwickeln, verfolgt der AI Index von Stanford Jahr für Jahr. Der Abstand zwischen „klingt fließend" und „ist inhaltlich richtig" wird dadurch kleiner, aber bei einem einzelnen falsch verstandenen Namen hilft der allgemeine Fortschritt im Einzelfall nichts.
Nutzt du den Sprachmodus für etwas, das andere lesen oder hören, hilft ein Grundsatz aus den OECD-Leitlinien zu KI: Transparenz darüber, wie ein Text entstanden ist, und eine menschliche Prüfung vor der Veröffentlichung. Für eine schnelle Notiz an dich selbst spielt das keine Rolle — für eine Mail an einen Kunden schon.
Wie verbreitet Sprachsteuerung für Arbeitsaufgaben in Deutschland inzwischen ist, zeigt der Bitkom in seinen regelmäßigen Erhebungen zum KI-Einsatz. Welche Aufgaben sich durch Diktat wirklich beschleunigen lassen und wo die Nachbearbeitung mehr Zeit kostet, als das Tippen gespart hätte, untersucht laufend das IAB.
Genau diese Nachbearbeitung — ein Transkript gegenlesen, bevor es weitergeht — ist Teil dessen, wofür der Arbeitsmarkt laut PwC AI Jobs Barometer einen deutlichen Gehaltsaufschlag zahlt, unabhängig davon, ob der erste Entwurf gesprochen oder getippt entstanden ist.
Was du am Montag ausprobierst
- Sag den Zweck des Gesprächs in einem Satz, bevor du losredest.
- Buchstabiere jeden wichtigen Eigennamen oder jede wichtige Zahl einmal vorab.
- Lass dir das Ergebnis am Ende vorlesen, bevor du es verschickst oder übernimmst.
- Bitte ausdrücklich darum, Pausen zum Nachdenken nicht als Satzende zu werten.
Der Prüfschritt am Ende — vorlesen lassen und gegen das eigene Gedächtnis abgleichen — ist derselbe wie bei jeder anderen KI-Aufgabe im Alltag, ausführlicher beschrieben in KI im Büro. Soll aus dem Diktat eine formelle E-Mail werden, zeigt ChatGPT Brief schreiben dieselbe Vorgabe-Logik für den geschriebenen Teil danach. Willst du nicht nur diktieren, sondern mit deiner eigenen, geklonten Stimme vorlesen lassen, gilt derselbe Zustimmungs- und Prüfschritt wie in Stimme klonen. Nutzt du für wiederkehrende Diktate immer dieselben Vorgaben, hilft Custom GPT erstellen, sie nicht jedes Mal neu aufzusagen. Fehlt dir statt des Sprachmodus eher ein Alternativ-Tool für ganz andere Aufgaben, zeigt ChatGPT Alternative einen Überblick, der nicht am Namen des Werkzeugs hängt.
Genau diese Fähigkeit — eine Vorgabe vorher klar machen und das Ergebnis prüfen, statt es einfach zu glauben — vermittelt Coursium in kurzen Lektionen fürs Handy. Bleib der KI voraus mit Übungen, die zu einer echten Aufgabe passen, nicht zu einem Demo-Beispiel. Mehr zu diesem Ansatz steht über Coursium.