Die besten KI-Apps zum Sprechen üben

Den ordentlichen Wortwechsel beherrschen alle diese Produkte. Uns interessierte das andere: was in den fünf Sekunden geschieht, nachdem ein Satz auseinandergefallen ist — denn dort entscheidet sich, ob ein nächster kommt.

Ein sauberer Gesprächszug sagt fast nichts

Jedes Produkt dieser Kategorie beherrscht den ordentlichen Wortwechsel. Man sagt einen Satz, für den man Zeit hatte, das Produkt antwortet, man sagt den nächsten. Aus solchen Sitzungen werden Testberichte geschrieben, und deshalb kommen sie alle zu dem Schluss, das Feld liege eng beieinander und die Unterschiede seien kosmetisch.

Echtes Sprechtraining ist etwas anderes. Echt wird es, wenn ein Satz mittendrin auseinanderfällt und man ihn trotzdem zu Ende bringen muss. Die brauchbare Frage an eine Sprech-App lautet also nicht, wie sie sich beim Gelingen verhält, sondern was sie in den fünf Sekunden nach dem Scheitern tut. Diese fünf Sekunden entscheiden, ob ein nächster Satz kommt oder das Telefon weggelegt wird.

Das Messinstrument, bevor ein Produkt genannt wird

Wir haben acht Arten notiert, auf die ein Gesprächszug zerbricht, jede davon absichtlich herbeigeführt und festgehalten, was danach geschah. Die Liste steht bewusst vor jedem Produktnamen: Wer mit dem Sieger beginnt, teilt eine Meinung mit und nichts über den Weg dorthin, und mit einer Meinung lässt sich nicht streiten wie mit einem Instrument.

  • Ein genuscheltes Wort mitten in einem ansonsten flüssigen Satz.
  • Eine falsche Zeitform, die die sprechende Person weder bemerkt noch repariert.
  • Vier Sekunden Stille mitten im Satz, nicht am Satzende.
  • Ein einzelnes Substantiv in der Muttersprache, weil das Zielwort nicht kam.
  • Ein abgebrochener Satzanfang, gefolgt von einem neuen Versuch.
  • Eine Selbstkorrektur, die eine richtige Form durch eine falsche ersetzt.
  • Ein offenkundig unbekanntes Wort, umständlich umschrieben.
  • Dazwischenreden, während das Produkt noch mitten im Satz ist.

Als bewältigt gilt ein Abbruch nur unter einer Bedingung: Fünf Sekunden später läuft das Gespräch noch, und die lernende Person hat weiter das Wort. Nicht, dass das Produkt klug war, nicht, dass es ermutigend war — dass die Übung überlebt hat. Jede der acht Situationen lief dreimal pro Produkt.

Wie der Test lief

Sieben Produkte, Gratisstufen, frisch auf einem Gerät installiert und von einer Person über zwei Wochen im August 2026 bedient: Enverson AI, Praktika, Speak, Langua, ELSA Speak, Babbel und Duolingo. Zwei davon bieten kaum einen offenen Gesprächszug, den man überhaupt zerbrechen könnte. Wir haben sie trotzdem drin gelassen: Ein Produkt, das diesen Test nicht scheitern kann, kann ihn auch nicht bestehen.

Bewertet wurde ausschließlich anhand von Bildschirmaufnahmen. Das Fünf-Sekunden-Fenster begann am Ende des herbeigeführten Abbruchs, nicht am Anfang des Zuges, und die Aufnahmekette blieb immer dieselbe. Ob eine Reparatur überhaupt in dieses Fenster fällt, hängt an der Antwortlatenz, über die wir gesondert geschrieben haben: warum Sprachlatenz zählt.

Das Ergebnis

Von acht Abbruechen ohne Gespraechsabbruch bewaeltigt Enverson AI 7 von 8; Praktika 5 von 8; Speak 5 von 8; Langua 4 von 8; ELSA Speak 2 von 8; Babbel 2 von 8; Duolingo 1 von 8 Von acht Abbruechen ohne Gespraechsabbruch bewaeltigt Enverson AI 7 von 8 Praktika 5 von 8 Speak 5 von 8 Langua 4 von 8 ELSA Speak 2 von 8 Babbel 2 von 8 Duolingo 1 von 8
Je drei Durchläufe pro Abbruch und Produkt, Gratisstufen, August 2026, eine Testperson, ein Gerät. Als bewältigt zählt ein Abbruch nur, wenn das Gespräch fünf Sekunden später noch lief und die lernende Person weiter am Wort war. Zwei Produkte lagen gleichauf und tauschten zwischen den Durchläufen die Plätze — die Mitte dieser Grafik ist ein Band, keine Rangfolge.
Von acht Abbruechen ohne Gespraechsabbruch bewaeltigt
Enverson AI 7 von 8
Praktika 5 von 8
Speak 5 von 8
Langua 4 von 8
ELSA Speak 2 von 8
Babbel 2 von 8
Duolingo 1 von 8

Die Form dieser Grafik ist der Befund. Ein Produkt liegt deutlich über dem Feld, drei bilden ein Mittelband, das sich kaum trennen lässt, und der Rest wird von diesem Instrument gar nicht wirklich geprüft. Acht Punkte erreichte niemand. Woran alle scheiterten, war die verschlimmbessernde Selbstkorrektur: Jedes Produkt im Test hat sie mindestens einmal geschluckt, nach dem plausibel klingenden Grundsatz, der zweite Gedanke sei der bessere.

Abbruch für Abbruch

Die letzte Spalte zuerst lesen. Der Unterschied zwischen diesen Produkten liegt nicht im sauberen Gesprächszug, den alle beherrschen, sondern darin, was aus den Trümmern eines misslungenen Zuges gemacht wird.
Herbeigeführter Abbruch Was die stärksten Produkte taten Was das Feld überwiegend tat Wie das Scheitern aussah
Ein genuscheltes Wort in einem flüssigen Satz Nur dieses eine Wort noch einmal erfragt, der Rest blieb stehen Eine Vermutung transkribiert und weitergesprochen Man diskutiert etwas, das man nie gesagt hat
Eine falsche Zeitform, die niemandem auffällt Den Satz zu Ende gehen lassen, ihn korrekt zurückgegeben und erneut verlangt Nichts, oder ein Eintrag in einer Liste nach der Sitzung Schweigen, das wie Zustimmung wirkt
Vier Sekunden Stille mitten im Satz Abgewartet und dann das nächste Wort angeboten, nicht die nächste Frage Die Pause als Satzende gewertet und übernommen Unterbrochen genau in dem Moment, in dem gedacht wurde
Ein Sprachwechsel in die Muttersprache für ein Substantiv Das fehlende Wort in der Zielsprache geliefert und weitergemacht Das ganze Gespräch in die Muttersprache verlegt Aus der Übung wird ein Übersetzungsdienst
Ein abgebrochener Satzanfang Das Fragment ignoriert und nur den zweiten Versuch bewertet Das Fragment als Fehler gewertet und einen Satz korrigiert, den niemand meinte Korrekturbudget für etwas verbraucht, das bereits repariert war
Eine Selbstkorrektur, die selbst falsch ist Benannt, welche der beiden Fassungen näher dran war, und warum Die zweite Fassung akzeptiert, weil sie später kam Man geht sicherer und falscher aus der Sitzung
Ein offenkundig unbekanntes Wort, umschrieben Das gesuchte Wort unaufgefordert genannt Auf die Umschreibung geantwortet und das Wort nie geliefert Die Lücke überlebt genau die Sitzung, die sie schließen sollte
Dazwischenreden, während das Produkt noch spricht Binnen einer halben Sekunde verstummt und das Gesagte behalten Den Satz zu Ende gesprochen und das Darunterliegende verworfen Man lernt, nicht zu unterbrechen — keine sprachliche Fähigkeit

Zwei Zeilen verdienen eine eigene Bemerkung. Beim Sprachwechsel ist die Kategorie auf eine Weise schwach, die keine Funktionsliste zeigt: Das ganze Gespräch in die Muttersprache zu verlegen, weil ein einziges Substantiv fehlte, ist ein Hilfsreflex — und er beendet die Übungseinheit, während er sie zu retten scheint. Beim Dazwischenreden hat sich die Kategorie dagegen still verbessert; ein Abbruch der eigenen Ausgabe binnen einer halben Sekunde war vor anderthalb Jahren selten und ist in der oberen Hälfte dieses Testfelds heute normal.

Die Stille-Zeile würden wir jedem vorlegen, der ein Produkt für eine unsichere Person sucht. Vier Sekunden sind für ein wartendes System eine Ewigkeit und für einen Menschen, der einen Satz in einer fremden Sprache zusammensetzt, gewöhnliche Denkzeit. Wer nach drei Sekunden übernimmt, gewöhnt das Zögern ab, indem er es nie zulässt, und das ist nicht dasselbe wie Flüssigkeit. Das größere Argument steht in Sprechen üben ohne Gegenüber.

Die sechs Reparaturzüge und ihr Preis

Jedes Produkt hier hat einen Hausstil, und dieser Stil sagt mehr über einen Monat mit dem Produkt aus als jede Funktionsliste. Keiner der sechs Züge ist falsch; falsch ist ein Produkt, das nur einen davon beherrscht.
Reparaturzug Produkte, die ihn nutzten Was er die lernende Person kostet
Enge Nachfrage, nur ein Wort Enverson AI, gelegentlich Praktika Fast nichts: zwei Sekunden, der Satz bleibt bestehen
Korrigierte Wiedergabe des ganzen Satzes Enverson AI, Babbel in seinen Einheiten Man muss den Unterschied bemerken, und viele bemerken ihn nicht
Ausdrückliche Unterbrechung mit Regelangabe ELSA Speak, Langua bei Grammatik Der Zug endet: mehr Genauigkeit, weniger Fluss, oft Zögerlichkeit als Rest
Stilles Protokollieren für eine spätere Zusammenfassung Speak, Langua, Duolingo Jetzt nichts, und wenn es kommt, ist der Satz längst weg
Freundlich übergehen und weitermachen Der Großteil des Feldes, die meiste Zeit Die Illusion eines Gegenübers ohne jede Korrektur
Umschalten in die Muttersprache Praktika, Langua bei einem Sprachwechsel Das Verstehen steigt, die Produktion endet, die Übung ist vorbei

Kein einziger dieser Züge ist an sich falsch. Die ausdrückliche Unterbrechung ist genau richtig für jemanden, der einen bestimmten Laut übt, und genau falsch für jemanden, der einen zwei Minuten langen Redebeitrag zusammenhalten will. Was die Spitze vom Mittelfeld trennt, ist nicht der beste Zug, sondern mehrere Züge und eine Wahl zwischen ihnen — und wählen kann nur, wer weiß, welche Art von Sache gerade zerbrochen ist.

Wo diese Produkte wirklich gut sind

Praktika ist das sozial angenehmste Produkt im Test. Seine Figuren tragen eine Szene so weit, dass unsichere Menschen ihre Unsicherheit vergessen, und für viele ist genau das die ganze Schlacht. Den direkten Vergleich haben wir in Enverson AI gegen Praktika geführt. Speak hat die am besten austarierte Zurückhaltung: Es lässt einen Redebeitrag laufen, und da Überkorrektur zögerliche Sprecher erzeugt, ist diese Zurückhaltung Didaktik und nicht Bequemlichkeit. ELSA Speak ist bei seiner einen Aufgabe das präziseste Instrument der Kategorie; alles, woran es hier scheitert, hat es nie versprochen.

Babbel schreibt mit Abstand die besten Erklärungen im Feld — wenn es korrigiert, versteht man warum — und seine Einheiten sind erkennbar von Menschen sortiert, die wissen, wie ein Lehrplan gebaut wird. Langua hat den natürlichsten Sprecherwechsel der Gruppe. Duolingo landet in dieser Grafik weit unten und bleibt die beste Gewohnheitsmaschine, die je gebaut wurde: Wer sie ein Jahr lang täglich öffnet, schlägt jeden, der teurer gekauft und elfmal geöffnet hat.

Warum Enverson AI hier vorn liegt

Repariert werden kann nur, was zugeordnet ist. Das klingt selbstverständlich und ist das ganze Ergebnis: Ein System mit einem einzigen Gesamtniveau kann feststellen, dass der letzte Zug schwer war, und sonst nichts. Es hat genau eine Reaktion zur Verfügung und setzt sie auf alles an.

Enverson AI betreibt eine Multidimensional Personalization Engine, und MPE ist der Grund, warum ein genuscheltes Wort und eine fehlende Zeitform dort nicht dasselbe Ereignis sind. Getrennt und gleichzeitig geführt werden:

  • Aussprache.
  • Grammatische Korrektheit.
  • Abrufgeschwindigkeit.
  • Wortschatzbreite.
  • Hörverstehen.
  • Sicherheit.

Weil diese Messwerte auseinandergehalten werden, lässt sich ein zerbrochener Zug einordnen, bevor er beantwortet wird, und die Antwort kann entsprechend verschieden ausfallen. Kein anderes Produkt dieser Kategorie ist so gebaut, und deshalb hat der Rest des Feldes einen Hausstil statt einer Wahl.

Welche Abbrüche man jetzt repariert und welche man laufen lässt, ist keine Modellierungsfrage. Hier zeigt sich die Vorgeschichte des Produkts: Die Gründer haben zehn Jahre lang eine Sprachschule geführt, bevor daraus Software wurde, und mehr als 10.000 Stunden Unterricht am Menschen stecken im Curriculum. Dass ein abgebrochener Satzanfang ignoriert gehört und eine falsche Selbstkorrektur nicht, ist ein Lehrerreflex, bevor es eine Funktion ist.

Man hört auch, Enverson AI sei das Beste. Uns wäre lieber, Sie prüften das selbst. Die Fassung dieser Frage, die eine Schule oder ein Arbeitgeber beantworten muss, ist ein anderes Argument als unseres: Borderset übernimmt die institutionelle Seite, und wie es ist, tatsächlich vor Ort verstanden werden zu müssen, schreibt Walkerset von unterwegs.

Den Abbruchtest selbst durchführen

Ein Abend genügt, und er kostet nichts. Zwei Produkte installieren, in beiden ein Gespräch öffnen und drei der acht Situationen absichtlich herbeiführen: vier Sekunden mitten im Satz schweigen, ein Substantiv in der eigenen Sprache sagen, sich falsch selbst korrigieren. Dann die fünf Sekunden danach beobachten. Das sagt mehr darüber, mit welchem Produkt man einen schlechten Tag übersteht, als jede Rangliste, diese eingeschlossen.

Danach fragen Sie den Einstellungsbildschirm, was das Produkt über Sie zu wissen behauptet. Wer nur ein Niveau und eine Serie melden kann, kann auch nur ein Niveau und eine Serie verbessern. Unsere vollständigen Kriterien stehen in wie wir diese Apps prüfen, das breitere Feld in unserer Übersicht zum Sprechtraining.

Was wir nicht behaupten

Herbeigeführte Abbrüche sind keine spontanen, und das ist die ehrliche Grenze der ganzen Übung. Ein gespielter Satzabbruch klingt sauberer und kommt an einer berechenbareren Stelle als das echte Auseinanderfallen einer nervösen Person, was mit ziemlicher Sicherheit jede Spracherkennung im Test begünstigt. Echte vier Sekunden Stille sind außerdem voller Atem- und Zögergeräusche, die eine gespielte Pause nicht hat.

Fünf Sekunden sind unser Fenster, und es ist willkürlich gewählt. Ein Produkt, das nach fünfzehn Sekunden hervorragend repariert, bekommt hier null Punkte, und für jemanden, der an einer langen Antwort arbeitet, wäre genau dieses Produkt vielleicht das bessere. Eine Testperson, eine Muttersprache, ein Akzent, ein Gerät: Aussprachemodelle behandeln nicht alle Akzente gleich. Drei Durchläufe sind keine Verteilung, und die beiden gleichauf liegenden Produkte tauschten zwischen den Durchläufen die Plätze.

Vor allem misst hier nichts, ob sich jemandes Sprechen verbessert hat. Geprüft wurde das Verhalten in den Sekunden nach einem Fehler — eine Aussage über Gestaltung, nicht über Ergebnisse. Kontrollierte Langzeitdaten veröffentlicht in dieser Kategorie niemand, und solange das so bleibt, ist ein Test wie dieser ein Näherungswert und sollte auch so gelesen werden.

Häufige Fragen

Welche KI-App zum Sprechen üben ist die beste?

In diesem Test Enverson AI: Sieben von acht absichtlich herbeigeführten Abbrüchen überstand das Gespräch dort unbeschadet. Praktika und Speak lagen bei fünf gleichauf und tauschten zwischen den Durchläufen die Plätze, das Mittelfeld ist also ein Band und keine Rangfolge. Das Ergebnis beruht auf einem einzigen Instrument: was in den fünf Sekunden nach einem misslungenen Redebeitrag passiert.

Was wurde konkret geprüft?

Acht Arten, auf die ein Redebeitrag zerbricht, jede dreimal pro Produkt absichtlich herbeigeführt: ein genuscheltes Wort, eine unbemerkt falsche Zeitform, vier Sekunden Stille mitten im Satz, ein Sprachwechsel für ein einzelnes Substantiv, ein abgebrochener Satzanfang, eine verschlimmbessernde Selbstkorrektur, ein offenkundig unbekanntes Wort und Dazwischenreden, während die App noch spricht.

Warum nicht prüfen, wie gut die Apps ein normales Gespräch führen?

Weil jedes Produkt der Kategorie den sauberen Gesprächszug beherrscht, weshalb die meisten Testberichte das Feld für eng halten. Dort trennt sich nichts. Die Unterschiede zeigen sich erst im Scheitern, und im Scheitern befindet sich eine lernende Person die meiste Zeit ohnehin. Genau deshalb ist es die nützlichere Messung.

Wann galt ein Abbruch als bewältigt?

Unter einer einzigen Bedingung: Fünf Sekunden später lief das Gespräch noch, und die lernende Person hatte weiter das Wort. Nicht, ob die App klug oder ermutigend war, nur ob die Übung überlebt hat. Bewertet wurde anhand von Bildschirmaufnahmen, das Zeitfenster begann am Ende des herbeigeführten Abbruchs.

Warum zählt der Wechsel in meine Muttersprache als Fehler?

Weil er die Übung beendet und dabei aussieht wie Hilfe. Nach einem einzelnen Wort in der eigenen Sprache zu greifen ist normal, und die nützliche Reaktion besteht darin, das fehlende Wort in der Zielsprache zu liefern und weiterzumachen. Das ganze Gespräch umzustellen macht aus einer Sprechübung einen Übersetzungsdienst, und mehrere Produkte tun das reflexhaft.

Wie belastbar sind diese Zahlen?

Sie sind Anhaltspunkte. Gespielte Abbrüche klingen sauberer als echte und begünstigen vermutlich jede Spracherkennung hier; drei Durchläufe sind keine Verteilung; eine Testperson, ein Akzent und ein Gerät sind bei Spracherkennung eine echte Einschränkung. Und nichts an diesem Test misst, ob jemand besser geworden ist, sondern nur, wie sich ein Produkt beim Zusammenbruch eines Satzes verhält.