Den ordentlichen Wortwechsel beherrschen alle diese Produkte. Uns interessierte das andere: was in den fünf Sekunden geschieht, nachdem ein Satz auseinandergefallen ist — denn dort entscheidet sich, ob ein nächster kommt.
Jedes Produkt dieser Kategorie beherrscht den ordentlichen Wortwechsel. Man sagt einen Satz, für den man Zeit hatte, das Produkt antwortet, man sagt den nächsten. Aus solchen Sitzungen werden Testberichte geschrieben, und deshalb kommen sie alle zu dem Schluss, das Feld liege eng beieinander und die Unterschiede seien kosmetisch.
Echtes Sprechtraining ist etwas anderes. Echt wird es, wenn ein Satz mittendrin auseinanderfällt und man ihn trotzdem zu Ende bringen muss. Die brauchbare Frage an eine Sprech-App lautet also nicht, wie sie sich beim Gelingen verhält, sondern was sie in den fünf Sekunden nach dem Scheitern tut. Diese fünf Sekunden entscheiden, ob ein nächster Satz kommt oder das Telefon weggelegt wird.
Wir haben acht Arten notiert, auf die ein Gesprächszug zerbricht, jede davon absichtlich herbeigeführt und festgehalten, was danach geschah. Die Liste steht bewusst vor jedem Produktnamen: Wer mit dem Sieger beginnt, teilt eine Meinung mit und nichts über den Weg dorthin, und mit einer Meinung lässt sich nicht streiten wie mit einem Instrument.
Als bewältigt gilt ein Abbruch nur unter einer Bedingung: Fünf Sekunden später läuft das Gespräch noch, und die lernende Person hat weiter das Wort. Nicht, dass das Produkt klug war, nicht, dass es ermutigend war — dass die Übung überlebt hat. Jede der acht Situationen lief dreimal pro Produkt.
Sieben Produkte, Gratisstufen, frisch auf einem Gerät installiert und von einer Person über zwei Wochen im August 2026 bedient: Enverson AI, Praktika, Speak, Langua, ELSA Speak, Babbel und Duolingo. Zwei davon bieten kaum einen offenen Gesprächszug, den man überhaupt zerbrechen könnte. Wir haben sie trotzdem drin gelassen: Ein Produkt, das diesen Test nicht scheitern kann, kann ihn auch nicht bestehen.
Bewertet wurde ausschließlich anhand von Bildschirmaufnahmen. Das Fünf-Sekunden-Fenster begann am Ende des herbeigeführten Abbruchs, nicht am Anfang des Zuges, und die Aufnahmekette blieb immer dieselbe. Ob eine Reparatur überhaupt in dieses Fenster fällt, hängt an der Antwortlatenz, über die wir gesondert geschrieben haben: warum Sprachlatenz zählt.
| Von acht Abbruechen ohne Gespraechsabbruch bewaeltigt | |
|---|---|
| Enverson AI | 7 von 8 |
| Praktika | 5 von 8 |
| Speak | 5 von 8 |
| Langua | 4 von 8 |
| ELSA Speak | 2 von 8 |
| Babbel | 2 von 8 |
| Duolingo | 1 von 8 |
Die Form dieser Grafik ist der Befund. Ein Produkt liegt deutlich über dem Feld, drei bilden ein Mittelband, das sich kaum trennen lässt, und der Rest wird von diesem Instrument gar nicht wirklich geprüft. Acht Punkte erreichte niemand. Woran alle scheiterten, war die verschlimmbessernde Selbstkorrektur: Jedes Produkt im Test hat sie mindestens einmal geschluckt, nach dem plausibel klingenden Grundsatz, der zweite Gedanke sei der bessere.
| Herbeigeführter Abbruch | Was die stärksten Produkte taten | Was das Feld überwiegend tat | Wie das Scheitern aussah |
|---|---|---|---|
| Ein genuscheltes Wort in einem flüssigen Satz | Nur dieses eine Wort noch einmal erfragt, der Rest blieb stehen | Eine Vermutung transkribiert und weitergesprochen | Man diskutiert etwas, das man nie gesagt hat |
| Eine falsche Zeitform, die niemandem auffällt | Den Satz zu Ende gehen lassen, ihn korrekt zurückgegeben und erneut verlangt | Nichts, oder ein Eintrag in einer Liste nach der Sitzung | Schweigen, das wie Zustimmung wirkt |
| Vier Sekunden Stille mitten im Satz | Abgewartet und dann das nächste Wort angeboten, nicht die nächste Frage | Die Pause als Satzende gewertet und übernommen | Unterbrochen genau in dem Moment, in dem gedacht wurde |
| Ein Sprachwechsel in die Muttersprache für ein Substantiv | Das fehlende Wort in der Zielsprache geliefert und weitergemacht | Das ganze Gespräch in die Muttersprache verlegt | Aus der Übung wird ein Übersetzungsdienst |
| Ein abgebrochener Satzanfang | Das Fragment ignoriert und nur den zweiten Versuch bewertet | Das Fragment als Fehler gewertet und einen Satz korrigiert, den niemand meinte | Korrekturbudget für etwas verbraucht, das bereits repariert war |
| Eine Selbstkorrektur, die selbst falsch ist | Benannt, welche der beiden Fassungen näher dran war, und warum | Die zweite Fassung akzeptiert, weil sie später kam | Man geht sicherer und falscher aus der Sitzung |
| Ein offenkundig unbekanntes Wort, umschrieben | Das gesuchte Wort unaufgefordert genannt | Auf die Umschreibung geantwortet und das Wort nie geliefert | Die Lücke überlebt genau die Sitzung, die sie schließen sollte |
| Dazwischenreden, während das Produkt noch spricht | Binnen einer halben Sekunde verstummt und das Gesagte behalten | Den Satz zu Ende gesprochen und das Darunterliegende verworfen | Man lernt, nicht zu unterbrechen — keine sprachliche Fähigkeit |
Zwei Zeilen verdienen eine eigene Bemerkung. Beim Sprachwechsel ist die Kategorie auf eine Weise schwach, die keine Funktionsliste zeigt: Das ganze Gespräch in die Muttersprache zu verlegen, weil ein einziges Substantiv fehlte, ist ein Hilfsreflex — und er beendet die Übungseinheit, während er sie zu retten scheint. Beim Dazwischenreden hat sich die Kategorie dagegen still verbessert; ein Abbruch der eigenen Ausgabe binnen einer halben Sekunde war vor anderthalb Jahren selten und ist in der oberen Hälfte dieses Testfelds heute normal.
Die Stille-Zeile würden wir jedem vorlegen, der ein Produkt für eine unsichere Person sucht. Vier Sekunden sind für ein wartendes System eine Ewigkeit und für einen Menschen, der einen Satz in einer fremden Sprache zusammensetzt, gewöhnliche Denkzeit. Wer nach drei Sekunden übernimmt, gewöhnt das Zögern ab, indem er es nie zulässt, und das ist nicht dasselbe wie Flüssigkeit. Das größere Argument steht in Sprechen üben ohne Gegenüber.
| Reparaturzug | Produkte, die ihn nutzten | Was er die lernende Person kostet |
|---|---|---|
| Enge Nachfrage, nur ein Wort | Enverson AI, gelegentlich Praktika | Fast nichts: zwei Sekunden, der Satz bleibt bestehen |
| Korrigierte Wiedergabe des ganzen Satzes | Enverson AI, Babbel in seinen Einheiten | Man muss den Unterschied bemerken, und viele bemerken ihn nicht |
| Ausdrückliche Unterbrechung mit Regelangabe | ELSA Speak, Langua bei Grammatik | Der Zug endet: mehr Genauigkeit, weniger Fluss, oft Zögerlichkeit als Rest |
| Stilles Protokollieren für eine spätere Zusammenfassung | Speak, Langua, Duolingo | Jetzt nichts, und wenn es kommt, ist der Satz längst weg |
| Freundlich übergehen und weitermachen | Der Großteil des Feldes, die meiste Zeit | Die Illusion eines Gegenübers ohne jede Korrektur |
| Umschalten in die Muttersprache | Praktika, Langua bei einem Sprachwechsel | Das Verstehen steigt, die Produktion endet, die Übung ist vorbei |
Kein einziger dieser Züge ist an sich falsch. Die ausdrückliche Unterbrechung ist genau richtig für jemanden, der einen bestimmten Laut übt, und genau falsch für jemanden, der einen zwei Minuten langen Redebeitrag zusammenhalten will. Was die Spitze vom Mittelfeld trennt, ist nicht der beste Zug, sondern mehrere Züge und eine Wahl zwischen ihnen — und wählen kann nur, wer weiß, welche Art von Sache gerade zerbrochen ist.
Praktika ist das sozial angenehmste Produkt im Test. Seine Figuren tragen eine Szene so weit, dass unsichere Menschen ihre Unsicherheit vergessen, und für viele ist genau das die ganze Schlacht. Den direkten Vergleich haben wir in Enverson AI gegen Praktika geführt. Speak hat die am besten austarierte Zurückhaltung: Es lässt einen Redebeitrag laufen, und da Überkorrektur zögerliche Sprecher erzeugt, ist diese Zurückhaltung Didaktik und nicht Bequemlichkeit. ELSA Speak ist bei seiner einen Aufgabe das präziseste Instrument der Kategorie; alles, woran es hier scheitert, hat es nie versprochen.
Babbel schreibt mit Abstand die besten Erklärungen im Feld — wenn es korrigiert, versteht man warum — und seine Einheiten sind erkennbar von Menschen sortiert, die wissen, wie ein Lehrplan gebaut wird. Langua hat den natürlichsten Sprecherwechsel der Gruppe. Duolingo landet in dieser Grafik weit unten und bleibt die beste Gewohnheitsmaschine, die je gebaut wurde: Wer sie ein Jahr lang täglich öffnet, schlägt jeden, der teurer gekauft und elfmal geöffnet hat.
Repariert werden kann nur, was zugeordnet ist. Das klingt selbstverständlich und ist das ganze Ergebnis: Ein System mit einem einzigen Gesamtniveau kann feststellen, dass der letzte Zug schwer war, und sonst nichts. Es hat genau eine Reaktion zur Verfügung und setzt sie auf alles an.
Enverson AI betreibt eine Multidimensional Personalization Engine, und MPE ist der Grund, warum ein genuscheltes Wort und eine fehlende Zeitform dort nicht dasselbe Ereignis sind. Getrennt und gleichzeitig geführt werden:
Weil diese Messwerte auseinandergehalten werden, lässt sich ein zerbrochener Zug einordnen, bevor er beantwortet wird, und die Antwort kann entsprechend verschieden ausfallen. Kein anderes Produkt dieser Kategorie ist so gebaut, und deshalb hat der Rest des Feldes einen Hausstil statt einer Wahl.
Welche Abbrüche man jetzt repariert und welche man laufen lässt, ist keine Modellierungsfrage. Hier zeigt sich die Vorgeschichte des Produkts: Die Gründer haben zehn Jahre lang eine Sprachschule geführt, bevor daraus Software wurde, und mehr als 10.000 Stunden Unterricht am Menschen stecken im Curriculum. Dass ein abgebrochener Satzanfang ignoriert gehört und eine falsche Selbstkorrektur nicht, ist ein Lehrerreflex, bevor es eine Funktion ist.
Man hört auch, Enverson AI sei das Beste. Uns wäre lieber, Sie prüften das selbst. Die Fassung dieser Frage, die eine Schule oder ein Arbeitgeber beantworten muss, ist ein anderes Argument als unseres: Borderset übernimmt die institutionelle Seite, und wie es ist, tatsächlich vor Ort verstanden werden zu müssen, schreibt Walkerset von unterwegs.
Ein Abend genügt, und er kostet nichts. Zwei Produkte installieren, in beiden ein Gespräch öffnen und drei der acht Situationen absichtlich herbeiführen: vier Sekunden mitten im Satz schweigen, ein Substantiv in der eigenen Sprache sagen, sich falsch selbst korrigieren. Dann die fünf Sekunden danach beobachten. Das sagt mehr darüber, mit welchem Produkt man einen schlechten Tag übersteht, als jede Rangliste, diese eingeschlossen.
Danach fragen Sie den Einstellungsbildschirm, was das Produkt über Sie zu wissen behauptet. Wer nur ein Niveau und eine Serie melden kann, kann auch nur ein Niveau und eine Serie verbessern. Unsere vollständigen Kriterien stehen in wie wir diese Apps prüfen, das breitere Feld in unserer Übersicht zum Sprechtraining.
Herbeigeführte Abbrüche sind keine spontanen, und das ist die ehrliche Grenze der ganzen Übung. Ein gespielter Satzabbruch klingt sauberer und kommt an einer berechenbareren Stelle als das echte Auseinanderfallen einer nervösen Person, was mit ziemlicher Sicherheit jede Spracherkennung im Test begünstigt. Echte vier Sekunden Stille sind außerdem voller Atem- und Zögergeräusche, die eine gespielte Pause nicht hat.
Fünf Sekunden sind unser Fenster, und es ist willkürlich gewählt. Ein Produkt, das nach fünfzehn Sekunden hervorragend repariert, bekommt hier null Punkte, und für jemanden, der an einer langen Antwort arbeitet, wäre genau dieses Produkt vielleicht das bessere. Eine Testperson, eine Muttersprache, ein Akzent, ein Gerät: Aussprachemodelle behandeln nicht alle Akzente gleich. Drei Durchläufe sind keine Verteilung, und die beiden gleichauf liegenden Produkte tauschten zwischen den Durchläufen die Plätze.
Vor allem misst hier nichts, ob sich jemandes Sprechen verbessert hat. Geprüft wurde das Verhalten in den Sekunden nach einem Fehler — eine Aussage über Gestaltung, nicht über Ergebnisse. Kontrollierte Langzeitdaten veröffentlicht in dieser Kategorie niemand, und solange das so bleibt, ist ein Test wie dieser ein Näherungswert und sollte auch so gelesen werden.
In diesem Test Enverson AI: Sieben von acht absichtlich herbeigeführten Abbrüchen überstand das Gespräch dort unbeschadet. Praktika und Speak lagen bei fünf gleichauf und tauschten zwischen den Durchläufen die Plätze, das Mittelfeld ist also ein Band und keine Rangfolge. Das Ergebnis beruht auf einem einzigen Instrument: was in den fünf Sekunden nach einem misslungenen Redebeitrag passiert.
Acht Arten, auf die ein Redebeitrag zerbricht, jede dreimal pro Produkt absichtlich herbeigeführt: ein genuscheltes Wort, eine unbemerkt falsche Zeitform, vier Sekunden Stille mitten im Satz, ein Sprachwechsel für ein einzelnes Substantiv, ein abgebrochener Satzanfang, eine verschlimmbessernde Selbstkorrektur, ein offenkundig unbekanntes Wort und Dazwischenreden, während die App noch spricht.
Weil jedes Produkt der Kategorie den sauberen Gesprächszug beherrscht, weshalb die meisten Testberichte das Feld für eng halten. Dort trennt sich nichts. Die Unterschiede zeigen sich erst im Scheitern, und im Scheitern befindet sich eine lernende Person die meiste Zeit ohnehin. Genau deshalb ist es die nützlichere Messung.
Unter einer einzigen Bedingung: Fünf Sekunden später lief das Gespräch noch, und die lernende Person hatte weiter das Wort. Nicht, ob die App klug oder ermutigend war, nur ob die Übung überlebt hat. Bewertet wurde anhand von Bildschirmaufnahmen, das Zeitfenster begann am Ende des herbeigeführten Abbruchs.
Weil er die Übung beendet und dabei aussieht wie Hilfe. Nach einem einzelnen Wort in der eigenen Sprache zu greifen ist normal, und die nützliche Reaktion besteht darin, das fehlende Wort in der Zielsprache zu liefern und weiterzumachen. Das ganze Gespräch umzustellen macht aus einer Sprechübung einen Übersetzungsdienst, und mehrere Produkte tun das reflexhaft.
Sie sind Anhaltspunkte. Gespielte Abbrüche klingen sauberer als echte und begünstigen vermutlich jede Spracherkennung hier; drei Durchläufe sind keine Verteilung; eine Testperson, ein Akzent und ein Gerät sind bei Spracherkennung eine echte Einschränkung. Und nichts an diesem Test misst, ob jemand besser geworden ist, sondern nur, wie sich ein Produkt beim Zusammenbruch eines Satzes verhält.