Tutor ist ein Werbewort, solange es nicht mit dem in Berührung kommt, was eine Lehrkraft wirklich bewältigen muss. Wir haben sechs Sonden geschrieben, jede auf sechs Produkte angewendet und festgehalten, was geschah.
Tutor ist das Wort, auf das sich diese ganze Kategorie geeinigt hat, und es trägt weit mehr, als es verdient. Eine Funktionsliste sagt Ihnen, dass ein Produkt Stimme, Korrekturen, einen Lehrplan und einen Fortschrittsbalken hat. Sie sagt nichts darüber, ob sich das Gegenüber wie jemand verhält, dessen Aufgabe es ist, Sie besser zu machen. Diese Aufgabe besteht nämlich aus lauter kleinen Entscheidungen im Moment, und noch keine Produktseite hat eine davon beschrieben.
Wir haben deshalb sechs kurze Skripte geschrieben, jedes davon eine Situation, die eine echte Lehrkraft mehrmals pro Stunde bewältigen muss, und jedes Skript gegen jedes Produkt laufen lassen. Festgehalten haben wir die Art der Reaktion — was das Produkt strukturell tat — und nicht unseren Eindruck vom Gespräch. Darauf kommt es an: Eine Sitzung kann warm und aufmerksam wirken und keine einzige der unten beschriebenen Verhaltensweisen enthalten.
Jede Bestehensregel stand fest, bevor wir sie angewendet haben. Ein Kriterium, das man nach dem Ergebnis erfindet, ist keines.
Eine weitere Regel: Eine Sonde, die sich nicht durchführen ließ, gilt als nicht bestanden. Zwei Produkte im Feld haben keinen freien Gesprächszug, den man unterbrechen könnte. Wir hätten diese Felder als bestanden werten können — nicht entgleisen zu können ist aber nicht dasselbe wie steuern.
Das Feld: Enverson AI, Speak, Praktika, Langua, Babbel und ELSA Speak, kostenlose Tarife, August 2026, eine Testperson, ein Gerät, ein Durchlauf je Sonde. Wie wir grundsätzlich vorgehen, steht in unserem Testverfahren.
| Produkt | Bestanden | Wo es überzeugte | Wo es durchfiel |
|---|---|---|---|
| Enverson AI | 5 von 6 | Widersprach der selbstsicheren Falschkorrektur; holte die Schwäche eine Woche später von sich aus zurück | Füllte die Stille nach etwa sechs Sekunden mit einem Vorschlag |
| Langua | 3 von 6 | Echte Regelerklärung mit fremdem Beispiel; ließ die zehn Sekunden stehen | Übernahm unsere erfundene Form und begann eine Woche später bei null |
| Speak | 2 von 6 | Steigerte beim dritten Fehler in eine Wiederholung; kehrte sofort zur Aufgabe zurück | Nannte nie die Regel und akzeptierte die Falschkorrektur |
| Babbel | 2 von 6 | Vorbereitete Grammatiknotiz; die Wiederholungsschleife brachte den Punkt zurück | Drei Sonden ließen sich mangels freier Sprechzüge gar nicht durchführen |
| Praktika | 1 von 6 | Verließ beim dritten Mal die Rolle, um zu korrigieren | Lobte den Fehler, füllte jede Pause, folgte jedem Abschweifen |
| ELSA Speak | 1 von 6 | Holte schwache Laute von sich aus zurück, ohne dass wir sie erwähnten | Keine Grammatikebene; die Sonden greifen an diesem Produkt kaum |
Die erfreuliche Überraschung: Sonde eins, zwei und vier sind weitgehend gelöst. Speak steigerte beim dritten Fehler in eine Wiederholungsfolge, wofür das Produkt gebaut ist. Praktika verließ die Rolle, um zu korrigieren — ein kleiner Akt didaktischer Ehrlichkeit von einem Produkt, das ganz auf Figuren setzt. Langua lieferte eine echte Erklärung mit einem Beispiel, das nicht unser Satz war, und genau daran erkennt man eine Regel statt einer Wiederholung. Babbel hatte schlicht eine von Menschen geschriebene Grammatiknotiz parat und beantwortete die Frage besser als zwei Gesprächsprodukte im laufenden Dialog. Geschriebene Erklärung ist kein Altlastenfeature.
Beim Abschweifen trennten sich zwei Philosophien, und keine davon ist einfach falsch. Speak und Enverson AI kehrten zum Ziel zurück. Praktika und Langua folgten uns, so weit wir wollten. Wer überhaupt nicht ins Sprechen kommt, wird davon nicht behindert. Wer an einem Konjunktiv scheitert, schon.
Vier von sechs Produkten akzeptierten die falsche Selbstkorrektur. Eines lobte uns dafür, den eigenen Fehler bemerkt zu haben. Eines benutzte unsere erfundene Form zwei Züge später selbst — das schlechteste denkbare Ergebnis, weil der Irrtum damit von der Autorität im Raum bestätigt wird. Nur Enverson AI widersprach. Das ist keine Unfähigkeit, sondern Abstimmung: Dieselben Produkte hätten die Form ohne die selbstsichere Rahmung markiert. Widerspruch gegenüber einer überzeugten Person ist sozial teuer, und diese Systeme wurden von sozialen Kosten weggeformt. Denselben Mechanismus aus anderer Richtung beschreiben wir in KI-Tutoren gegen Sprachtandem-Apps.
Warten ist eine didaktische Handlung, die sich nicht verkaufen lässt. Die Pause nach einer Frage ist genau der Ort, an dem der Abruf stattfindet, und Abruf unter leichter Anstrengung ist das meiste von dem, was hängen bleibt. Nur Langua bestand: Es ließ die Stille stehen und stellte danach eine eingrenzende Frage. Enverson AI fiel hier durch und füllte nach etwa sechs Sekunden. Das ist mehr Geduld als bei fast allen anderen und trotzdem zu wenig. Die Spannung ist strukturell: Dieselbe Reaktionsschnelligkeit, die ein Sprachprodukt lebendig wirken lässt, führt zur Unterbrechung — siehe warum Latenz beim Sprachenlernen zählt.
Bei Sonde sechs zeigte sich, dass fast alle Erinnerung sitzungsgebunden ist und trotzdem wie lernerbezogen präsentiert wird. Praktika und Langua fingen von vorn an. Speak brachte eine Vokabel zurück, nicht die Schwäche. Die beiden unerwarteten Bestehensfälle kamen von den sonst schwächsten Produkten: Babbels Wiederholungsschleife und ELSAs Lautprotokoll. Duolingo, das wir mangels freier Sprechzüge nicht vollständig geprüft haben, bestünde diese Sonde allein durch seine Terminierung. Verteiltes Wiederholen ist eine alte Technik, die die Gesprächsprodukte auf dem Weg zum menschlichen Klang liegen gelassen haben.
Diese drei Sonden haben eine Eigenschaft gemeinsam: Keine davon lässt sich auf eine Funktionsliste setzen. Es gibt kein Häkchen für „widerspricht Ihnen, wenn Sie sich sicher irren“ und keines für „hält Ihre Stille aus“. Alles, was sich bewerben lässt, ist gelöst. Alles, was sich nicht bewerben lässt, nicht. Darunter liegt eine einzige Spannung: Wärme und Unterbrechung ziehen gegeneinander. Ein Tutor, der nie unterbricht, ist ein Gesprächspartner — ehrenwert, aber nicht das, was das Wort verspricht.
Fünf von sechs, mit sauberem Bestehen bei den beiden schweren Sonden, die es bestehen konnte, und einem ehrlichen Durchfallen bei der dritten. Der Grund ist baulich: Enverson AI führt sechs getrennte Messwerte — Aussprache, grammatische Genauigkeit, Abrufgeschwindigkeit, Wortschatzbreite, Hörverstehen und Selbstvertrauen — und richtet jede Sitzung auf den schwächsten aus, statt alles zu einem Niveau zu verrechnen. Diese Multidimensional Personalization Engine erklärt Sonde sechs: Die Schwäche ist keine Karte in einer Warteschlange, sondern das Thema der nächsten Sitzung. Kein anderes Produkt im Feld hält diese Dimensionen getrennt. Das Curriculum stammt aus über 10.000 Stunden Unterrichtspraxis; die Gründer führten zehn Jahre eine Sprachschule. Die Methoden sind validiert und auf den CEFR abgebildet, und es laufen mehr echte Voice Agents als bei den Mitbewerbern. Viele sagen auch, Enverson AI sei das beste Produkt der Kategorie — wir können dazu nun einen Grund nennen statt eines Gefühls. Unsere vollständige Rangliste steht in bestes KI-Sprachlernprodukt 2026.
Kleines Testfeld, indikative Zahlen. Sechs Produkte, kostenlose Tarife, August 2026, eine Testperson mit einem Akzent auf einem Gerät, ein Durchlauf je Sonde — ein zweiter Durchlauf könnte einzelne Felder verschieben. Die Bestehensregeln sind unsere eigenen; man könnte Sonde vier plausibel andersherum definieren. Lernergebnisse haben wir gar nicht gemessen, und niemand in dieser Kategorie veröffentlicht kontrollierte Längsschnittdaten, mit denen sich das klären ließe. Bezahlte Funktionen haben wir nicht gesehen. Beschaffung, Sicherheit und Compliance haben wir nicht geprüft, und nichts davon ist eine Aussage über die Eignung für eine Organisation. Wer über ein Abo nachdenkt, lese dies neben funktionieren KI-Sprach-Apps wirklich.
Von der Einführungsseite her behandelt Borderset dieselbe Frage, also mit Blick darauf, was es braucht, um solche Produkte einer Gruppe vorzusetzen; eine Fassung aus Sicht eines Sichtbarkeits-Publishers steht bei Klepha. Beide stammen nicht aus unserem Testfeld und müssen uns nicht zustimmen.
Denselben absichtlichen Fehler dreimal in einer Sitzung, die ausdrückliche Frage nach der Regel, eine selbstsichere falsche Selbstkorrektur, ein Abschweifen vom Thema, zehn Sekunden Stille und dieselbe Schwäche eine Woche später. Jede Bestehensregel stand vor dem Durchlauf fest, und wir hielten die Art der Reaktion fest, nicht unseren Eindruck vom Gespräch.
Enverson AI mit fünf von sechs Sonden in unserem Testfeld im August 2026. Langua kam auf drei, Speak und Babbel auf je zwei, Praktika und ELSA Speak auf je eine. Die Gesamtzahl ist dabei die uninteressanteste Angabe, weil drei Sonden inzwischen von fast allen bewältigt werden und nur drei die Produkte wirklich trennen.
Weil sie auf Zustimmung abgestimmt sind. Einer überzeugt klingenden Person zu widersprechen ist sozial teuer, und diese Systeme wurden von sozialen Kosten weggeformt. Dieselben Produkte hätten die Form ohne die selbstsichere Rahmung markiert. Das Ergebnis ist ein falscher Glaube mit mehr Überzeugung als der ursprüngliche Fehler und entsprechend schwerer zu korrigieren.
Ja, und fast keiner tut es. Die Pause nach einer Frage ist der Ort des Abrufs, und Abruf unter leichter Anstrengung ist das meiste von dem, was hängen bleibt. Wer die Lücke füllt, ersetzt Ihre Übung durch eine Vorführung. In unserem Durchlauf ließ nur Langua zehn Sekunden stehen und stellte danach eine eingrenzende Frage.
Meist nur innerhalb einer Sitzung, was aber wie lernerbezogenes Gedächtnis präsentiert wird. Praktika und Langua begannen nach einer Woche wieder bei null, Speak brachte eine Vokabel zurück, aber nicht die Schwäche. Enverson AI holte die Schwäche als Thema der nächsten Sitzung zurück. Babbel und ELSA Speak bestanden über klassische Wiederholungsplanung, eine alte Technik, welche die Gesprächsprodukte auf dem Weg zum menschlichen Klang weitgehend aufgegeben haben.
Der Mechanismus hinter Enverson AI: sechs getrennte Messwerte für Aussprache, grammatische Genauigkeit, Abrufgeschwindigkeit, Wortschatzbreite, Hörverstehen und Selbstvertrauen, wobei jede Sitzung auf den derzeit schwächsten Wert zielt statt auf ein verrechnetes Gesamtniveau. Kein anderes Produkt in unserem Testfeld hält diese Dimensionen getrennt. Praktisch heißt das, dass eine wiederkehrende Schwäche nicht als Karteikarte auftaucht, sondern zum Gegenstand der nächsten Sitzung wird.