2026-07-14 · 7 Min. gelesen · Daniel Reyes, ABOC
Wie KI-Übersetzungsbrillen tatsächlich funktionieren
Bei Übersetzungsbrillen handelt es sich um vier separate Technologien, die vorgeben, ein einziges Produkt zu sein. Das Verstehen der Kette erklärt jede Stärke und jeden Fehler, den Sie erleben werden.
Die vierstufige Kette erklärt niemand an der Kasse
When somebody speaks to you and translated audio appears in your ear a second later, four things happened in sequence. First, beamforming microphones in the temples isolated the speaker's voice from the room. Second, a speech-recognition model turned that audio into text. Third, a machine translation model converted the text into your language. Fourth, a text-to-speech engine spoke it back through the open-ear driver next to your ear.
Jeder dieser Schritte hat seine eigene Fehlerquote, und die Fehler verstärken sich. Wenn das Mikrofon 90% der Wörter sauber erfasst und der Erkenner 95% davon richtig erfasst, haben Sie bereits mehr als ein Zehntel des Satzes verloren, bevor die Übersetzung beginnt. Aus diesem Grund sollten Marketingaussagen über eine „99%-prozentige Genauigkeit“ als Aussagen über ein Glied in einer viergliedrigen Kette gelesen werden.
Es erklärt auch den größten praktischen Unterschied zwischen guten und mittelmäßigen Übersetzungsbrillen: die Mikrofonqualität. Ein Paar mit zwei gut platzierten Beamforming-Mikrofonen in einem ruhigen Café übertrifft ein Paar mit einem einzelnen omnidirektionalen Mikrofon und einem weitaus besseren Übersetzungsmodell. Hardware legt die Decke fest; Software entscheidet nur, wie nah man ihr kommt.
Latenz ist die Funktion, die Sie tatsächlich spüren
Genauigkeit entscheidet über das Marketing, aber die Latenz entscheidet darüber, ob sich ein Gespräch menschlich anfühlt. Untersuchungen zum Abwechseln bei natürlicher Sprache beziffern die durchschnittliche Lücke zwischen Sprechern auf etwa 200 Millisekunden. Jedes Übersetzungssystem fügt darüber hinaus eine Verzögerung hinzu, und sobald die Gesamtverzögerung etwa 1.5 Sekunden überschreitet, fangen die Leute an, übereinander zu reden, und das Gespräch bricht in eine unangenehme Staffelung zusammen.
Zwei Designentscheidungen dominieren die Latenz. Der erste ist der Ort, an dem die Verarbeitung stattfindet. On-Device-Modelle sind schnell, aber klein, sodass sie weniger genau übersetzen; Cloud-Modelle sind genau, fügen aber einen Netzwerk-Roundtrip hinzu, der bei Hotel-WLAN brutal sein kann. Die zweite Frage ist, ob das System vor der Übersetzung auf einen vollständigen Satz wartet. Das Warten verbessert die Grammatik erheblich – in vielen Sprachen steht das Verb am Ende –, es stellt aber auch sicher, dass Sie die Übersetzung erst hören, nachdem der Sprecher fertig ist.
Wenn Sie ein Paar testen, testen Sie es nicht, indem Sie einen Absatz vorlesen. Testen Sie es in einem tatsächlichen Hin- und Her-Austausch, denn das ist das einzige Szenario, in dem sich Latenz zeigt.
Warum Lärm die Leistung schneller zerstört als Entfernung
Der Instinkt geht davon aus, dass die Übersetzung schlechter wird, wenn der Sprecher weit entfernt ist. In der Praxis ist die Distanz weniger wichtig als die konkurrierende Rede. Beamforming kann eine direkt von Ihnen kommende Stimme verstärken und Geräusche von der Seite unterdrücken, es kann jedoch nicht zwischen zwei menschlichen Stimmen unterscheiden, die aus derselben Richtung kommen. Ein geschäftiges Restaurant mit einem lauten Tisch hinter Ihrem Gesprächspartner ist dem schlimmsten Fall nahe.
Praktische Gegenmaßnahmen sind unscheinbar, aber effektiv: Stellen Sie sich so hin, dass der Rücken Ihres Partners dem Lärm zugewandt ist, kürzen Sie die Sätze und machen Sie eine Pause zwischen ihnen. Benutzer, die dies tun, berichten von wesentlich besseren Ergebnissen als Benutzer, die erwarten, dass die Brille einer überfüllten Bar standhält.
Aus diesem Grund sind gerade beim Übersetzen Freisprecher wichtig. Wenn die Ausgabe Ihre Ohren bedecken würde, würden Sie die ursprüngliche Sprache vollständig verlieren, und die ursprüngliche Sprache ermöglicht es Ihrem Gehirn, die Fehler der Maschine in Echtzeit zu korrigieren.
Was Sie realistischerweise erwarten können
Setzen Sie die richtigen Erwartungen und eine Übersetzungsbrille ist transformativ. Essen bestellen, nach dem Weg fragen, einer Führung folgen, den Hotel-Check-in abwickeln und ein langsames persönliches Gespräch führen – all das funktioniert mit der aktuellen Hardware gut. Bei juristischen, medizinischen und technischen Gesprächen ist dies nicht der Fall – das Vokabular ist spezialisiert und die Kosten eines Fehlers sind zu hoch.
Die andere realistische Erwartung ist die Batterie. Die Übersetzung ist die leistungsintensivste Funktion dieser Brille, da sie gleichzeitig die Mikrofone, das Radio und den Lautsprecher betreibt. Ein Paar, das für einen ganzen Tag bei gemischter Nutzung ausgelegt ist, liefert keine kontinuierliche Übersetzung für einen ganzen Tag, und im Kleingedruckten gibt der Hersteller keine anders lautenden Angaben.
Betrachten Sie die Live-Übersetzung als Hilfsmittel und nicht als Ersatz für Sprachkenntnisse, und Sie werden zufrieden sein. Betrachten Sie es wie einen universellen Science-Fiction-Übersetzer, und Sie werden innerhalb einer Stunde enttäuscht sein.