Wie schnell antwortet ein KI-Avatar auf der Bühne?
1,5–2 s
bis zum ersten Ton
gemessen · live
live mit Personen im Raum, im Median rund 2 s · im Labor 1,7–1,8 s
Kurz gesagt
In 1,5–2 s. So viel Zeit verging live am Laptop, mit Personen im Raum, vom letzten Wort des Aufrufs bis zum ersten hörbaren Ton, im Median rund zwei Sekunden. Schneller als rund 1,5 s geht es kaum, weil der KI-Avatar erst das Satzende erkennen und dann seine Stimme erzeugen muss. Eine Antwort in unter einer Sekunde versprechen wir nicht.
Stand 2. Oktober 2026
01Erster Test
Knapp vier Sekunden im ersten Live-Test
Zum ersten Mal hörte der KI-Avatar Menschen, die frei sprachen, statt eingespielter Stimmen. Zwei Personen sassen vor einem Laptop, dessen eingebautes Mikrofon sein einziges Ohr war. Bis zum ersten Ton vergingen im Median knapp vier Sekunden, mehr als doppelt so lang wie im Labor.
Vermeidbar war vor allem eine Stelle, die im Raum niemand hörte. Bei fast jedem Aufruf prüfte das System zuerst eigens, ob der KI-Avatar überhaupt gemeint war. Das allein dauerte live rund eine Sekunde, einmal mit Wartezeit drei Sekunden.
Dazu kam die Art, wie Menschen reden. Wer frei spricht, setzt nach einer kurzen Pause noch einmal an oder hängt ein «äh» an. Die Spracherkennung erkannte das Satzende dann später als bei den sauberen Aufnahmen aus dem Labor.
Wer den Aufruf mit seinem Namen begann, ersparte ihm diese Prüfung. Wo der Name nicht vorne stand, brauchte sie im nächsten Lauf weniger als eine Sekunde. Später sank der Median auf rund zwei Sekunden.
02Messung
Die Uhr läuft ab dem letzten Wort
Ein Beispiel: Die Moderation fragt «Albert, wie siehst du das?». Die Uhr startet nach «das» und stoppt beim ersten Laut, den man vom KI-Avatar hört. Was die Moderation vorher sagt, eine Ankündigung etwa, zählt nicht mit.
Stand der Name in der Frage, vorne oder hinten, war der KI-Avatar live nach rund zwei Sekunden zu hören. Kam der Name allein nach der Frage, dauerte es gut vier Sekunden.
- 1,5–2 sbis zum ersten Ton, liveam Laptop, Moderation und Gast sprechen frei · im Median rund zwei Sekunden
- 1,7–1,8 sbis zum ersten Ton, im Laboreingespielte Diskussion · Satzenden früher erkannt als live
- 1,5 sUntergrenze, gerundetSatzende erkennen, dann Stimme erzeugen · schneller geht es kaum
Der Median glättet. Schon innerhalb einer Diskussion kam die schnellste Antwort nach gut anderthalb Sekunden, die langsamste nach gut zweieinhalb.
03Untergrenze
Zwei Schritte, die jede Antwort braucht
- 01
Pausenerkennung
Der KI-Avatar muss hören, dass die Moderation fertig ist. Eine kurze Denkpause ist noch kein Satzende. Er wartet auf eine kurze Stille, und setzt sie wieder an, wartet er weiter.
- 02
Sprachsynthese
Aus dem Text der Antwort wird Stimme. Allein dieser Schritt braucht knapp eine Sekunde, bis der erste Laut zu hören ist.
Zusammen ergibt das rund 1,5 s. Kürzer warten hiesse, in Denkpausen hineinzureden und halbe Sätze zu beantworten.
04Einstieg
Was der Saal in diesen zwei Sekunden hört
Nach der Frage bleibt es kurz still. Dann sagt der KI-Avatar «Also.», «Hm.» oder «Nun.». Dieses Wort ist der erste Ton, den unsere Messung erfasst, und es trägt noch keinen Inhalt.
Der Inhalt folgt mit etwas Abstand. Live kam er meist eine bis knapp zwei Sekunden nach Beginn des Einstiegsworts. Vom letzten Wort der Frage an gerechnet hörte man den ersten Satz mit Inhalt meist nach knapp drei bis gut vier Sekunden. Diesen Satz formuliert er im Wissen, welches Wort schon gesprochen ist, und knüpft daran an.
Für die Moderation ist die Pause kürzer als für den Saal. Auf ihrem Tablet erscheint der Text der Antwort, bevor der Saal ihren Inhalt hört, meist gut eine Sekunde vorher. Nur das Einstiegswort kommt ohne Text.
05Fragen
Wann dauert es länger?
Dauert eine Nachfrage ohne Namen länger?
Etwas länger. Nach einer Antwort bleibt er eine Weile im Gespräch, und ein «Und warum?» genügt. Auf eine solche Nachfrage, etwa die Bitte, das Gesagte genauer zu erläutern, setzt er im Median nach gut zwei Sekunden ein, auf einen Aufruf mit Namen nach knapp zwei.
Antworten alle vier Charaktere gleich schnell?
Ja, die Werte dieser Seite gelten für jeden von ihnen. Albert, Vera, Tina und Ken unterscheiden sich in Haltung, Gesicht und Stimme. Darunter liegt dieselbe Technik, und alle warten mit derselben Pausenerkennung auf das Satzende.
Nach unseren Werten vom Laptop rechnen Sie für Ihren Ablauf nach jedem Aufruf mit rund zwei Sekunden bis zum Einstiegswort und ein bis zwei weiteren, bis der erste Satz mit Inhalt kommt. Bei zehn Aufrufen in einer Stunde sind das zusammen eine halbe Minute oder etwas mehr.