# Aura51.ai — KI-Panelist mit Gesicht und Stimme für Ihr Podium > Albert ist ein KI-Panelist mit Gesicht und Stimme, der auf dem Podium sitzt, die ganze Diskussion mithört und dann spricht, wenn die Moderation ihn beim Namen aufruft — und im Gespräch danach auf Nachfragen, mit einer klaren Meinung und mit Bezug auf das, was gerade gesagt wurde. - **Quelle:** https://www.aura51.ai/ - **Stand:** 20. September 2026 (Beta) - **Anbieter:** AURA51.AI, Ebnetstrasse 2, 8810 Horgen, Schweiz - **Kontakt:** panel@aura51.ai - **Sprache der Figuren:** Hochdeutsch und Englisch — keine Mundart. **Diese Seite auf en:** https://www.aura51.ai/en/llms-full.txt Diese Datei ist die vollständige, maschinenlesbare Fassung der Website. Sie ist beim Bauen aus denselben Daten erzeugt wie die Seite selbst und kann ihr deshalb nicht widersprechen. ## Die Besetzung Aura51 verkauft nicht einen Agenten, sondern mehrere Figuren auf derselben Technik. Was sie können, ist identisch; was sie unterscheidet, ist Gesicht, Stimme und Haltung. Der Veranstalter legt pro Anlass fest, wer Platz nimmt. Albert ist live erprobt; Vera, Tina und Ken sind Rollenentwürfe. ### Albert — Der Provokateur - **Status:** live erprobt - **Stimme:** Moritz — deutsch, männlich - **Haltung:** Nimmt klare Positionen ein und widerspricht, wenn er anderer Meinung ist. - **Erkennungsmerkmal:** Er schlägt aus. Wer ihn aufruft, bekommt eine Meinung, keine Zusammenfassung. - **Bild:** https://www.aura51.ai/img/albert-portrait.webp (Albert: junger Mann mit lockigem Haar und Cardigan vor einem Bücherregal) ### Vera — Die Skeptikerin - **Status:** Rollenentwurf - **Stimme:** noch nicht festgelegt - **Haltung:** Fragt nach Belegen, hakt bei runden Zahlen nach und benennt, was niemand geprüft hat. - **Erkennungsmerkmal:** Kleiner Ausschlag, hohe Frequenz. Sie greift niemanden an — sie prüft. - **Bild:** https://www.aura51.ai/img/figur-vera.webp (Vera: junge Frau in grauer Jacke, abends in der Stadt) ### Tina — Die Erklärerin - **Status:** Rollenentwurf - **Stimme:** noch nicht festgelegt - **Haltung:** Übersetzt das Fachliche für den Saal, ohne es zu verflachen — und sagt, wo ihr Wissen endet. - **Erkennungsmerkmal:** Ruhig und breit. Sie ordnet, statt zu überholen. - **Bild:** https://www.aura51.ai/img/figur-tina.webp (Tina: Frau im weiss-blauen Anzug vor neutralem Grund) ### Ken — Die Stimme von aussen - **Status:** Rollenentwurf - **Stimme:** offen - **Haltung:** Bringt die Sicht derer ins Panel, die nicht auf dem Podium sitzen: Kundschaft, Betroffene, Nachbarschaft. - **Erkennungsmerkmal:** Ruhig und knapp. Seine Haltung entsteht aus Ihrem Briefing. - **Bild:** https://www.aura51.ai/img/figur-ken.webp (Ken: Mann im blauen Sakko vor einer Stadtkulisse) ### Was alle Figuren teilen - Sie hören die ganze Diskussion mit. - Sie sprechen, wenn die Moderation sie beim Namen ruft — und zwölf Sekunden danach auch auf ein blosses «Und warum?». - Sie verstehen und sprechen Hochdeutsch und Englisch — keine Mundart. - Sie lassen sich in unter einer halben Sekunde stoppen. - Sie erfinden keine Zahlen und benennen ihr Nichtwissen. *Herkunft der Messwerte: Die Technik ist bei allen vier Figuren dieselbe. Die Messwerte stammen aus den Tests mit Albert — er ist bisher die einzige Figur, die auf einer Bühne stand.* ### Was der Veranstalter je Figur festlegt - Den Namen — phonetisch eindeutig, kein Teilnehmername. - Gesicht und Stimme. - Die Haltung: widersprechend, prüfend, erklärend. - Das Briefing: Thema, Teilnehmende, Rolle. ## Die Figur im Detail (Albert, live erprobt) - **Name:** Albert — phonetisch eindeutig, kein Teilnehmername - **Avatar:** Fotorealistisch, junger Mann mit lockigem Haar, Cardigan, Bücherregal (Anam, Cara 4) - **Stimme:** «Moritz – Modern Communicator», deutsch, männlich, klar und nahbar - **Sprachen:** Hochdeutsch und Englisch — keine Mundart - **Ton:** Tech-Experte mit Haltung: Er widerspricht, wenn er anderer Meinung ist, provoziert aber nicht um der Provokation willen - **Rolle:** Konfigurierbar pro Veranstaltung - **Kennzeichnung:** Das Video kann dauerhaft als KI-Avatar gekennzeichnet werden (EU AI Act Art. 50) ## Einsatzszenarien - **Konferenz-Panel:** Ein KI-Teilnehmer, der die Diskussion herausfordert — sichtbar auf der Leinwand, nicht als Chatfenster am Rand. - **Kundenevent:** Albert vertritt die Position des Produkts. Oder eben die des Kritikers — die Rolle wird pro Veranstaltung konfiguriert. - **Interne Townhall:** Der Advocatus Diaboli, den sich sonst niemand zu spielen traut. - **Bildungs- und Hochschulformate:** KI als sichtbarer Gesprächspartner auf dem Podium, nicht als Werkzeug hinter der Bühne. ## Fähigkeiten — live auf einer Bühne gemessen «Gemessen» heisst: in den Live-Tests vorgekommen, mit Personen im Raum und natürlicher Sprache. ### Zuhören Albert kennt jede Aussage der letzten Minuten wörtlich und den Rest der Diskussion als fortlaufende Zusammenfassung. *Prüfstand: gemessen · live* ### Auf Namensaufruf antworten «Albert, wie siehst du das?» — er reagiert. Erwähnt ihn jemand nur («Albert hat vorhin gesagt …»), bleibt er still. *Prüfstand: gemessen · live* ### Im Gespräch bleiben Nach einer Antwort hört er zwölf Sekunden lang auf Nachfragen, auch ohne seinen Namen: «Und warum?» genügt. Ein «Danke» oder «Okay» beantwortet er nicht; wird jemand anderes aufgerufen, ist das Gespräch beendet. *Prüfstand: gemessen · live* ### Mit Bezug und Position Er nennt Personen beim Namen, widerspricht, nimmt Stellung — so lang, wie die Frage es verlangt, nicht wie in einem Chat. *Prüfstand: gemessen · live* ### Den Umfang selbst wählen «Kurz», «in einem Satz» oder «ja oder nein» ergibt einen Satz; «erklär uns» oder «ein Beispiel» eine kurze Erklärung; alles andere zwei bis drei Sätze. Kein Knopf nötig, die Moderation hat die Hände frei. *Prüfstand: gemessen · live* ### Natürlich einsteigen Er beginnt mit einem neutralen «Also.», «Hm.» oder «Nun.» und formuliert die Antwort im Wissen um diesen Einstieg. Ein «Ja.» mit anschliessendem «Nein» kommt nicht mehr vor. *Prüfstand: gemessen · live* ### Zweigeteilte Aufrufe verstehen «Ich frage jetzt Albert. Albert, was hältst du von …?» ergibt eine Antwort auf die ganze Frage. Redet die Moderation weiter, wartet er. *Prüfstand: gemessen · live* ### Sich stoppen lassen Ein Tipp auf STOPP, und er verstummt in unter einer halben Sekunde. *Prüfstand: gemessen · live* ## Fähigkeiten — gebaut, aber noch nicht vor Publikum Diese stehen bewusst getrennt. Sie sind gebaut und im Labor oder im automatischen Test geprüft, standen aber noch auf keiner Bühne. Wer sie zitiert, zitiert bitte den Prüfstand mit. ### Auf Zwischenrufe reagieren Ruft jemand in seine Antwort hinein, sagt er «Moment — den Gedanken führe ich noch kurz zu Ende» und setzt genau dort fort, wo er unterbrochen wurde. *Prüfstand: gemessen · Labor* ### Per Stimme stoppen «Danke, Albert» beendet seine Antwort wie der STOPP-Knopf. Dasselbe «Danke, Albert» im normalen Gespräch ruft ihn nicht auf. *Prüfstand: geprüft im Test · live noch nicht* ### Die Teilnehmenden kennen Namen von Moderation und Gästen werden vor dem Panel auf dem Tablet eingetragen; er spricht sie richtig an und erkennt sie im Transkript. *Prüfstand: geprüft im Test · live noch nicht* ## Kontrolle durch die Moderation - **Antwortvorschau:** Jede Antwort erscheint als Text auf dem Tablet, bevor der Saal sie hört — der Text läuft dem Ton etwa eine Sekunde voraus. Die Moderation kann gegen den Inhalt stoppen, nicht gegen eine Vermutung. - **Stoppen, antworten, tippen:** Abbrechen — auf dem Tablet oder mit «Danke, Albert» —, den letzten Satz einer Person als Frage geben, oder eine Frage tippen. - **Kein autonomes Reden:** Ohne Aufruf, Knopfdruck oder ein laufendes Gespräch sagt Albert nichts. Das Gespräch endet zwölf Sekunden nach seiner Antwort, spätestens wenn jemand anderes aufgerufen wird. - **Live-Transkript:** Mit Sprechernamen, Verbindungsampel und Latenzanzeige. ## Messwerte, jeder mit seiner Bedingung | Wert | Was gemessen wurde | Bedingung | | --- | --- | --- | | 1,8–1,9 s | bis zum ersten Ton | mit Personen im Raum, Median der Live-Tests 5 und 6 · im Labor 1,5–1,9 s | | 334 ms | bis er verstummt | STOPP auf dem Tablet · gemessen 334 und 374 ms | | 12 s | Gespräch ohne Namensaufruf | nach jeder Antwort · danach braucht es wieder seinen Namen | | 1,3 s | bis zum «Moment»-Satz | nach einem Zwischenruf · echte Stimme | Technischer Hintergrund: Die Antwort wird spekulativ erzeugt, bevor die Prüfung abgeschlossen ist; ein kurzer Einstieg («Also.») überbrückt die Rechenzeit, sodass der erste Ton nicht am Sprachmodell hängt; der Kontext ist so gebaut, dass wiederkehrende Teile aus dem Cache kommen. 122 automatische Tests sichern den Stand. ## Der Signalweg 1. **Vom Pult in den Laptop:** Die Mikrofone des Podiums gehen vom Mischpult über einen Aux-Send in einen Laptop. 2. **Mitschreiben:** Ein Spracherkennungsdienst schreibt live mit, Sprecher inklusive (Deepgram Nova-3, Namen per Keyword-Boosting). 3. **Erkennen und formulieren:** Das «Brain» erkennt den Aufruf, prüft, ob Albert wirklich gemeint ist, und formuliert die Antwort — bereits während die Moderation noch ausspricht. 4. **Sprechen:** Ein fotorealistischer Avatar spricht die Antwort mit natürlicher deutscher Stimme auf der Leinwand. ## Grenzen ### Was die Figuren nicht tun — weil sie so gebaut sind - Von sich aus reden — ohne Aufruf oder Knopfdruck sagt sie nichts. - Zahlen oder Studien erfinden. Weiss sie etwas nicht, sagt sie das. - Publikumsstimmen aufzeichnen. ### Was sie nicht können — weil die Technik es nicht hergibt - Schneller als rund 1,6 Sekunden antworten — so lange brauchen Pausenerkennung und Sprachsynthese zusammen. - Mundart. Hochdeutsch und Englisch versteht und spricht sie, Schweizerdeutsch nicht. - Weiterreden, wenn niemand sie ruft: Zwölf Sekunden nach einer Antwort braucht es wieder ihren Namen. - Ohne Internet arbeiten. ## Häufige Fragen ### Redet er einfach drauflos? Nein. Nur auf Namensaufruf oder Knopfdruck — und in den zwölf Sekunden nach einer Antwort auf Nachfragen. Danach braucht es wieder seinen Namen. ### Was, wenn er Unsinn sagt? Die Moderation liest jede Antwort, bevor der Saal sie hört, und stoppt ihn auf dem Tablet in unter einer halben Sekunde. Der Stopp per «Danke, Albert» ist im Test geprüft, auf einer Bühne noch nicht. ### Versteht er, wer spricht? Ja — im Test geprüft, auf einer Bühne noch nicht. Die Moderation hat ein eigenes Mikrofon, die übrigen Sprecher werden vor dem Panel einmal zugeordnet. ### Kann man ihn unterbrechen? Ja — im Labor gemessen, auf einer Bühne noch nicht. Er reagiert darauf, bittet kurz um Geduld und führt den Gedanken zu Ende. ### Wie schnell ist er? Rund zwei Sekunden bis zum ersten Ton, auch mit Personen im Raum — ähnlich einem Menschen, der kurz nachdenkt. ### Wie lang sind seine Antworten? So lang, wie die Frage es verlangt. «Kurz» oder «ja oder nein» ergibt einen Satz, «erklär uns» eine kurze Erklärung, alles andere zwei bis drei Sätze. Niemand muss dafür einen Knopf drücken. ### Welche Sprachen sprechen die Figuren? Alle vier verstehen und sprechen Hochdeutsch und Englisch. Schweizerdeutsch nicht — weder verstehen noch sprechen. ### Was passiert, wenn das Internet wegbricht? Ohne Internet arbeitet keine der Figuren; das steht so unter «Was nicht geht». Für den Fall der Fälle gibt es einen geübten Satz der Moderation, und die Diskussion läuft ohne sie weiter. ## Was ein Veranstalter mitbringt - Mischpult mit einem Aux-Send für die Mikrofone (pre-fader, ohne den Avatar-Return) und ein Audio-Interface. - Laptop (Mac) mit Internet — die drei Dienste laufen in der Cloud, das Transkript bleibt lokal. - Leinwand oder Monitor für den Avatar, Lautsprecherweg zurück ins Pult. - Tablet für die Moderation im eigenen Netz (Hotspot oder Kabel), nicht im Kongress-WLAN. - Thema, Teilnehmende und Rolle als Briefing; eine kurze Probeaufnahme für die Namenserkennung; eine Generalprobe. ## Kontakt AURA51.AI, Ebnetstrasse 2, 8810 Horgen, Schweiz E-Mail: panel@aura51.ai Developed with love in Horgen, Switzerland