Wer bisher mit digitalen Avataren interagierte, erlebte unweigerlich den Bruch zwischen Mensch und Maschine: Nach jedem gesprochenen Satz herrscht eine sekundenlange Pause, der Blick des Avatars wirkt erstarrt, und setzt der Mensch zu einem kurzen Zwischengedanken an, redet die Software ungerührt weiter. Das US-amerikanische KI-Unternehmen Tavus will diese Barriere nun durchbrochen haben. Mit der Vorstellung von Griffin präsentiert das Team um CEO Hassaan Raza das nach eigenen Angaben weltweit erste „Human Interaction Model“ (HIM) - ein System, das von Grund auf für simultane, visuelle Echtzeit-Interaktionen von Angesicht zu Angesicht trainiert wurde.
In einer verblindeten Teststudie mit einminütigen Videoanrufen hielten 48 Prozent der menschlichen Gesprächspartner das KI-Modell für eine reale Person. Zum Vergleich: Das bisherige Produktionssystem von Tavus erreichte unter identischen Versuchsbedingungen eine Quote von lediglich 2,4 Prozent. Auch in unabhängigen Messungen setzt das System neue Maßstäbe: Im Video Full-Duplex Benchmark (VideoFDB) von Nvidia belegt das Modell auf Anhieb den ersten Platz unter allen getesteten Systemen.
Abschied von der Kaskade: Warum bisherige Avatare hölzern wirken
Herkömmliche interaktive Video-Agenten - wie sie etwa bei Avatar-Lösungen von HeyGen oder asynchronen Systemen wie Google Vids zum Einsatz kommen - basieren fast ausnahmslos auf einer mehrstufigen Kaskade: Zunächst wandelt ein Spracherkennungsmodell (ASR) das Gehörte in Text um. Erst wenn der Nutzer verstummt ist, verarbeitet ein großes Sprachmodell (LLM) die Worte und generiert eine Antwort. Diese Textantwort wandert anschließend in ein Sprachsynthese-Modell (TTS), dessen Audiosignal schließlich an einen Video-Renderer übergeben wird, der die Lippenbewegungen auf ein Gesicht mappt.
Jede dieser Übergabestellen kostet wertvolle Zeit. Bis zu 1,5 Sekunden Stille vergehen in der Praxis, bevor sich das Gesicht des Avatars überhaupt in Bewegung setzt. Schlimmer noch: Die Kaskade schneidet sämtliche nonverbalen Informationen ab. Ob der Gesprächspartner zögert, den Blick zur Decke richtet, um nachzudenken, oder die Stirn runzelt, bleibt für das Sprachmodell unsichtbar.
Kaskadensystem vs. Vollduplex
Die Kaskade: Spracherkennung wartet auf Gesprächspause → LLM erzeugt Text → Text-to-Speech erzeugt Ton → Grafik-Engine animiert Lippen. Folge: 1,5 Sekunden Latenz, keine Wahrnehmung von Mimik oder Zwischenrufen.
Vollduplex-HIM: Ein einziges Modell sieht Video und hört Audio simultan, bewertet die Situation alle paar Millisekunden neu und steuert Stimme, Blick und Gestik direkt an.
Griffin ersetzt diesen Staffellauf durch eine einheitliche Video-zu-Video-Architektur. Das Modell arbeitet im sogenannten Vollduplex-Betrieb (Full-Duplex) - es kann also zur selben Zeit zuhören, zusehen und sprechen, genau wie zwei Menschen in einem Gespräch. Statt einmal pro Rederunde Entscheidungen zu treffen, bewertet das System die Konversation in kontinuierlichen Intervallen von wenigen Sekundenbruchteilen (Sub-Second Mini-Turns).
Blickkontakt, Denkpausen und Unterbrechungen
Die praktische Konsequenz dieser Architektur zeigt sich im Umgang mit den ungeschriebenen Regeln menschlicher Kommunikation. Wenn ein Nutzer mitten im Satz kurz innehält und zur Seite blickt, interpretiert ein gewöhnlicher Sprachassistent wie GPT-Realtime von OpenAI die Pause oft fälschlicherweise als Gesprächsende und fällt ins Wort. Griffin registriert laut Entwicklungsbericht die Kombination aus Stille und abgewandtem Blick, deutet dies als aktiven Denkprozess und hält sich zurück (Hold-Signal).
Ebenso beherrscht das System das sogenannte Backchanneling: Es nickt zustimmend mit dem Kopf oder streut ein bestätigendes „Mhm“ ein, während der Nutzer noch spricht. Fällt der Nutzer der KI ins Wort (Barge-in), bricht Griffin die begonnene Silbe unverzüglich ab, weicht zurück und lauscht dem neuen Einwand. Weil das Modell auch das Kamerabild verarbeitet, kann es zudem auf physische Gesten, das Zeigen von Gegenständen oder eine geteilte Bildschirmansicht reagieren.
Die Technik unter der Haube: Tavec-Codec und 320-Millisekunden-Blöcke
Um hochauflösendes Audio und Video ohne wahrnehmbare Verzögerung über das Netz zu übertragen, entwickelte das Forschungsteam zwei zentrale Komponenten:
- Tavec Audio-Codec: Ein kontinuierlicher Convolutional Autoencoder komprimiert 48-kHz-Audiosignale in 40 kontinuierliche Werte pro Zeitschritt bei 100 Frames pro Sekunde - vollkommen ohne diskrete Codebooks. Der kausale Decoder verarbeitet Audio-Pakete ab 10 Millisekunden Größe. Stimmen lassen sich laut Tavus anhand eines Referenzclips von lediglich 10 Sekunden klonen.
- Autoregressiver Diffusionsgenerator: Das Videomodell generiert 720p-Videomaterial mit 25 Bildern pro Sekunde in Blöcken von 320 Millisekunden. Ein Variational Autoencoder (VAE) komprimiert die Zeitachse um den Faktor 8, sodass pro Schritt jeweils nur ein einziger Latent-Frame berechnet werden muss.
- Dreistufige Destillation: Um das rechenintensive Diffusionsmodell echtzeitfähig zu machen, destillierte Tavus ein großes bidirektionales Ausgangsmodell zunächst mittels Distribution Matching Distillation (DMD), wandelte es per Teacher Forcing in ein autoregressives Modell um und trainierte es anschließend per Self-Forcing, um Drift-Effekte bei längeren Gesprächen zu unterbinden.
Auf Nvidia-H100-Grafikprozessoren sinkt die reine Audio-zu-Video-Latenz laut Anbieterangaben auf durchschnittlich 0,43 Sekunden - was einer Halbierung gegenüber bisher publizierten Streaming-Diffusionsmodellen entspricht.
Spitzenplatz im Nvidia VideoFDB Benchmark
Dass die Ergebnisse nicht nur auf Herstellervideos gut aussehen, untermauern unabhängige Messungen. Im September 2026 evaluierte Nvidia das Modell auf seinem Video Full-Duplex Benchmark (VideoFDB). Der Benchmark misst auf zwei separaten Ranglisten, wie gut ein System menschliche Gesprächssignale erzeugt (Generation) und wie präzise es diese erfasst (Perception).
| System / Modell | Generation (0 bis 5) | Perception (0 bis 5) | Takeover-Rate |
|---|---|---|---|
| Menschliche Referenz (Ground Truth) | 3,92 | 4,20 | 100 % |
| Tavus Griffin | 3,83 | 3,73 | 62,8 % / 73,8 % |
| Gemini 2.5 + Anam | 2,80 | - | - |
| MiniCPM-o 4.5 (Audio-only) | - | 3,44 | - |
| Google Gemini Flash Native | - | 3,17 | - |
| OpenAI gpt-realtime (Audio-only) | - | 2,97 | - |
In der Generierungswertung liegt Griffin mit einem Score von 3,83 mehr als einen vollen Punkt vor der Kombination aus Google Gemini 2.5 und Anam (2,80) und verfehlt das menschliche Referenzniveau von 3,92 um lediglich 0,09 Punkte. Auch bei der Wahrnehmung platziert sich das System vor rein sprachbasierten Frontier-Modellen.
48 Prozent Täuschungsrate: Der Video-Turing-Test
Besondere Aufmerksamkeit erregt die begleitende Humanstudie: 54 Probanden wurden über eine unabhängige Plattform für ein einminütiges Videogespräch rekrutiert. Man teilte ihnen mit, sie würden sich mit einem anderen Studienteilnehmer über ihre Pläne für das laufende Jahr austauschen. Am anderen Ende saß jedoch Griffin-Lite, das Gesicht, Stimme und Mimik in Echtzeit errechnete.
Erst im Anschluss an das Gespräch und nach mehreren Fragen zur Gesprächsqualität wurden die Teilnehmer gefragt, ob sie vermuten würden, dass ihr Gegenüber kein echter Mensch gewesen sei. 26 von 54 Probanden (48 Prozent) antworteten mit der Überzeugung, mit einem echten Menschen gesprochen zu haben. Bei denjenigen, die Verdacht schöpften, trat dieser meist innerhalb der ersten 20 Sekunden auf. Auf einer 7-Punkte-Skala bewerteten die Teilnehmer die Natürlichkeit im Schnitt mit 5,4 und die Vertrauenswürdigkeit mit 5,6 Punkten.
Sicherheitsbedenken und rechtliche Hürden
So beeindruckend die Zahlen klingen, so deutlich sind die damit verbundenen Risiken. Ein System, das im direkten Videoanruf kaum noch von einem Menschen zu unterscheiden ist, birgt ein enormes Potenzial für Social Engineering, Telefonbetrug im Namen von Führungskräften (CEO-Fraud) oder automatisierte Desinformationskampagnen. Auch technische Grenzen bleiben bestehen: Die Auflösung ist vorerst auf 720p limitiert, und ob die Natürlichkeit auch in halbstündigen Fachdiskussionen ohne Halluzinationen oder Wiederholungen stabil bleibt, muss sich erst noch erweisen.
Tavus kündigte daher an, Griffin zunächst nicht allgemein für Kunden freizuschalten. Das Modell steht vorerst nur als geschlossene Forschungs-Preview (Griffin-Lite) für ausgewählte Tester bereit. Das Unternehmen wolle vor einem breiten Rollout an Schutzmechanismen und einer manipulationssicheren Kennzeichnungspflicht (Safe Disclosure) arbeiten.
Für Unternehmen im europäischen Wirtschaftsraum kommt ein weiterer harter Faktor hinzu: Nach Artikel 50 des EU AI Act gilt für interaktive KI-Systeme eine strenge Transparenzpflicht. Betreiber müssen Nutzer unmissverständlich und vorab darüber informieren, dass sie mit einer künstlichen Intelligenz kommunizieren. Der Einsatz täuschend echter KI-Avatare im Kundensupport oder Recruiting wird in der Praxis daher zwingend an optische und akustische Kennzeichnungen gebunden sein.
🎯 Was das für die Praxis bedeutet
1. Vollduplex wird neuer Standard: Kaskadierte Avatarsysteme mit Sekundenpausen werden zügig an Relevanz verlieren, sobald integrierte Video-zu-Video-Modelle marktreif sind.
2. Rollout-Bereiche evaluieren: Erste praxistaugliche Einsatzfelder für Vollduplex-Systeme liegen in simulierten Trainingsgesprächen, automatisiertem Erstkontakt im Vertrieb und sprachgestützten HR-Onboardings.
3. Kennzeichnungspflicht mitdenken: Unternehmen sollten Pilotprojekte von Beginn an mit den Transparenzvorgaben des EU AI Acts abstimmen, um rechtliche Sanktionen bei Kundenkontakt zu vermeiden.


