Ohne offizielle Vorankündigung oder einen begleitenden Blogbeitrag von Google DeepMind ist am Montagabend eine neue Modellgeneration in Googles Kreativplattform Google Flow aufgetaucht: Nano Banana 2.1. In der Weboberfläche wird das Modell unter dem internen Codenamen „Beluga“ geführt. Erste Tests aus der KI-Community deuten darauf hin, dass Google gezielt an Schwachstellen bei räumlicher Logik, Zählfähigkeiten und feinteiliger Typografie gearbeitet hat.

Nachdem Google im Februar mit Nano Banana 2 seine Gemini-basierte Bildgenerierung auf hohe Geschwindigkeit getrimmt hatte und im Frühsommer Spekulationen über Nachfolge-Architekturen wie Instant-Ramen kursierten, wählt der Konzern nun offenbar erneut die Taktik des stillen Ausrollens. Erste Nutzer entdeckten die neue Version direkt in der Modellauswahl von Flow und teilten umgehend ihre ersten Render-Ergebnisse.

Härtetests für Anatomie und dynamische Bewegungen

Zu den traditionellen Schwachstellen diffusionsbasierter Bildgeneratoren zählen komplexe anatomische Posen, in denen mehrere Körperachsen oder gar mythologische Hybridwesen glaubhaft interagieren müssen. In ersten Stresstests meisterte Nano Banana 2.1 Prompts wie „drei Zentauren, die Rückwärtssaltos schlagen“ mit bemerkenswerter perspektivischer Stabilität und ohne die sonst typischen Verwachsungen an Gliedmaßen.

Noch deutlicher werden die Fortschritte bei einer Anforderung, an der frühere Modellgenerationen fast durchgehend scheiterten: die Kombination aus exakter Typografie und einer spezifischen Handhaltung. Ein Tester ließ eine linke Hand darstellen, die mit einem Stift das Wort „Google“ auf Papier schreibt. Während ältere Systeme hier regelmäßig zu sechsfingrigen Händen, unnatürlichen Gelenkwinkeln oder Buchstabensalat neigten, rendert das neue Modell die Handhaltung und den geschriebenen Schriftzug sauber.

Zähllogik: Zehn Zwillinge und ihre Finger

Die größte Hürde für visuelle KI-Modelle bleibt die sogenannte Kardinalität - also das exakte Abzählen von Objekten im Bildraum. Ein viel beachteter Stresstest forderte zehn identische Zwillinge in unterschiedlich farbigen Regenmänteln, die jeweils eine aufsteigende Anzahl von Fingern (von eins bis zehn) in die Kamera halten.

Das Ergebnis illustriert sowohl den enormen Sprung als auch die verbleibende Grenze: Neun der zehn Personen zeigten die exakte Fingeranzahl, lediglich bei der Zahl acht zählte das Modell ungenau. Dass ein Bildmodell neun von zehn diskreten Handkonfigurationen in einer einzigen Szene korrekt umsetzt, galt vor wenigen Monaten noch als nahezu unlösbare Aufgabe.

Modellvergleiche: 2.1 gegen Pro und GPT Images

Unmittelbar nach dem Bekanntwerden des Rollouts begannen Creator mit Vergleichsreihen gegen frühere Google-Modelle sowie die Konkurrenz von OpenAI. Im direkten Gegenüberstellen mit Nano Banana Pro zeichnet sich Version 2.1 durch feinere Texturen und eine kontrolliertere Belichtung aus.

Gleichzeitig zeigt der Abgleich mit OpenAIs GPT Images 2.5, dass der Wettlauf an der Spitze eng bleibt. Während Nano Banana 2.1 bei geometrischer Strenge und Textplatzierung Boden gutmacht, bewerten Tester die narrative Kohärenz und filmische Stimmungen unterschiedlich.

Gegenposition: Grenzen bei Popkultur und komplexer Erzählung

Trotz der sichtbaren Fortschritte bei isolierten Benchmark-Aufgaben gibt es auch vernehmbare Kritik an der Neuauflage. Mehrere Tester merkten an, dass Beluga bei popkulturellen Szenarien und komplexer Szenenregie nach wie vor hinter OpenAIs Spitzenmodellen wie GPT-Image-2 zurückbleibt.

So scheiterte das Modell in Tests an fiktiven filmischen Endsequenzen („Avengers: Doomsday“) oder differenzierten Gruppenarrangements wie K-Pop-Formationen, bei denen Gesichter und Kostüme zu stark homogenisiert wurden. Solche Schwächen zeigen, dass das Weltwissen und die semantische Auflösung bei Nano Banana 2.1 zwar gegenüber Version 2 spürbar optimiert wurden, komplexe narrative Bildkompositionen aber weiterhin eine Stärke dedizierter multimodaler Riesenmodelle bleiben.

Die Modellgenerationen der Nano-Banana-Reihe im Überblick

Modell Erscheinungsdatum Basis / Plattform Fokus & Kernstärken
Nano Banana August 2025 Gemini 2.5 Flash / Gemini App Erste native Bildintegration, virale Bildbearbeitung im Consumer-Chat.
Nano Banana Pro November 2025 Gemini 3 Pro Fokus auf visuelle Begründung, Studio-Ästhetik und erweiterte Weltkenntnis.
Nano Banana 2 Februar 2026 Gemini 3.1 Flash Image Erheblicher Geschwindigkeitssprung, Integration in Suche und NotebookLM.
Nano Banana 2.1 („Beluga“) Oktober 2026 Google Flow Preview Fortschritte bei Hand- und Fingerzählungen, Typografie und räumlicher Kohärenz.

🎯 Was das für die Praxis bedeutet

1. Google Flow als Testlabor beobachten: Google nutzt seine Video- und Kreativplattform Flow zunehmend als Vorab-Bühne für neue Modell-Iterationen, bevor diese in der Gemini-API oder im AI Studio landen.

2. Weniger Retusche-Aufwand bei Typografie: Wer Marketing-Grafiken mit Schriftzügen oder realistischen Handlungen (wie Schreiben oder Zeigen) entwirft, profitiert von der deutlich stabileren Gliedmaßen- und Textdarstellung.

3. Modell-Diversifikation bleibt unverzichtbar: Auch wenn Google bei Einzel-Disziplinen aufschließt, bleibt der Abstand bei komplexer Popkultur und narrativer Dichte bestehen - für anspruchsvolle Szenen empfiehlt sich weiterhin der Paralleltest mit OpenAI-Systemen.

Dieser Artikel enthält eingebettete Inhalte externer Anbieter, etwa Videos oder Social-Media-Beiträge. kiwoche.com ordnet diese Inhalte redaktionell ein, übernimmt sie jedoch nicht als eigene Inhalte. Die Rechte daran verbleiben bei den jeweiligen Rechteinhabern; für die externen Inhalte sind die jeweiligen Anbieter verantwortlich. Eingebettete Inhalte können vollständig oder teilweise mit KI erstellt oder bearbeitet worden sein.

📰 Quellen
Google Flow ↗ Lyra auf X ↗ Chetaslua auf X ↗ Harshith auf X (Zentauren) ↗ Harshith auf X (Zähllogik) ↗ Harshith auf X (Linkshänder) ↗ Doe auf X ↗ Alex auf X ↗ Jazii auf X ↗
Teilen: