Der chinesische Technologie-Konzern Tencent hat mit der Veröffentlichung von Hy4-preview (Hunyuan 4) ein neues Schwergewicht in das globale KI-Rennen geschickt. Das Modell bricht mit bisherigen Größenordnungen im quelloffenen Bereich: Mit insgesamt 770 Milliarden Parametern in einer Mixture-of-Experts-Architektur (MoE), wovon 49 Milliarden Parameter pro Token dynamisch aktiviert werden, zielt Tencent direkt auf anspruchsvolle Entwickler- und Unternehmens-Workflows ab. Bemerkenswert ist vor allem die Lizenzierung: Tencent stellt die vollständigen Modellgewichte unter der liberalen Apache-2.0-Lizenz zur freien kommerziellen Nutzung und Weiterentwicklung bereit.

Die Veröffentlichung unterstreicht das enorme Tempo fernöstlicher KI-Labore. Erst vor wenigen Tagen sorgte die Geschwindigkeitsoffensive von GLM 5.3 und Qwen 3.8 Flash für Aufsehen in der Inferenz-Welt. Während dort jedoch kompakte Echtzeit-Modelle im Vordergrund standen, schlägt Tencent mit Hy4 nun im Segment der maximalen Rechenkapazität auf. Der Nachfolger des erst im Juli 2026 vorgestellten Hy3-Modells (295 Milliarden Parameter) vervielfacht die Kapazitäten und soll insbesondere bei langen, komplexen Denk- und Programmieraufgaben mit proprietären US-Flaggschiffen konkurrieren.

Architektur-Feinschliff: 1 Million Token Kontext und DeepSeek Sparse Attention

Das technische Grundgerüst von Hy4 basiert auf einem tiefen 78-Schichten-Transformer. Nach einer initialen dichten Schicht arbeiten 77 MoE-Schichten mit 256 gerouteten Experten sowie einem geteilten Experten (Shared Expert). Bei jedem Durchlauf wählt das System dynamisch die acht am besten passenden Experten aus. Um das native Kontextfenster von 1 Million Tokens effizient zu verarbeiten, integriert Tencent die sogenannte Gated DeepSeek Sparse Attention (DSA). Diese wird mit einem neuartigen IndexCache gekoppelt, der Sparse-Indizes ebenenübergreifend wiederverwendet und so den Speicherbandbreiten-Engpass bei langen Dokumenten drastisch reduziert.

Zur Stabilisierung des Signalflusses durch die 78 Schichten setzt das Entwicklerteam auf identity Hyper-Connections (iHC) mit vier parallelen Residual-Strömen. Um zudem die Ausgabegeschwindigkeit bei der Textgenerierung zu steigern, ist ein nativer Multi-Token Prediction (MTP)-Block mit 10 Milliarden Parametern (0,7 Milliarden aktiv) integriert, der spekulative Vorhersagen mehrerer aufeinanderfolgender Token ermöglicht.

Merkmal Tencent Hy4 Preview Vorgänger Hy3 (Juli 2026)
Gesamtparameter 770 Milliarden (MoE) 295 Milliarden (MoE)
Aktive Parameter / Token 49 Milliarden (Top-8 von 256) 21 Milliarden (Top-8 von 128)
Kontextfenster 1.000.000 Tokens (nativ) 256.000 Tokens
Aufmerksamkeitsmechanismus Gated DSA + IndexCache Standard Grouped-Query Attention
Inferenz-Beschleunigung Natives 10B MTP (Multi-Token) Kein integriertes MTP
Lizenz Apache 2.0 (Open Weights) Apache 2.0

Fokus auf autonome Agenten und Software-Engineering

Tencent positioniert das Modell explizit nicht nur als Konversations-KI, sondern als Arbeitspferd für produktive Agenten-Systeme. Trainingsdaten und Feinabstimmung wurden gemeinsam mit internen Entwicklerteams für anspruchsvolle Software-Architekturen, mehrstufige Refactorings, unübersichtliche Tabellenkalkulationen und wissenschaftliche Simulationen optimiert. Coding-Werkzeuge wie Cline haben Hy4 umgehend integriert und melden deutliche Fortschritte bei der Bearbeitung komplexer Codebasen.

In Entwicklerkreisen wird hervorgehoben, dass offene Modelle bei agentischen Programmier-Pipelines zunehmend auf Augenhöhe mit führenden proprietären Systemen agieren. Dies ermöglicht es Organisationen, autonome Entwicklungs-Workflows auf eigener Infrastruktur zu betreiben, ohne sensiblen Quellcode an externe Plattformen übermitteln zu müssen.

Sprung in der LMSYS Arena und interne Blindtests

Erste Leistungsindikatoren aus unabhängigen Vergleichen untermauern den Fortschritt: In der LMSYS Chatbot Arena erzielte Hy4 in der Kategorie Code Arena (WebDev) einen Zuwachs von +115 Punkten im Vergleich zum Vorgänger Hy3 und stieg direkt in die globale Spitzengruppe der quelloffenen Programmiermodelle auf.

In internen Doppelblind-Untersuchungen von Tencent, bei denen 163 Fachexperten insgesamt 203 reale Programmier- und Analyseaufgaben bewerteten, erreichte Hy4 nach Unternehmensangaben eine durchschnittliche Bewertung von 2,99 von 4,00 Punkten. Damit platzierte sich das Modell knapp vor Konkurrenten wie GLM-5.3 (2,92 Punkte) und Kimi K3 (2,94 Punkte).

Markteinordnung & Ökosystem

Open-Source-Aggressivität: Die Bereitstellung eines 770B-Modells unter Apache 2.0 erhöht den Preisdruck auf geschlossene Anbieter wie OpenAI und Anthropic massiv.

Rechenzentrums-Fokus: Mit 770 Milliarden Parametern ist das Modell kein Werkzeug für lokale Entwickler-Laptops, sondern erfordert dedizierte GPU-Cluster oder skalierbare Cloud-Endpunkte.

Ökosystem-Verzahnung: Tencent integriert Hy4 unmittelbar in die eigenen Plattformen CodeBuddy, WorkBuddy, Yuanbao und ima, um das interne Entwicklungs- und Office-Ökosystem zu beschleunigen.

Verfügbarkeit und Hardware-Anforderungen

Die vollständigen Modellgewichte sowie optimierte FP8-Checkpoints sind ab sofort auf Plattformen wie Hugging Face, ModelScope, GitCode und CNB verfügbar. Entwickler können das Modell zudem über Programmierschnittstellen (APIs) via Tencent Cloud TokenHub und OpenRouter ansprechen.

Wer das Modell selbst hosten möchte, muss allerdings erhebliche Hardware-Ressourcen einplanen: Für die Inferenz im ungekürzten Präzisionsmodus werden Server-Konfigurationen mit beispielsweise 16 NVIDIA H200- oder 8 Blackwell B300-Grafikprozessoren empfohlen. Für kleinere Setups dürften in den kommenden Tagen stark quantisierte Versionen der Community folgen.

🎯 Was das für die Praxis bedeutet

1. Offene Agenten-Pipelines testen: Durch die Apache-2.0-Lizenz und die direkte Cline-Anbindung können Teams Hy4 als leistungsfähige Backend-Alternative für autonome Coding-Agenten erproben.

2. Cloud-Inferenz gegenüber Eigenbetrieb abwägen: Da der lokale Betrieb von 770B-Modellen massive Cluster erfordert, sind gemanagte API-Endpunkte (wie OpenRouter oder TokenHub) für die meisten Unternehmen die wirtschaftlichere Wahl.

3. Datenschutz und Datenflüsse prüfen: Bei der Nutzung chinesischer Cloud-APIs müssen europäische Betriebe die Einhaltung der DSGVO und Vorgaben zur Datenhaltung strikt sicherstellen oder auf europäisch gehostete Open-Weights-Instanzen setzen.

4. Große Kontextfenster strukturiert nutzen: Die Kombination aus 1 Million Tokens Kontext und DeepSeek Sparse Attention eignet sich ideal für das Durchforsten kompletter Softwaredepots und umfangreicher Dokumentensammlungen.

Dieser Artikel enthält eingebettete Inhalte externer Anbieter, etwa Videos oder Social-Media-Beiträge. kiwoche.com ordnet diese Inhalte redaktionell ein, übernimmt sie jedoch nicht als eigene Inhalte. Die Rechte daran verbleiben bei den jeweiligen Rechteinhabern; für die externen Inhalte sind die jeweiligen Anbieter verantwortlich. Eingebettete Inhalte können vollständig oder teilweise mit KI erstellt oder bearbeitet worden sein.

📰 Quellen
Tencent HY4 Preview ↗ TencentHunyuan auf X ↗ LMSYS Arena auf X ↗ Cline auf X ↗ Tencent AI News auf X (Release) ↗ Tencent AI News auf X (Update) ↗ Tim Jayas auf X ↗ Wudan auf X ↗ hakmgpt auf X ↗ HarshithLucky3 auf X ↗
Teilen: