Nur zwei Wochen nach dem Marktstart des proprietären KI-Entscheidungsmodells Jev von TypeSafe AI reagiert Cloudflare mit einer quelloffenen Kampfansage: Das US-Netzwerkunternehmen hat mit Clef und Clef-flash zwei spezialisierte Entscheidungsmodelle unter der freien Apache-2.0-Lizenz veröffentlicht. Statt wie klassische Sprachmodelle langwierig Wort für Wort zu generieren, werten die neuen Modelle strukturierte Klassifikationsfragen in einem einzigen Durchlauf parallel aus - und drücken die Latenz laut Cloudflare auf bis zu 38,8 Millisekunden.
In autonomen Software-Pipelines und Agenten-Architekturen entsteht dadurch ein neuer Baustein: sogenannte System-1-Modelle, die wie ein schneller menschlicher Reflex blitzschnell Einordnungen treffen, bevor teure Großmodelle für tiefes Nachdenken aktiviert werden müssen.
Weg von Textausgabe: Wie ein Entscheidungsmodell arbeitet
Klassische generative Sprachmodelle (LLMs) wie GPT-5 oder Claude arbeiten autoregressiv: Sie sagen ein Token nach dem anderen voraus, was selbst bei kurzen Antworten spürbare Rechenzeit und Latenz kostet. Für redaktionelle Texte oder Programmiercode ist das unverzichtbar. Wenn ein Software-Agent jedoch lediglich entscheiden muss, ob eine Kundenanfrage dringlich ist oder an welches Fachteam ein Ticket weitergeleitet werden soll, ist die Textgenerierung ein kostspieliger Umweg.
Entscheidungsmodelle lösen diese Aufgabe grundlegend anders. Clef nutzt das Sprachmodell als reinen Inferenz-Rumpf (Prefill-Pass) und liest die vorgegebenen Auswahlmöglichkeiten direkt aus den internen Repräsentationen des Modells ab. Anstelle von Fließtext liefert Clef typisierte Antworten mitsamt mathematischen Wahrscheinlichkeiten für jede Option. Das System entscheidet deterministisch und strukturiert, wodurch nachgelagerter Programmcode sofort ohne fehleranfälliges Text-Parsing weiterarbeiten kann.
Cloudflare hat den Namen an den musikalischen Notenschlüssel (englisch: Clef) angelehnt: So wie ein Notenschlüssel das Tonsystem und den Rahmen für nachfolgende Noten festlegt, definiert das Modell den Kontext und stößt die nächsten Arbeitsschritte eines Agenten an.
Qwen-Basis, Vision-Encoder und 64k-Kontext
Technisch setzt Cloudflare auf bestehende Open-Source-Modelle der Qwen-Familie. Für das größere Modell Clef nutzt das Team ein eingefrorenes Qwen3.8-27B, während die schlanke Variante Clef-flash auf Qwen3.5-9B aufbaut. Beide Modelle wurden mit Rank-256 Low-Rank Adapters (LoRA) und einem zweistufigen Routing-Kopf erweitert.
Gegenüber dem Vorreiter Jev, der im Praxistest bei Entwicklern für Aufsehen sorgte, bringt Clef zwei wesentliche Neuerungen mit:
- Integrierter Vision-Encoder: Das größere Clef-Modell kann nicht nur Text analysieren, sondern verarbeitet auch Bilddaten direkt. Damit lassen sich Screenshots, Webseiten oder grafische Dokumente klassifizieren.
- Doppeltes Kontextfenster: Während Jev auf 32.000 Tokens begrenzt ist, akzeptiert Clef bis zu 64.000 Tokens an Eingabedaten. Entwickler können somit umfangreiche Logs, Programmabläufe oder Kundendialoge in einem Durchgang übergeben.
- Vollständige API-Kompatibilität: Cloudflare hat die Schnittstelle exakt an das Schema von Jev angepasst. Bestehende Integrationen lassen sich ohne Code-Umbau auf Clef umstellen.
Bei der internen Erkennung von bösartigen Domains im eigenen Threat-Intelligence-Team habe Clef laut Cloudflare eine Webseite innerhalb von 2,2 Sekunden gerendert und kategorisiert. Ein herkömmliches 120B-Sprachmodell habe für dieselbe Aufgabe 4,7 Sekunden benötigt und weniger präzise Kategorisierungen geliefert.
Der Modellvergleich im Überblick
Die folgende Übersicht vergleicht die Spezifikationen der neuen Cloudflare-Modelle mit dem bisherigen Marktstandard:
| Eigenschaft | Cloudflare Clef | Cloudflare Clef-flash | TypeSafe AI Jev |
|---|---|---|---|
| Basis-Architektur | Qwen3.8-27B (eingefroren) | Qwen3.5-9B (eingefroren) | Proprietäres Backbone |
| Inferenz-Methode | Nicht-autoregressiv (parallel) | Nicht-autoregressiv (parallel) | Nicht-autoregressiv (parallel) |
| Bildverarbeitung (Vision) | Ja (Vision-Encoder integriert) | Nein (nur Text) | Nein (nur Text) |
| Kontextfenster | 64.000 Tokens | 64.000 Tokens | 32.000 Tokens |
| Median-Latenz (Cloudflare-Eval) | 209,3 ms (p95: 238,6 ms) | 38,8 ms (p95: 122,4 ms) | 524,1 ms (p95: 536,0 ms) |
| Lizenz & Verfügbarkeit | Apache 2.0 (Hugging Face & Workers AI) | Apache 2.0 (Hugging Face & Workers AI) | Proprietär (Cloud-API) |
In der Entwickler-Community stößt der Vorstoß auf reges Interesse. Jared Zoneraich, Mitgründer des KI-Observability-Pioniers PromptLayer und Software-Entwickler bei Cognition, kommentierte den Launch auf X mit Verweis auf die neue Pareto-Effizienzfront für System-1-Modelle:
Zoneraich hebt hervor, dass sich im Bereich der schnellen Entscheidungsmodelle ein eigener Wettbewerbsmarkt etabliert, auf dem Latenz und Kosteneffizienz die entscheidenden Differenzierungsmerkmale bilden.
Training mit RLCD und Brier-Loss
Um die Zuverlässigkeit der Wahrscheinlichkeitswerte sicherzustellen, setzte Cloudflare auf eine Kombination aus synthetischen Datensätzen und kalibriertem Training. Neben label-geglätteter Kreuzentropie kam ein sogenannter Brier-Loss zum Einsatz, der die mathematische Kalibrierung der Wahrscheinlichkeiten schärft: Ein Wert von 90 Prozent entspricht somit auch real einer 90-prozentigen Treffsicherheit.
Zusätzlich implementierte Cloudflare ein sekundäres Optimierungsverfahren namens Reinforcement Learning for Calibrated Decisions (RLCD). Dieser Mechanismus vergibt Teilpunkte für benachbarte ordinale Antwortstufen und belegt Abweichungen mit einer Referenzstrafe, um unerwünschte Distributionsverschiebungen beim Training zu verhindern.
Eigene Fine-Tuning-Plattform auf Edge-Infrastruktur
Gemeinsam mit den Modellgewichten kündigte Cloudflare eine neue Plattform für Reinforcement Learning an. Da generische Klassifikatoren bei hochspezifischen Unternehmensdaten - etwa internen Bot-Erkennungen, Support-Kategorisierungen oder Sicherheitsaudits - an Grenzen stoßen, sollen Kunden Clef künftig mit eigenen Datensätzen feintunen können.
Die Trainings-Pipeline stützt sich dabei auf bestehende Cloudflare-Dienste:
- AI Gateway: Zeichnet den laufenden KI-Datenverkehr auf und generiert daraus automatisch Trainingsdatensätze aus echten Anfragen.
- Workers AI: Führt Basis-Rollouts mit Clef direkt im weltweiten Edge-Netzwerk aus.
- Cloudflare Containers: Dient als isolierte Sandbox, um Aktionen von Agenten nachzustellen, zu bewerten und mit Belohnungsfunktionen zu versehen.
- Trainer & BYO-Model: Aktualisiert die Modellgewichte und stellt das spezialisierte Modell über die von Replicate übernommene Container-Technologie wieder auf Workers AI bereit.
In der ersten Phase bietet Cloudflare das Feintuning als Begleitprogramm über spezialisierte Ingenieure (Forward-Deployed Engineers) an. Später soll der Dienst zu einer vollautomatisierten Self-Service-Plattform ausgebaut werden.
🎯 Was das für die Praxis bedeutet
1. Agenten-Kosten drastisch senken: Wer teure Frontier-Modelle wie GPT-5 oder Claude ausschließlich für Ja-Nein-Entscheidungen, Dringlichkeits-Scoring oder Ticket-Routing nutzt, verbrennt unnötig Budget. Clef übernimmt diese Reflex-Schritte für einen Bruchteil der Kosten.
2. Kein Vendor-Lock-in durch Apache 2.0: Da Cloudflare sowohl die Modellgewichte als auch die Inferenz-Architektur auf Hugging Face freigegeben hat, können europäische Unternehmen Clef auf eigener GPU-Infrastruktur On-Premises oder in der privaten Cloud betreiben.
3. Kürzere Antwortzeiten für Endnutzer: Bei komplexen Agenten-Workflows summiert sich die Latenz einzelner Zwischenschritte rasch auf mehrere Sekunden. Mit Reaktionszeiten von unter 40 Millisekunden verhindert Clef-flash Latenz-Engpässe im kritischen Pfad.
4. Bestehende Jev-Pipelines evaluieren: Dank identischer Schnittstellen-Definitionen können Entwickler, die bereits Jev einsetzen, Clef ohne Architekturanpassungen als kostengünstigere Open-Source-Alternative testen.


