Bislang galten leistungsfähige KI-Agenten als Domäne gigantischer Cloud-Rechenzentren: Wer ein Modell mit 27 Milliarden Parametern für verlässliche Funktionsaufrufe, API-Steuerungen und Code-Workflows einsetzen wollte, benötigte entweder teure Cloud-Infrastruktur oder High-End-Grafikkarten mit reichlich Videospeicher. Das Entwicklerteam von Underdog hat mit Saluki 27B nun ein Modell vorgelegt, das dieses Gefüge aufbricht: Das auf Alibabas quelloffenem Qwen3.8-27B basierende Modell wurde durch eine neuartige 2-Bit-Quantisierung auf eine kompakte Dateigröße von 7,89 Gigabyte geschrumpft.

Damit passt der gesamte Parametersatz problemlos in den Arbeitsspeicher eines herkömmlichen 16-GB-Laptops. Das Modell lässt sich ohne Spezial-Treiber oder maßgeschneiderte Laufzeitumgebungen direkt im Standard-Tool llama.cpp laden. Wie die Entwickler mitteilen, soll Saluki bei Funktionsaufrufen (Tool-Calling) sogar bessere Trefferquoten erzielen als das unkomprimierte Original.

Funktionsaufrufe im Fokus: Wie Saluki das Original schlägt

Quantisierung galt lange Zeit als technischer Kompromiss mit schmerzhaftem Intelligenzverlust. Sinkt die Präzision der Modellgewichte von 16 Bit auf extreme 2 Bit, brechen viele Sprachmodelle in unkontrollierte Halluzinationen oder fehlerhafte Syntax aus. Bei Saluki 27B haben die Entwickler den Fokus daher gezielt auf eine einzige Kernkompetenz gelegt: die verlässliche Auswahl und Befüllung von Software-Werkzeugen.

Um die Praxistauglichkeit zu messen, nutzte das Team den sogenannten Underdog Bench, der auf 120 Aufgaben aus dem anerkannten Berkeley Function Calling Leaderboard (BFCL) basiert. Dabei erzielt Saluki 27B nach Angaben des Anbieters 88 von 120 möglichen Punkten. Das unkomprimierte Ausgangsmodell Qwen3.8-27B, das in voller Präzision rund 54 Gigabyte wiegt, erreichte im selben Versuchsaufbau 84 Punkte.

Besonders ausgeprägt zeigt sich die Stärke im Alltag einfacher Funktionsentscheidungen: Muss das Modell aus einer Liste mehrerer Schnittstellen das richtige Werkzeug identifizieren und mit den passenden Parametern versehen, löst Saluki laut Hersteller 47 von 48 Testszenarien fehlerfrei. Das konkurrierende 2-Bit-Format Mia kam hier lediglich auf 31 Treffer.

Modell Dateigröße Underdog Bench (max. 120) Werkzeugauswahl (max. 48) Parallele Calls (tolerant) Laufzeit
Saluki 27B 7,89 GB 88 47 55 % Standard llama.cpp
Main (Underdog) 7,90 GB 91 45 - Standard llama.cpp
Mia 2-bit 9,10 GB 85 31 70 % ExLlamaV3 (nur CUDA)
Qwen3.8-27B (FP16) ca. 54 GB 84 ca. 45 35 % GPU-Server / Cloud
Ternary Bonsai 2 5,95 GB 70 44 11 % BitNet / On-Device

Geringe Hardware-Hürden und offene Veröffentlichung

Ein entscheidender Vorzug von Saluki liegt in der breiten Kompatibilität. Während andere Ansätze für 2-Bit-Inferenz oft proprietäre Bibliotheken oder Nvidia-spezifische CUDA-Erweiterungen verlangen, liefert ConwayResearch das Modell als fertige GGUF-Datei (IQ2-Mix) auf Hugging Face aus. Lizenziert ist das Modell unter der liberalen Open-Source-Lizenz Apache 2.0.

Damit lässt sich das Modell lokal auf Apple-Silicon-Macs oder PCs mit Mittelklasse-Grafikkarten ausführen. Auch die Einbindung in bestehende Ökosysteme wie das beliebte Ollama auf Desktop-Rechnern oder Workflows via Model Context Protocol (MCP) ist damit ohne Hürden möglich.

In der Entwickler-Community stößt der Release auf reges Interesse. Erste unabhängige Messungen zeigen, dass das Modell bei langen Kontexten auf Consumer-Hardware flüssige Arbeitsgeschwindigkeiten von über 35 Tokens pro Sekunde liefert. Werden zusätzliche Beschleunigungsverfahren wie MTP-Draft-Heads integriert, lassen sich bei Routine-Abfragen sogar noch deutlich höhere Raten erzielen.

Technischer Hintergrund

ISTA-DASLab-Fundament: Die 2-Bit-Basis von Saluki baut auf Forschungsarbeiten des ISTA-DASLab auf, wurde von Underdog jedoch mit einem spezifischen IQ2-Gewichtungsmix verfeinert.

Thinking-Mechanismus: Saluki unterstützt standardmäßig internes Chain-of-Thought-Denken. Für reaktionsschnelle Tool-Aufrufe kann das Reasoning jedoch deaktiviert werden.

Wo die Grenzen extremer Kompression liegen

Trotz der beeindruckenden Effizienz sollten Entscheider die Grenzen des Modells nüchtern bewerten. Der scheinbare Vorsprung vor dem 54-GB-Original bedeutet nicht, dass ein 2-Bit-Modell über Nacht fundamental klüger geworden ist. Die Entwickler betonen selbst, dass ein Testset aus 120 Aufgaben statistischen Schwankungen unterliegt und das Modell schlicht hochgradig auf die Muster von Funktionsaufrufen abgestimmt ist.

An anderen Stellen fordert die Radikaldiät ihren Tribut: In formalen Mathematik-Wettbewerben (AIME) behält Saluki laut Hersteller nur 82 bis 85 Prozent des Niveaus des Ausgangsmodells. Auch buchstabenbasierte Sprachknobeleien wie Palindrome bereiten dem Modell spürbare Schwierigkeiten.

Zudem schwächelt Saluki bei komplexen, parallelen Werkzeugketten. Sollen mehrere unterschiedliche Befehle gleichzeitig in einer einzigen Antwort abgearbeitet werden, stürzte die Erfolgsquote bei strenger Prüfung auf 42 Prozent ab. Erst ein fehlertoleranter Parser, der kleinere Formatierungsfehler verzeiht, konnte 55 Prozent der Aufgaben retten. Hier behält das Modell Mia 2-bit mit 70 Prozent klar die Oberhand.

Saluki 27B ist damit ein hochgradig spezialisierter Baustein in der Debatte um lokale KI-Agenten und Datenschutz. Nach den Fortschritten bei ternären Modellen wie Bonsai 27B zeigt Saluki, dass die Zukunft lokaler Agenten nicht zwingend im Neudenken kompletter Architekturen liegt, sondern auch in der radikalen Optimierung bewährter Open-Source-Giganten.

🎯 Was das für die Praxis bedeutet

1. Lokale Agenten-Pipelines testen: Unternehmen, die sensible Schnittstellen ansteuern, können Saluki 27B als lokale Funktionsweiche evaluieren, ohne Daten an Cloud-Provider zu senden.

2. Rollenbasierte Aufgabenteilung etablieren: Saluki eignet sich hervorragend als ausführender Werkzeug-Worker. Für strategische Planung und komplexe Analysen sollte weiterhin ein Frontier-Modell die Führung behalten.

3. Fehlertolerante Parser einsetzen: Bei der Integration in eigene Software sollten Entwickler nachsichtige JSON- und Tool-Parser nutzen, um kleine Formatierungsunsicherheiten des 2-Bit-Modells abzufangen.

4. Hardware-Budgets hinterfragen: Für viele agentische Routineaufgaben sind keine fünfstelligen GPU-Server mehr nötig - Consumer-Hardware mit 16 GB RAM reicht zunehmend aus.

Dieser Artikel enthält eingebettete Inhalte externer Anbieter, etwa Videos oder Social-Media-Beiträge. kiwoche.com ordnet diese Inhalte redaktionell ein, übernimmt sie jedoch nicht als eigene Inhalte. Die Rechte daran verbleiben bei den jeweiligen Rechteinhabern; für die externen Inhalte sind die jeweiligen Anbieter verantwortlich. Eingebettete Inhalte können vollständig oder teilweise mit KI erstellt oder bearbeitet worden sein.

📰 Quellen
Underdog Blog ↗ Hugging Face ↗ Underdog AI auf X ↗ Md Ismail Šojal auf X ↗
Teilen: