Wenn ein Sprachmodell Programmiercode schreibt, spart das Unternehmen Arbeitsstunden. Wenn ein Modell jedoch lernt, eigenständig Hypothesen aufzustellen, Machine-Learning-Experimente zu planen und aus Fehlschlägen die richtigen Schlüsse für den nächsten Trainingslauf zu ziehen, betrifft das den Kern der Technologie selbst: die automatisierte Selbstbeschleunigung von Forschung und Entwicklung (AI R&D). Eine von ehemaligen Forschern aus OpenAIs Sicherheits- und Preparedness-Teams gegründete Organisation hat dazu nun eine Untersuchung vorgelegt - und verbindet ihre Ergebnisse mit einem radikalen Bruch wissenschaftlicher Traditionen.

Das Forschungsinstitut P-Zero Research, gegründet von den früheren OpenAI-Forschern Ollie Jaffe und Dane Sherburn, hat mit TasteVal einen neuartigen Benchmark vorgestellt. Die dazugehörige Forschungsarbeit ist als Preprint auf arXiv erschienen. Ziel des Vorhabens ist es, den sogenannten „experimentellen Forschungssinn“ (Experimental Research Taste) führender KI-Modelle quantitativ zu vermessen. Gleichzeitig verweigert das Team in einem begleitenden Grundsatzpapier die Veröffentlichung der konkreten Testaufgaben und verzichtet bewusst auf öffentliche Bestenlisten, um den Wettlauf um automatisierte KI-Entwicklung nicht noch weiter anzufeuern.

Forschungssinn als Rechenzeit-Multiplikator

Die Autoren definieren Forschungssinn als die dreiteilige Fähigkeit, relevante Fragestellungen auszuwählen, aussagekräftige Experimente zu entwerfen und die daraus resultierenden Daten korrekt zu interpretieren. TasteVal konzentriert sich gezielt auf die experimentelle Komponente: Ein Modell erhält eine fest vorgegebene Forschungsaufgabe und muss durch wiederholte Experimente eine vorgegebene Zielmetrik maximieren.

Um die strategische Versuchsplanung von reinen Programmierfertigkeiten zu trennen, wählten die Forscher ein zweiteiliges Setup: Das zu prüfende Modell übernimmt ausschließlich die Rolle des Versuchsleiters (Researcher). Es formuliert Hypothesen, legt Hyperparameter fest und entscheidet, welche Tests gestartet werden. Die technische Umsetzung des Codes übernimmt ein separater, fest vorgegebener Programmier-Agent, der die Testläufe auf einer Nvidia H100 GPU ausführt. Ein Durchlauf endet, sobald 40 GPU-Stunden oder 120 Zeitstunden abgelaufen sind.

Die Aufgabenstellung umfasst acht offene Probleme, die den Alltag führender KI-Entwicklungslabore widerspiegeln - darunter die Kuration von Trainingsdaten für Sprachmodelle, das Pretraining kleiner Basismodelle, Feintuning-Methoden, Präferenzmodellierung (RLHF) sowie Abwehrmaßnahmen gegen feindselige Eingaben (Adversarial Robustness). Die menschliche Vergleichsbasis bildeten 24 erfahrene Machine-Learning-Experten mit Stationen bei Google DeepMind, OpenAI, Microsoft Research und Nvidia, wobei für jede Aufgabe der jeweils beste menschliche Durchlauf als Referenzlinie (Human Baseline) herangezogen wurde.

Das zentrale methodische Konzept von TasteVal ist die Definition von Forschungssinn als Rechenzeit-Effizienz: Ein System, das mit der Hälfte der GPU-Rechenzeit dasselbe Forschungsergebnis wie ein menschlicher Experte erzielt, besitzt laut den Autoren den doppelten Forschungssinn. Ein höherer Wert wirkt in der Praxis wie ein Rechenkraft-Multiplikator auf die gesamte Forschungsabteilung.

Claude Opus 5.5 überflügelt menschliche Experten

Die Auswertung von 20 Modellgenerationen seit 2023 zeigt einen auffälligen Entwicklungssprung. Nach Angaben der Autoren verdoppelte sich die experimentelle Recheneffizienz von Frontier-Modellen zwischen Mitte 2023 und Ende 2025 zunächst alle 14 Monate. Seit Dezember 2025 habe sich dieses Tempo jedoch dramatisch beschleunigt: Seither verdopple sich der gemessene Forschungssinn im Schnitt alle 3,0 Monate.

An der Spitze des Feldes platziert sich das kürzlich vorgestellte Spitzenmodell Claude Opus 5.5 von Anthropic. Das Modell erreichte einen Rechenzeit-Multiplikator von 2,30 (bei einem 95-Prozent-Konfidenzintervall von 1,15 bis 4,37). Das bedeutet: Das Modell benötigte weniger als die Hälfte der experimentellen H100-Rechenzeit, um die Lösungsqualität der menschlichen Experten-Baseline zu erreichen. Noch drastischer fällt der finanzielle Vergleich aus: Pro Versuchsdurchlauf fielen bei dem Modell nach Angaben der Forscher rund 1/30 der Kosten an, die für die Entlohnung der menschlichen Spezialisten aufgewendet werden mussten.

Modell Veröffentlichung Compute-Multiplikator Status gegenüber Experten
GPT-4 Juni 2023 0,027x Weit unter Expertenniveau
GPT-5.2 Dezember 2025 0,277x Rund 28 % menschlicher Effizienz
Opus 4.8 Mai 2026 0,842x Nah an menschlicher Baseline
Opus 5 Juli 2026 1,286x Übertrifft menschliche Baseline
Fable 5.1 September 2026 1,716x Deutlicher Effizienzvorsprung
Claude Opus 5.5 September 2026 2,304x Mehr als doppelt so effizient wie Experten

Die Autoren verknüpfen ihre Messdaten mit den makroökonomischen Projektionen des AI Futures Model, über dessen Vorhersagen zur vollständigen Automatisierung von KI-Forschung bis 2028 bereits berichtet wurde. In diesem Modell ist experimentelle Rechenkapazität der maßgebliche Flaschenhals, sobald die Programmierarbeit automatisiert ist. Legt man die bei TasteVal beobachtete Beschleunigungsrate zugrunde, steigt die statistische Wahrscheinlichkeit einer durch Forschungssinn getriebenen Singularität („Taste-Only Singularity“) im Modell von 51 auf 88 Prozent. Das prognostizierte Median-Datum für das Erreichen künstlicher Superintelligenz (ASI) rückt dabei von Mitte 2030 auf Ende 2028 vor.

Dual-Use-Dilemma: Warum der Testdatensatz geheim bleibt

Bemerkenswerter als die reinen Leistungsdaten ist der Umgang von P-Zero Research mit den Ergebnissen. In einem Grundsatzmanifest mit dem Titel Our thoughts on publishing dual-use evaluations erklären die Forscher, warum sie den gesamten Testdatensatz, die Bewertungsfunktionen und die detaillierten Aufgaben unter Verschluss halten.

Evaluierungen von KI-Forschungsfähigkeiten seien per se eine Dual-Use-Technologie mit erheblichem Missbrauchspotenzial. Öffentliche Benchmarks signalisieren den großen Entwicklungslaboren nicht nur, welche Fähigkeiten technisch umsetzbar sind, sondern liefern ihnen zugleich eine messbare Zielgröße zur Optimierung. Zudem lenken prestigeträchtige Ranglisten zusätzliches Kapital und Personal in die Beschleunigung automatisierter KI-Forschung - ein Prozess, den P-Zero Research als „unterm Strich negativ für die Menschheit“ bewertet.

„Wir glauben, dass eine Beschleunigung bestimmter Arten der KI-Entwicklung unterm Strich negativ für die Welt ist. Öffentliche Benchmarks können als Bestenlisten fungieren, die zu Optimierung und ungebremstem Wettbewerb einladen.“

- Dane Sherburn, Oliver Jaffe und Edward Burrowes, P-Zero Research

Um diesem Dilemma zu begegnen, unterteilt P-Zero jede Evaluierung in vier getrennte Artefakte, über deren Freigabe unabhängig entschieden wird:

Der Vier-Stufen-Filter von P-Zero

1. Methodik (Freigegeben): Das Aufgabendesign, die Metriken und das Referenzkonzept werden offengelegt, um die wissenschaftliche Diskussion über Messverfahren zu ermöglichen.

2. Statische Resultate (Freigegeben): Scores, Trends und Vergleiche historischer Modelle werden veröffentlicht, um Politikern und der Öffentlichkeit unabhängige Daten über tatsächliche Fähigkeiten an die Hand zu geben.

3. Laufende Aktualisierungen (Zurückgehalten): Das regelmäßige Nachtesten neuer Modelle wird nicht als dynamische Bestenliste publiziert, um keinen kontinuierlichen Wettlauf der Hersteller anzuheizen.

4. Testdatensatz und Aufgaben (Streng gesperrt): Die konkreten Aufgaben und Trajektorien bleiben geheim, um Trainingskontaminationen zu verhindern und zu verhindern, dass Labore ihre Systeme direkt auf den Benchmark hintrainieren.

P-Zero formuliert zwei Bedingungen, die beide erfüllt sein müssen, damit ein Artefakt überhaupt veröffentlicht wird: Erstens müssen die führenden Frontier-Labore intern bereits über vergleichbare Messwerkzeuge verfügen. Zweitens muss die Veröffentlichung eine konkrete sicherheitspolitische Entscheidung oder Prognose nachweisbar verändern. Diese Haltung deckt sich mit den jüngsten Debatten über verbindliche Sicherheitsgrenzen und das sogenannte Pacing the Frontier zur Verlangsamung rekursiver Selbstverbesserung, wie sie auch der ausgestiegene Anthropic-Forscher Jacob Coxon forderte.

Kritik: Echter Forschungssinn oder nur geschicktes Hill-Climbing?

In der KI-Forschungsgemeinschaft stoßen die Veröffentlichung und die Geheimhaltung der Daten auf geteilte Reaktionen. Während Befürworter loben, dass erstmals der strategische Versuchsaufbau isoliert von Programmierroutinen gemessen wird, üben Forscher wie Dylan Hadfield-Menell und David Pfau deutliche Kritik an der Begriffsverwendung.

Was TasteVal messe, sei im Kern kein wissenschaftlicher „Forschungssinn“, sondern geschickte empirische Metrik-Optimierung („Hill-Climbing“) innerhalb eines eng abgesteckten Versuchskorridors. Echte wissenschaftliche Genialität zeige sich darin, das richtige Problem überhaupt erst zu formulieren, Paradigmenwechsel anzustoßen und theoretische Sackgassen intuitiv zu erkennen - Aspekte, die TasteVal bewusst ausklammert.

Die Autoren von P-Zero räumen diese Limitationen in ihrer Publikation offen ein: Die acht Aufgaben seien so gewählt worden, dass sie schnell und kostengünstig verifizierbar seien - genau die Art von Aufgaben also, bei denen Sprachmodelle durch systematisches Durchprobieren am stärksten glänzen. Zudem repräsentiere die menschliche Baseline zwar kompetente Industrie-Entwickler, nicht aber Spitzenforscher vom Kaliber eines Turing-Preisträgers. Auf der anderen Seite wendete das Team für die Modell-Abfragen nur minimale Optimierung auf, was darauf hindeuten könnte, dass das tatsächliche Potenzial von Modellen wie Opus 5.5 bei intensiverem Prompting sogar noch höher liegt.

Ein weiteres Problem bleibt das wissenschaftliche Peer-Review: Wer Testaufgaben aus Sicherheitsgründen sperrt, entzieht sich der unabhängigen Nachprüfbarkeit durch die Fachwelt. Ähnlich wie bei früheren Evaluierungen der Evaluierungs-Organisation METR müssen externe Beobachter darauf vertrauen, dass die Aufgaben keine systematischen Verzerrungen aufweisen.

🎯 Was das für die Praxis bedeutet

1. Rechenzeit wird zum dominierenden F&E-Engpass: Wenn Modelle Experimente mit 2,3-facher Effizienz zu einem Dreißigstel der Personalkosten planen, bestimmt künftig nicht mehr die Kopfzahl der Forschungsabteilung, sondern das verfügbare GPU-Budget das Innovationstempo.

2. Trennung von Konzeption und Ausführung: Das TasteVal-Setup demonstriert die Architektur künftiger Entwicklungsteams: Ein Reasoning-Modell plant die Versuchsreihen, während spezialisierte Coding-Agenten die Ausführung auf Compute-Clustern automatisieren.

3. Sicherheitsrisiko Selbstverbesserung rückt näher: Die rasante Verdopplung der experimentellen Fähigkeiten zeigt, dass Frontier-Modelle zunehmend in der Lage sind, ihre eigenen Nachfolger zu optimieren. Für Technologieverantwortliche gewinnt die Frage nach Absicherung und Leitplanken autonomer Entwicklungsumgebungen höchste Priorität.

Dieser Artikel enthält eingebettete Inhalte externer Anbieter, etwa Videos oder Social-Media-Beiträge. kiwoche.com ordnet diese Inhalte redaktionell ein, übernimmt sie jedoch nicht als eigene Inhalte. Die Rechte daran verbleiben bei den jeweiligen Rechteinhabern; für die externen Inhalte sind die jeweiligen Anbieter verantwortlich. Eingebettete Inhalte können vollständig oder teilweise mit KI erstellt oder bearbeitet worden sein.

📰 Quellen
P-Zero Research Publishing ↗ P-Zero TasteVal ↗ P-Zero auf X ↗ TasteVal Paper (arXiv) ↗
Teilen: