Als Anthropic Anfang August ankündigte, künftige Claude-Modelle mit maschinenlesbaren Kennzeichnungen auszustatten, blieb das genaue technische Verfahren noch unter Verschluss. In unserer Analyse zur EU-Kennzeichnungspflicht hatten wir festgehalten, dass offen war, auf welche mathematische Methode das KI-Labor setzen würde. In einem ausführlichen Erklärbeitrag hat das US-Unternehmen die Details nun offiziell offengelegt: Claude nutzt eine Variante des von Google DeepMind entwickelten SynthID-Text-Verfahrens. Das Signal greift direkt in die Zufallsauswahl einzelner Wörter ein, ohne den Text für menschliche Leser zu verändern.
Google DeepMinds SynthID als mathematisches Fundament
Das eingesetzte Verfahren basiert auf Forschungsarbeiten, die Google DeepMind im Oktober 2024 in einem Nature-Fachaufsatz publiziert hatte, und knüpft an ein theoretisches Konzept des Informatikers Scott Aaronson aus dem Jahr 2022 an. Anders als frühe Wasserzeichen-Ansätze bestraft oder verbietet SynthID bestimmte Wortwahlen nicht künstlich.
Sprachmodelle erzeugen Texte bekanntlich Token für Token. Bei jedem Schritt berechnet das Modell Wahrscheinlichkeiten für plausible Folgewörter. Steht im Satzanfang etwa „Das Wetter war kalt und…“, sind Wörter wie „stürmisch“ oder „ungemütlich“ gleichermaßen wahrscheinlich. Im regulären Betrieb entscheidet ein gewöhnlicher Pseudozufallsgenerator, welches dieser passenden Wörter gewählt wird. Genau an dieser Weiche setzt das Wasserzeichen an: Es ändert nicht die Grammatik oder die Bedeutung, sondern ersetzt den Zufallswürfel durch eine kryptografisch gesteuerte Zahlenfolge.
Das Monopoly-Prinzip: Würfel gegen die Kreiszahl Pi getauscht
Anthropic veranschaulicht das Prinzip mit einem eingängigen Vergleich aus der Spielwelt: Man stelle sich eine Partie Monopoly vor. Normalerweise bestimmt der Wurf zweier Würfel, wie viele Felder eine Spielfigur vorrückt. Nun ersetzt man die Würfel durch die Nachkommastellen der Kreiszahl Pi und beginnt an einer geheimen Stelle - etwa ab der millionsten Ziffer. Für die Mitspieler am Tisch fühlt sich jeder Zug vollkommen zufällig an, und der Spielverlauf bleibt unbeeinträchtigt. Wer jedoch den geheimen Startpunkt in der Pi-Zahlenreihe kennt, kann im Nachhinein anhand der Zugfolge statistisch belegen, dass nach diesem festen Muster gezogen wurde.
Übertragen auf Claude bedeutet das: Ein Leser merkt keinen Unterschied zwischen markiertem und unmarkiertem Text. Es werden weder unsichtbare Sonderzeichen eingefügt noch zusätzliche Rechenschritte fällig. Laut Anthropic fallen weder zusätzliche Token-Kosten noch spürbare Latenzen beim Modellaufruf an. Zudem enthalte das Signal keinerlei Rückschlüsse auf einzelne Nutzer, Unternehmen oder vertrauliche Chat-Inhalte.
Freitext, Code und Lektorat: Wo das Signal greift
Da das Wasserzeichen auf die Wahlfreiheit des Modells zwischen mehreren gleichwertigen Begriffen angewiesen ist, verhält es sich je nach Textgattung und Anwendungsfall grundlegend unterschiedlich:
| Anwendungsfall | Wahlfreiheit (Entropie) | Signal-Stärke | Praktische Auswirkung |
|---|---|---|---|
| Kreativ- und Fließtexte | Hoch (viele Synonyme) | Sehr stark | Bereits nach wenigen Sätzen mit hoher Konfidenz nachweisbar |
| Vollständige Übersetzung | Mittel bis Hoch | Vollständig | Da Claude jedes Zielwort auswählt, wird der gesamte Text markiert |
| Grammatik-Lektorat | Sehr gering | Kaum messbar | Da fast alle Wörter vom Menschen stammen, greift das Signal ins Leere |
| Faktische Aussagen & Mathe | Gleich null | Keine Markierung | Bei „2 + 2 = 4“ gibt es keine Alternative; Signal wird ausgesetzt |
| Programmcode (Syntax) | Sehr gering | Minimal | Keine Fehler durch Worttausch; Signal beschränkt sich meist auf Kommentare |
Besonders bei Quellcode beruhigt der Hersteller Entwicklerteams: Da Compiler und Interpreter exakte Schlüsselwörter und Funktionssignaturen verlangen, setzt das System bei funktionalem Programmcode keine manipulierten Alternativen ein. Das Wasserzeichen kann sich im Code allenfalls in frei formulierten Kommentaren oder variablen Bezeichnern niederschlagen, sodass die Programmlogik unangetastet bleibt.
Detektions-API statt fehleranfälliger Stil-Detektoren
Heuristische Scanner scheitern: Bisherige KI-Detektoren (wie Pangram oder GPTZero) stützen sich meist auf statistische Stilmerkmale - etwa die Häufung bestimmter Phrasen wie „this isn’t X, it’s Y“ oder die Vorliebe für Wörter wie „quietly“. Dies führte in der Vergangenheit regelmäßig zu falschen Verdächtigungen bei rein menschlichen Texten.
Mathematischer Schlüssel: Die von Anthropic angekündigte Detektions-API prüft dagegen nicht den Schreibstil, sondern gleicht die Token-Abfolge mathematisch mit dem geheimen Verteilungsschlüssel ab. Das verhindert Fehlalarme bei menschlichen Autoren, setzt zur Überprüfung aber die Schnittstelle des Herstellers voraus.
Weltweiter Rollout und C2PA für Mediendateien
Hintergrund der Maßnahme sind die Transparenzanforderungen des EU AI Act Code of Practice, der seit Anfang August 2026 von führenden KI-Anbietern umgesetzt wird. Anthropic rollt das Text-Wasserzeichen weltweit aus, da eine zuverlässige geografische Trennung nach Regionen technisch kaum dauerhaft aufrechtzuerhalten sei. Für ältere Modellversionen, die vor dem Stichtag erschienen sind, gilt eine Übergangsfrist im Rahmen des europäischen Regelwerks; sie sollen schrittweise in den kommenden Monaten nachgerüstet werden.
Für generierte Bild- und Vektordateien (.png, .jpg, .svg) setzt Anthropic parallel auf den offenen C2PA-Standard. Hierbei werden kryptografisch signierte Metadaten in die Datei eingebettet, die von jedem C2PA-kompatiblen Bildbetrachter ausgelesen werden können. Wie bei allen Metadaten gilt jedoch: Durch Screenshots oder einfaches Neukomprimieren gehen diese Datei-Zertifikate verloren, während das statistische Text-Wasserzeichen auch leichte redaktionelle Anpassungen übersteht.
🎯 Was das für die Praxis bedeutet
1. Keine versteckten API-Mehrkosten: Das SynthID-Verfahren verändert lediglich die Auswahlwahrscheinlichkeiten während des Samplings. Für Unternehmenskunden entstehen weder zusätzliche Berechnungs-Tokens noch verlängerte Antwortzeiten.
2. Kein Datenschutzrisiko im Text: Das Wasserzeichen transportiert keine Identifikationsmerkmale. Weder der anfragende Nutzer noch Firmennamen oder Chat-Inhalte lassen sich aus dem Signal rekonstruieren.
3. Grenzen bei Code und Lektorat kennen: Wer bestehende Dokumente von Claude korrigieren lässt, erzeugt kaum messbare Wasserzeichenspuren. Wer dagegen vollständige Übersetzungen oder Rohentwürfe generiert, hinterlässt ein klares maschinenlesbares Signal.
4. Detektions-API für Compliance einplanen: Sobald Anthropic die angekündigte Prüfschnittstelle freigibt, können Medienhäuser und Prüfstellen Claude-Texte verlässlich verifizieren, ohne auf unzuverlässige Stil-Scanner angewiesen zu sein.


