Texte
Was Grok 4.5s neue EU-Offenlegung zum Trainingsdatenbestand beiträgt

xAI hat seine erste EU-Zusammenfassung zu Trainingsinhalten veröffentlicht, und zwar für Grok 4.5. Das Modell liegt bei Text, Bildern, Audio und Video jeweils in der größten verfügbaren Größenklasse. xAI gibt außerdem an, alle sechs Quellenkategorien aus der Vorlage der Europäischen Kommission genutzt zu haben.
Damit lässt sich Grok 4.5 erstmals mit den bereits in meinem Datensatz zur Transparenz von KI-Trainingsdaten erfassten Meldungen vergleichen. Zugleich wird die Vorlage selbst auf die Probe gestellt: Die Fragen nach Quellen zeigen echte Unterschiede zwischen Anbietern, während die Größenklassen sehr verschiedene Modelle häufig zusammenfassen.
Kernaussage: Artikel 53 Absatz 1 Buchstabe d des EU AI Act verpflichtet Anbieter von Allzweck-KI-Modellen, eine Zusammenfassung ihrer Trainingsinhalte nach der standardisierten Vorlage des AI Office zu veröffentlichen. In der hier verglichenen Momentaufnahme mit elf Einträgen melden sechs Modelle mehr als zehn Billionen Text-Token, fünf zwischen einer Milliarde und zehn Billionen und keines die kleinste Klasse. Weil die oberste Klasse keine Obergrenze hat, erhalten Grok 4.5, GPT-5.5, Gemini 3 Pro und ein offenes Modell mit drei Milliarden Parametern dieselbe Einstufung. Die Meldung zeigt, welche Arten von Quellen xAI nach eigener Aussage nutzte, aber nicht, wie groß Groks Korpus im Vergleich zu anderen Modellen derselben Klasse ist.
Breite Größenklassen begrenzen den Vergleich
| Größenklasse der Text-Trainingsdaten | Modelle |
|---|---|
| Mehr als zehn Billionen Token, ohne Obergrenze | 6 |
| Eine Milliarde bis zehn Billionen Token | 5 |
| Weniger als eine Milliarde Token | 0 |
Zur obersten Klasse gehören Gemini 3 Pro, GPT-5.5, Grok 4.5 und Muse Spark, aber auch Swiss AIs Apertus-70B und Hugging Faces SmolLM3-3B. Die mittlere Klasse umfasst vier Größenordnungen; Microsoft Phi-4, SpeakLeash Bielik und Bria fallen hinein. Nur Bria ergänzt präzise Angaben: „bis zu 19,2 Milliarden Token“ und „479 Millionen Bilder“. Gemini, GPT, Grok und Muse melden in allen Modalitäten die höchste Klasse, sodass die Zusammenfassungen keine Rangfolge nach Umfang erlauben.
Quellenkategorien unterscheiden stärker
| Anbieter und Modell | Öffentlich | Lizenziert | Privat, Dritte | Gecrawlt | Nutzerdaten | Synthetisch |
|---|---|---|---|---|---|---|
| Meta, Muse Spark | Ja | Ja | Ja | Ja | Ja | Ja |
| OpenAI, GPT-5.5 | Ja | Ja | Ja | Ja | Ja | Ja |
| xAI, Grok 4.5 | Ja | Ja | Ja | Ja | Ja | Ja |
| SpeakLeash, Bielik v3 11B | Ja | Ja | Nein | Ja | Nein | Ja |
| Hugging Face, SmolLM3-3B | Ja | Nein | Nein | Nein | Nein | Ja |
| Swiss AI, Apertus-70B | Ja | Nein | Nein | Nein | Nein | Nein |
| Bria, Bria 3.2 | Nein | Ja | Nein | Nein | Nein | Nein |
Meta, OpenAI und xAI antworten in jeder Kategorie mit Ja. Apertus nennt öffentliche Datensätze und erklärt, keinen eigenen Crawler betrieben zu haben. Bria 3.2 sei ausschließlich mit kommerziell lizenzierten Bildern trainiert worden. Google beantwortet nur drei von sechs Quellenfragen; ein leeres Feld bedeutet daher „nicht angegeben“, nicht „Nein“. Microsoft antwortet auf einige eigentlich binäre Felder mit Prosa. Die Vorlage ermöglicht Vergleiche, doch die Anbieter füllen sie nicht immer vergleichbar aus.
xAI erklärt zudem, den GPAI-Verhaltenskodex nicht unterzeichnet zu haben und Opt-out-Signale stattdessen direkt zu beachten. Es ist der erste Anbieter in diesem Datensatz, der die Vorlage ohne Unterzeichnung veröffentlicht. Kodex-Unterzeichnung und Veröffentlichung einer Zusammenfassung sind getrennte Handlungen mit unterschiedlichen Fristen; keines sollte als Ersatzmaß für das andere dienen.
Eine zweite Suche fand sechs weitere Zusammenfassungen
Nach der Aufnahme von Grok 4.5 fand eine anbieterweise Suche sechs glaubwürdige öffentliche Zusammenfassungen, die noch nicht in den elf Einträgen enthalten sind: Adobe Firefly Image Model 5, Domyn Large, FastwebMIIA, Thinking Machines Inkling, Microsoft MAI-Image-2 und Meta Muse Image. Sie werden vor der Aufnahme validiert und normalisiert; deshalb fließen ihre Werte noch nicht in die Zahlen oben ein.
Auf Moonshot AIs offizieller Website, in der API-Dokumentation und auf der offiziellen Modellseite fand ich keine standardisierte Artikel-53-Zusammenfassung für Kimi K2.5. Der technische Bericht nennt rund 15 Billionen gemischte Bild- und Text-Token, ist aber keine standardisierte EU-Offenlegung. Ob die Pflicht greift, hängt auch davon ab, ob Moonshot das Modell auf dem EU-Markt bereitgestellt hat. Das Fehlen allein belegt daher keinen Verstoß.
Reaktionen bisher
Ich fand keine öffentliche Reaktion der Europäischen Kommission, des AI Office oder eines benannten unabhängigen Fachleuts speziell auf die Grok-4.5-Meldung. Das ist weder als Zustimmung noch als Kritik zu verstehen.
Die breitere Debatte liefert Kontext. Die Kommission nennt die Vorlage eine „gemeinsame Mindestgrundlage“, die Transparenz verbessern und zugleich Geschäftsgeheimnisse schützen soll, nicht ein technisch vollständiges Inventar. Eine Koalition von 38 Kreativen- und Rechteinhaberorganisationen hat Unzufriedenheit geäußert, weil die Informationen für die Rechtsausübung nicht ausreichten. Das Europäische Parlament fordert allgemein mehr Transparenz, Vergütung und die Möglichkeit, die Nutzung geschützter Inhalte zu verhindern. Diese Positionen betreffen den Rahmen insgesamt, nicht Grok 4.5.
Einschränkungen: Alle Zahlen sind Selbstauskünfte und ungeprüft. Die elf Einträge sind eine Momentaufnahme, keine Marktstudie; drei davon sind Microsoft-Phi-Varianten. Die Datenstichtage reichen von März 2024 bis Juni 2026. Für Modelle, die vor dem 2. August 2025 auf den EU-Markt kamen, läuft die Veröffentlichungsfrist bis zum 2. August 2027. Eine fehlende Zusammenfassung ist daher nicht zwingend ein Compliance-Verstoß.
Daten: ai_training_metrics, Transparency Report API; erste Momentaufnahme von elf Modellen neun verschiedener Anbieter, mit Veröffentlichungen von Juni 2025 bis Juli 2026. Ergänzende Suche am 23. Juli 2026.