Scritti
Cosa aggiunge la nuova divulgazione UE di Grok 4.5 al quadro dei dati di addestramento

xAI ha pubblicato il suo primo riepilogo europeo dei contenuti di addestramento, relativo a Grok 4.5. Il modello rientra nelle fasce di dimensione più alte per testo, immagini, audio e video e dichiara di utilizzare tutte e sei le categorie di fonti previste dal modello della Commissione europea.
Grok 4.5 diventa così confrontabile con i riepiloghi già raccolti nel mio set di dati sulla trasparenza dell'addestramento IA. La dichiarazione mette alla prova anche il modello: le domande sulle fonti mostrano differenze significative tra fornitori, mentre le ampie fasce dimensionali spesso raggruppano modelli molto diversi.
In sintesi: l'articolo 53(1)(d) dell'AI Act impone ai fornitori di modelli di IA per finalità generali di pubblicare un riepilogo dei contenuti di addestramento usando il modello standard dell'Ufficio per l'IA. Nelle 11 voci qui confrontate, sei modelli dichiarano oltre 10.000 miliardi di token testuali e cinque tra un miliardo e 10.000 miliardi; nessuno usa la fascia minima. Poiché la fascia superiore non ha un limite, Grok 4.5, GPT-5.5, Gemini 3 Pro e un modello aperto da tre miliardi di parametri ricevono la stessa classificazione. Sappiamo quali tipi di fonti xAI dichiara di aver usato, ma non quanto sia grande il corpus di Grok rispetto agli altri modelli della fascia.
Le ampie fasce limitano il confronto
| Fascia dei dati testuali | Modelli |
|---|---|
| Oltre 10.000 miliardi di token, senza limite | 6 |
| Da un miliardo a 10.000 miliardi di token | 5 |
| Meno di un miliardo di token | 0 |
La fascia più alta include Gemini 3 Pro, GPT-5.5, Grok 4.5 e Muse Spark, ma anche Apertus-70B di Swiss AI e SmolLM3-3B di Hugging Face. La fascia intermedia copre quattro ordini di grandezza e comprende Microsoft Phi-4, SpeakLeash Bielik e Bria. Solo Bria aggiunge cifre precise: «fino a 19,2 miliardi di token» e «479 milioni di immagini». Gemini, GPT, Grok e Muse dichiarano la fascia massima in tutte le modalità; i riepiloghi non bastano quindi a ordinarli per scala.
Le categorie delle fonti differenziano meglio
| Fornitore e modello | Pubblici | Licenza | Privati terzi | Crawling | Utenti | Sintetici |
|---|---|---|---|---|---|---|
| Meta, Muse Spark | Sì | Sì | Sì | Sì | Sì | Sì |
| OpenAI, GPT-5.5 | Sì | Sì | Sì | Sì | Sì | Sì |
| xAI, Grok 4.5 | Sì | Sì | Sì | Sì | Sì | Sì |
| SpeakLeash, Bielik v3 11B | Sì | Sì | No | Sì | No | Sì |
| Hugging Face, SmolLM3-3B | Sì | No | No | No | No | Sì |
| Swiss AI, Apertus-70B | Sì | No | No | No | No | No |
| Bria, Bria 3.2 | No | Sì | No | No | No | No |
Meta, OpenAI e xAI rispondono Sì a ogni categoria. Apertus cita dataset pubblici e afferma di non aver gestito un proprio crawler. Bria 3.2 sarebbe stato addestrato esclusivamente su immagini con licenza commerciale. Google risponde solo a tre delle sei domande sulle fonti, quindi uno spazio vuoto significa «non dichiarato», non «No». Microsoft risponde ad alcuni campi binari con testo libero. Il modello consente il confronto, ma non tutti lo compilano nello stesso modo.
xAI dichiara inoltre di non aver firmato il Codice di buone pratiche GPAI e di rispettare direttamente i segnali di esclusione. È il primo fornitore del dataset a pubblicare il modello senza firmare il Codice. Firma e pubblicazione del riepilogo sono atti separati, con scadenze diverse, e nessuno dei due dovrebbe essere usato come indicatore dell'altro.
Una seconda ricerca ha trovato altri sei riepiloghi
Dopo aver aggiunto Grok 4.5, una ricerca fornitore per fornitore ha individuato sei riepiloghi pubblici credibili non ancora inclusi nelle 11 voci: Adobe Firefly Image Model 5, Domyn Large, FastwebMIIA, Thinking Machines Inkling, Microsoft MAI-Image-2 e Meta Muse Image. Saranno convalidati e normalizzati prima dell'inserimento, quindi i loro valori non sono mescolati ai conteggi precedenti.
Non ho trovato un riepilogo standard dell'articolo 53 per Kimi K2.5 di Moonshot AI sul sito ufficiale, nella documentazione API o nella pagina ufficiale del modello. Il rapporto tecnico descrive circa 15.000 miliardi di token misti visivi e testuali, ma non è la divulgazione standard UE. L'applicabilità dipende anche dall'immissione del modello sul mercato dell'UE da parte di Moonshot; l'assenza, da sola, non prova una violazione.
Le reazioni finora
Non ho trovato reazioni pubbliche della Commissione europea, dell'Ufficio per l'IA o di un esperto indipendente identificato specificamente sulla dichiarazione di Grok 4.5. Ciò non va interpretato né come approvazione né come critica.
Il dibattito generale offre contesto. La Commissione definisce il modello una «base minima comune», pensata per aumentare la trasparenza proteggendo i segreti commerciali, non un inventario tecnicamente completo. Una coalizione di 38 organizzazioni di creatori e titolari dei diritti ha espresso insoddisfazione, sostenendo che le informazioni non bastano a esercitare i propri diritti. Il Parlamento europeo ha chiesto più in generale maggiore trasparenza, remunerazione e la possibilità di impedire l'uso di contenuti protetti. Sono posizioni sul quadro complessivo, non su Grok 4.5.
Avvertenze: tutte le cifre sono autodichiarate e non sottoposte ad audit. Le 11 voci sono un'istantanea, non un'indagine di mercato, e tre sono varianti Microsoft Phi. Le date limite dei dati vanno da marzo 2024 a giugno 2026. I modelli immessi sul mercato UE prima del 2 agosto 2025 hanno tempo fino al 2 agosto 2027 per pubblicare; l'assenza di un riepilogo non indica necessariamente una violazione.
Dati: ai_training_metrics, Transparency Report API; istantanea iniziale di 11 modelli di nove fornitori, con dichiarazioni pubblicate tra giugno 2025 e luglio 2026. Ricerca supplementare svolta il 23 luglio 2026.