← Blog

Ce que la nouvelle divulgation européenne de Grok 4.5 ajoute au dossier des données d'entraînement

Règlement IA de l'UEIA/LLMTransparenceDonnées
Comparaison abstraite de divulgations de données d'entraînement d'IA selon trois grandes catégories

xAI a publié son premier résumé européen du contenu d'entraînement, consacré à Grok 4.5. Le document place le modèle dans les catégories de taille les plus élevées pour le texte, les images, l'audio et la vidéo, et indique avoir utilisé les six catégories de sources prévues par le modèle de la Commission européenne.

Grok 4.5 devient ainsi comparable aux résumés déjà rassemblés dans mon jeu de données sur la transparence des données d'entraînement. Cette déclaration permet aussi de tester le modèle lui-même : les questions sur les sources font apparaître de vraies différences entre fournisseurs, tandis que les tranches de taille regroupent souvent des modèles très différents.

En bref : l'article 53(1)(d) du règlement européen sur l'IA oblige les fournisseurs de modèles d'IA à usage général à publier un résumé de leur contenu d'entraînement selon le modèle standardisé du Bureau de l'IA. Dans l'instantané de 11 entrées utilisé ci-dessous, six modèles déclarent plus de dix mille milliards de tokens de texte et cinq entre un milliard et dix mille milliards. Aucun n'utilise la plus petite tranche. Comme la tranche supérieure n'a pas de plafond, Grok 4.5, GPT-5.5, Gemini 3 Pro et un modèle ouvert de trois milliards de paramètres reçoivent la même classification. La déclaration indique les types de sources que xAI dit avoir utilisés, mais pas la taille du corpus de Grok par rapport aux autres modèles de cette tranche.

De larges tranches de taille limitent la comparaison

La question de la taille intéressera sans doute titulaires de droits, chercheurs et régulateurs, mais elle distingue peu les modèles. Les fournisseurs choisissent l'une de trois tranches, chacune couvrant une vaste amplitude.

Tranche de taille des données textuellesNombre de modèles
Plus de dix mille milliards de tokens, sans plafond6
D'un milliard à dix mille milliards de tokens5
Moins d'un milliard de tokens0

La tranche supérieure comprend la famille Gemini 3 Pro de Google, GPT-5.5 d'OpenAI, Grok 4.5 de xAI et Muse Spark de Meta. Elle comprend aussi Apertus-70B de Swiss AI et SmolLM3-3B de Hugging Face, deux modèles ouverts, dont l'un compte trois milliards de paramètres. Quelles que soient les différences entre leurs corpus, la réponse déclarée est identique.

La tranche intermédiaire est tout aussi large : « d'un milliard à dix mille milliards de tokens » couvre quatre ordres de grandeur. La famille Phi-4 de Microsoft, Bielik de SpeakLeash et Bria y figurent. Bria fournit le seul chiffre précis de cet instantané, avec « jusqu'à 19,2 milliards de tokens » et « 479 millions d'images ». Ce texte apporte une précision utile au-delà de la tranche standard.

La même limite vaut pour les comparaisons par modalité. Gemini 3 Pro, GPT-5.5, Grok 4.5 et Muse Spark déclarent tous les tranches maximales pour le texte, les images, l'audio et la vidéo. Les résumés ne permettent pas de classer leurs jeux de données par taille pour chaque modalité.

Les catégories de sources distinguent davantage les modèles

Les questions sur les sources donnent une vision plus claire de la manière dont les fournisseurs disent avoir construit leurs modèles :

Fournisseur et modèlePublicSous licencePrivé tiersCrawléDonnées utilisateursSynthétique
Meta, Muse SparkOuiOuiOuiOuiOuiOui
OpenAI, GPT-5.5OuiOuiOuiOuiOuiOui
xAI, Grok 4.5OuiOuiOuiOuiOuiOui
SpeakLeash, Bielik v3 11BOuiOuiNonOuiNonOui
Hugging Face, SmolLM3-3BOuiNonNonNonNonOui
Swiss AI, Apertus-70BOuiNonNonNonNonNon
Bria, Bria 3.2NonOuiNonNonNonNon

Meta, OpenAI et xAI répondent Oui à chaque catégorie : données publiques, sous licence, privées de tiers, collectées par leurs propres crawlers, données utilisateurs et données synthétiques. Plusieurs modèles ouverts ou sous licence déclarent un éventail plus restreint. Apertus de Swiss AI utilise des jeux de données publics et affirme ne pas avoir exploité son propre crawler. Bria décrit encore une autre stratégie : Bria 3.2 aurait été entraîné exclusivement sur des images sous licence commerciale.

La comparaison a ses limites. Le résumé de Google ne répond qu'à trois des six questions sur les sources : une case vide signifie donc « non indiqué », et non « Non ». Microsoft répond à certains champs théoriquement binaires par du texte. Le modèle rend la comparaison possible, mais les fournisseurs ne le remplissent pas toujours de manière comparable.

xAI déclare aussi ne pas avoir signé le code de bonnes pratiques pour les modèles d'IA à usage général et respecter directement les signaux d'opposition. C'est le premier fournisseur de ce jeu de données à publier le modèle sans signer le code. La signature du code et la publication d'un résumé sont deux actes distincts, assortis de calendriers différents ; aucun ne doit servir d'indicateur indirect de l'autre.

Une seconde recherche a trouvé six autres résumés

Après l'ajout de Grok 4.5, j'ai mené une nouvelle recherche fournisseur par fournisseur. Elle a identifié six résumés publics crédibles qui ne figurent pas encore dans l'instantané de 11 entrées :

Ces documents sont en cours de validation et de normalisation avant leur intégration au jeu de données comparable ; leurs valeurs ne sont donc pas incluses dans les chiffres ci-dessus. Cette séparation est importante : découvrir un document n'équivaut pas à l'intégrer, surtout lorsque cases à cocher, définitions des modalités et formats de publication varient.

Je n'ai trouvé aucun résumé standardisé au titre de l'article 53 pour Kimi K2.5 de Moonshot AI sur son site officiel, dans sa documentation API ou sur la page officielle du modèle. Son rapport technique décrit environ 15 mille milliards de tokens visuels et textuels mélangés, mais il ne s'agit pas de la divulgation européenne standardisée. Kimi K2.5 a été publié après l'entrée en vigueur de l'obligation ; son applicabilité dépend aussi de la mise sur le marché européen du modèle par Moonshot. Cette absence ne suffit donc pas à conclure à une non-conformité.

Les réactions à ce jour

Je n'ai trouvé aucune réaction publique de la Commission européenne, du Bureau de l'IA ou d'un expert indépendant identifié visant spécifiquement la déclaration de Grok 4.5. Il ne faut y voir ni approbation ni critique.

Le débat plus général sur le modèle apporte un contexte. La Commission le qualifie de « socle minimal commun », destiné à améliorer la transparence tout en protégeant les secrets d'affaires, plutôt qu'à fournir un inventaire techniquement exhaustif. Une coalition de 38 organisations de créateurs et titulaires de droits a exprimé son mécontentement à l'égard du dispositif, estimant qu'il ne donne pas assez d'informations pour permettre aux titulaires de droits de les exercer. Le Parlement européen a aussi demandé, plus généralement, davantage de transparence, une rémunération et la possibilité d'empêcher l'utilisation de contenus protégés.

Ces positions portent sur le cadre dans son ensemble, pas sur Grok 4.5. La nouvelle déclaration illustre les deux aspects : elle crée un relevé comparable des catégories de sources qui n'existait pas auparavant, mais ses larges tranches ne révèlent ni la quantité de données utilisée par xAI par rapport aux autres fournisseurs, ni les œuvres protégées individuelles.

Réserves. Tous les chiffres sont autodéclarés et non audités. La comparaison de 11 entrées est un instantané, non une étude du marché, et trois entrées sont des variantes de Microsoft Phi. L'absence d'une ligne sur les sources signifie que le résumé est muet, non que la réponse est Non. Les dates limites des données vont de mars 2024 à juin 2026. Les modèles mis sur le marché européen avant le 2 août 2025 ont jusqu'au 2 août 2027 pour publier ; l'absence d'un résumé ne prouve donc pas nécessairement une non-conformité.

Données : ai_training_metrics, API Transparency Report ; instantané initial de 11 modèles provenant de neuf fournisseurs, avec des déclarations publiées de juin 2025 à juillet 2026. Recherche complémentaire effectuée le 23 juillet 2026.

esc