글
Grok 4.5의 새 EU 공개가 학습 데이터 기록에 더하는 것

xAI가 Grok 4.5를 다루는 첫 EU 학습 콘텐츠 요약을 공개했다. 텍스트, 이미지, 오디오, 비디오 모두 가장 큰 데이터 규모 구간에 해당하며, 유럽연합 집행위원회 양식의 여섯 가지 학습 데이터 출처를 모두 사용했다고 신고했다.
이제 Grok 4.5를 내가 수집한 AI 학습 데이터 투명성 데이터셋의 다른 요약과 비교할 수 있다. 이 신고는 양식 자체를 시험하기도 한다. 출처 질문은 제공자 사이의 의미 있는 차이를 보여 주지만 규모 구간은 매우 다른 모델을 한데 묶는다.
핵심: EU AI법 제53조 제1항 d호는 범용 AI 모델 제공자에게 AI 사무국의 표준 양식으로 학습 콘텐츠 요약을 공개하도록 요구한다. 아래 비교에 사용한 11개 기록 중 6개는 텍스트 10조 토큰 초과, 5개는 10억~10조 토큰을 신고했고 가장 작은 구간은 0개였다. 최상위 구간에는 상한이 없어 Grok 4.5, GPT-5.5, Gemini 3 Pro와 30억 파라미터의 오픈 모델이 같은 분류를 받는다. xAI가 어떤 종류의 출처를 썼다고 하는지는 알 수 있지만 같은 구간의 다른 모델과 비교한 Grok 말뭉치의 규모는 알 수 없다.
넓은 규모 구간은 비교를 제한한다
| 텍스트 학습 데이터 규모 | 모델 수 |
|---|---|
| 10조 토큰 초과, 상한 없음 | 6 |
| 10억~10조 토큰 | 5 |
| 10억 토큰 미만 | 0 |
최상위 구간에는 Gemini 3 Pro, GPT-5.5, Grok 4.5, Muse Spark뿐 아니라 Swiss AI의 Apertus-70B와 Hugging Face의 SmolLM3-3B도 들어간다. 중간 구간도 네 자릿수 범위를 포괄하며 Microsoft Phi-4, SpeakLeash Bielik, Bria가 포함된다. Bria만 “최대 192억 토큰”과 “4억 7,900만 이미지”라는 정확한 수치를 덧붙였다. Gemini, GPT, Grok, Muse는 모든 모달리티에서 최대 구간을 신고해 요약만으로 규모 순위를 정할 수 없다.
출처 범주는 더 많은 차이를 보여 준다
| 제공자·모델 | 공개 | 라이선스 | 제3자 비공개 | 크롤링 | 사용자 | 합성 |
|---|---|---|---|---|---|---|
| Meta / Muse Spark | 예 | 예 | 예 | 예 | 예 | 예 |
| OpenAI / GPT-5.5 | 예 | 예 | 예 | 예 | 예 | 예 |
| xAI / Grok 4.5 | 예 | 예 | 예 | 예 | 예 | 예 |
| SpeakLeash / Bielik v3 11B | 예 | 예 | 아니요 | 예 | 아니요 | 예 |
| Hugging Face / SmolLM3-3B | 예 | 아니요 | 아니요 | 아니요 | 아니요 | 예 |
| Swiss AI / Apertus-70B | 예 | 아니요 | 아니요 | 아니요 | 아니요 | 아니요 |
| Bria / Bria 3.2 | 아니요 | 예 | 아니요 | 아니요 | 아니요 | 아니요 |
Meta, OpenAI, xAI는 모든 범주에 예라고 답했다. Apertus는 공개 데이터셋을 사용했고 자체 크롤러를 운영하지 않았다고 한다. Bria 3.2는 상업적으로 라이선스된 이미지만으로 학습했다. Google은 여섯 출처 질문 중 세 개에만 답했으므로 빈칸은 아니요가 아니라 미기재다. Microsoft는 일부 이진 항목에 서술형으로 답해 표준 양식이라도 작성 방식이 완전히 같지는 않다.
xAI는 범용 AI 실천 강령에 서명하지 않았고 대신 옵트아웃 신호를 직접 존중한다고 밝혔다. 이 데이터셋에서 강령에 서명하지 않고 표준 양식을 공개한 첫 제공자다. 강령 서명과 요약 공개는 일정이 다른 별개의 행동이며 어느 것도 다른 하나의 대리 지표가 될 수 없다.
두 번째 검색에서 요약 여섯 건을 더 찾았다
Grok 4.5를 추가한 뒤 제공자별로 다시 검색해 11개 기록에 아직 포함되지 않은 신뢰할 만한 공개 요약 여섯 건을 찾았다. Adobe Firefly Image Model 5, Domyn Large, FastwebMIIA, Thinking Machines Inkling, Microsoft MAI-Image-2, Meta Muse Image다. 체크박스와 모달리티 정의, 공개 형식을 검증하고 정규화한 뒤 데이터셋에 넣을 것이므로 위 수치에는 합치지 않았다.
Moonshot AI 공식 사이트, API 문서, 공식 모델 페이지에서는 Kimi K2.5의 제53조 표준 요약을 찾지 못했다. 기술 보고서는 이미지와 텍스트를 합쳐 약 15조 토큰이라고 하지만 EU 표준 공개는 아니다. 의무 적용 여부는 Moonshot이 모델을 EU 시장에 출시했는지에도 달려 있으므로 부재만으로 위반이라고 할 수 없다.
지금까지의 반응
Grok 4.5 신고 자체에 대한 유럽연합 집행위원회, AI 사무국 또는 신원이 확인된 독립 전문가의 공개 반응은 찾지 못했다. 이를 승인이나 비판으로 해석해서는 안 된다.
전체 제도 논쟁은 맥락을 제공한다. 집행위원회는 이 양식을 영업비밀을 보호하면서 투명성을 높이기 위한 “공통 최소 기준”이라 부른다. 반면 창작자와 권리자 38개 단체는 권리 행사에 필요한 정보가 부족하다며 불만을 표했다. 유럽의회도 더 강한 투명성, 보상, 보호 콘텐츠 사용을 막을 권리를 요구했다. 이는 Grok 4.5가 아니라 제도 전체에 관한 입장이다.
주의: 모든 수치는 자체 신고이며 감사되지 않았다. 11개 비교는 시장 조사가 아닌 스냅숏이고 그중 3개는 Microsoft Phi 변형이다. 데이터 기준일은 2024년 3월부터 2026년 6월까지다. 2025년 8월 2일 이전 EU 시장에 출시된 모델은 2027년 8월 2일까지 공개할 수 있으므로 요약이 없다고 반드시 위반은 아니다.
데이터: Transparency Report API의 ai_training_metrics. 9개 제공자 11개 모델의 초기 스냅숏이며 신고 공개 시점은 2025년 6월~2026년 7월이다. 추가 검색은 2026년 7월 23일 수행했다.