Données

Inventaire complet des données collectées et des sorties du modèle stat-v1.13 — les compteurs ci-dessous sont calculés en direct depuis la base.

Base historique & CDM 2026
49 450
Matchs internationaux
historique depuis 1872 (martj42)
48
Équipes
qualifiées CDM 2026
1248
Joueurs
dans les effectifs 2026
104
Matchs CDM 2026
avec météo & camps de base
Couverture des données joueur
Taux de remplissage
Valeur marchande 956 / 1248 (76.6%)
Stats club détaillées 436 / 1248 (34.9%)
Sélections / caps 1244 / 1248 (99.7%)
104
Météo matchs
48
Camps de base
0
News en cache
Joueurs par confédération
Sorties du modèle stat-v1.13
104
Prédictions match
probas 1/N/2 + score prédit
48
Probas parcours
P(qualif) → P(titre) × équipe
1248
Buteurs prédits
E[buts] + P(Soulier d'or)
48
Classements prédits
classements de groupe prédits
2503
Historique équipes
résultats récents par équipe
Données live pendant le tournoi
7 carton(s) • 309 but(s) réel(s) enregistré(s) — se remplit à chaque mise à jour live
Données d'époque (fichiers rich)
21
Fichiers valeur effectif
data/rich/market_values/
Valeurs Transfermarkt reconstituées par édition
14
Fichiers valeur joueur
data/rich/player_values/
Valeurs individuelles par compétition
14
Fichiers effectifs d'époque
data/rich/squads/
Effectifs reconstitués pour le backtest
Backtest — validation sur 24 éditions

Le log loss mesure l'erreur des probabilités prédites : plus il est bas, meilleur est le modèle. Sur les éditions de test (jamais vues lors de la calibration), notre modèle (0.9653) fait mieux que l'Elo seul (0.9887) et que le hasard uniforme (1.0986) — il bat donc ces deux références.

ENTRAÎNEMENT CDM 2018 + 2022
2
éditions
128
matchs
1.0076
log loss moy.
Elo nu : 1.0168
Hasard : 1.0986
53.9%
issues correctes
TEST 20 éditions jamais vues
20
éditions
708
matchs
0.9653
log loss moy.
Elo nu : 0.9887
Hasard : 1.0986
54.7%
issues correctes
Matchs backtestés et log loss par compétition — courbe pointillée = Elo nu (référence)
Train vs Test — avec références

ENTRAÎNEMENT (CDM 2018 + 2022) : log_loss attendu plus bas car le stack de features a été calibré sur ces éditions. TEST (toutes autres) : log_loss reflète la vraie généralisation. Un écart train >> test indiquerait un sur-apprentissage.