Méthodologie

Comment le modèle de pronostic tennis fonctionne

Cette page décrit comment les probabilités publiées sont obtenues, comment elles sont validées, et où se situent les limites du modèle. Elle est écrite pour être vérifiable plutôt que rassurante.

Dernière mise à jour : 14 septembre 2026

Ce qui est prédit

Une seule chose : la probabilité que chaque joueur remporte le match. Un score en sets probable est également publié, mais c'est une sortie secondaire, moins fiable que la probabilité de victoire.

Le modèle couvre les circuits ATP, WTA, Challenger hommes et Challenger femmes, en simple comme en double. Les tournois ITF ne sont pas prédits, mais leurs résultats alimentent le calcul de la force des joueurs qui y participent.

Les données utilisées

Le modèle est un gradient boosting entraîné sur l'historique des matchs professionnels depuis 2020, en quatre étapes :

Historique depuis 2020

Tous les matchs professionnels archivés

Variables du match

Elo, forme, fatigue, H2H, cote du marché

Modèle

Gradient boosting entraîné sur l'historique

Résultat publié

Probabilité de victoire + score en sets

  • un Elo global et un Elo par surface, ce dernier initialisé sur le rating global plutôt que sur une valeur neutre, faute de quoi il converge mal et devient moins prédictif que le global seul ;
  • la forme récente et un indicateur de fatigue tirés des matchs joués dans les jours précédents ;
  • l'historique des confrontations directes, pondéré par récence : une rencontre d'il y a cinq ans ne pèse pas autant qu'une du mois dernier ;
  • la probabilité implicite du marché des cotes lorsqu'elle est disponible, après retrait de la marge du bookmaker.

La règle qui gouverne tout le reste

Aucune information postérieure au match ne peut entrer dans le calcul. C'est la seule règle qui, si elle est violée, produit un modèle excellent en test et inutile en production, sans jamais lever d'erreur.

1

Avant le match — l'état de chaque joueur est lu

2

Le match a lieu

3

Après le match — l'état est mis à jour

Jamais l'inverse : rien de postérieur au match n'entre dans le calcul

Concrètement, l'état de chaque joueur est lu et mis à jour dans cet ordre, par une seule et même implémentation partagée entre l'entraînement et la prédiction. Les statistiques détaillées d'un match, qui ne sont connues qu'une fois celui-ci terminé, ne sont jamais utilisées telles quelles : elles n'interviennent que sous forme de moyennes glissantes calculées sur les matchs précédents du joueur.

Comment le modèle est validé

Découpage chronologique

Entraînement, puis validation, puis test, toujours dans cet ordre temporel — jamais un mélange aléatoire, qui reviendrait à entraîner sur des matchs postérieurs à ceux évalués.

Validation glissante

Le modèle est réentraîné à chaque fenêtre sur tout l'historique disponible, puis évalué uniquement sur la fenêtre suivante, jamais vue.

La précision affichée dans l'application est calculée autrement, et c'est le chiffre qui compte vraiment : elle compare les pronostics réellement publiés avant les matchs aux résultats survenus ensuite. Elle n'est pas reconstituée après coup et ne peut pas être filtrée a posteriori.

Les métriques retenues

La précision seule ne suffit pas à juger un modèle qui affiche des probabilités : elle ignore le niveau de confiance. Annoncer 51 % ou 95 % pour une même bonne prédiction donne la même précision, sans que ces deux prédictions se vaillent.

Log-loss

Pénalise une confiance mal placée bien plus fortement qu'une simple erreur de précision.

Score de Brier

Mesure l'écart entre la probabilité annoncée et le résultat réel, sur l'ensemble des matchs.

Test de significativité

Un écart entre deux versions n'est retenu que s'il n'est pas simplement du bruit statistique.

Les probabilités produites sont enfin plafonnées : aucune prédiction n'affiche de certitude absolue. Une calibration laissée libre produit des valeurs exactement égales à 0 ou 1 sur les zones peu représentées, et une seule de ces prédictions prise en défaut coûte autant que des centaines d'erreurs modérées.

Source des données

Les calendriers, résultats, scores en direct et cotes proviennent du fournisseur api-tennis.com. Une interruption ou une erreur de sa part peut rendre certaines informations temporairement inexactes. Voir les mentions légales et les conditions générales d'utilisation.

Voir le modèle à l'œuvre

Les pronostics du jour, l'historique et la précision réelle sont visibles sans attendre.