Algorithme de pronostic tennis : comment fonctionne un modèle d’IA
· Pronocast

« Pronostic par intelligence artificielle » est devenu une formule qu’on lit partout, et qui ne dit rien de ce qui se passe réellement dans la machine. Derrière, il y a rarement de la magie : un modèle statistique reçoit quelques dizaines de chiffres décrivant deux joueurs, et rend un seul nombre, la probabilité que le premier l’emporte. Tout le travail consiste à choisir ces chiffres, à s’assurer qu’ils étaient connus avant le match, et à vérifier honnêtement ce que le modèle vaut une fois confronté à des matchs qu’il n’a jamais vus.
Cet article décrit ce mécanisme de bout en bout, en prenant pour exemple le modèle qui alimente Pronocast. Il explique quelles données entrent, comment on empêche le modèle de « voir le futur » pendant son apprentissage, ce que signifie une probabilité bien calibrée, et pourquoi la précision d’un tel algorithme plafonne, quoi qu’on fasse, autour de celle des cotes des bookmakers. L’objectif n’est pas de vendre un taux de réussite, mais de donner les clés pour juger n’importe quel pronostic automatique, celui-ci compris.
Ce qu’un modèle de pronostic tennis prédit vraiment
Une seule chose : la probabilité que chaque joueur gagne le match. Pas le score, pas le nombre de jeux, pas la durée. Un score en sets probable peut être dérivé ensuite, mais c’est une sortie secondaire, nettement moins fiable que la probabilité de victoire.
Une probabilité, pas un verdict
Dire « Alcaraz gagne à 71 % » n’est pas dire « Alcaraz gagne ». Cela veut dire que sur cent matchs présentant exactement ce profil, on s’attend à ce qu’il en gagne soixante-et-onze. Les vingt-neuf autres ne sont pas des erreurs du modèle : ils sont la part d’incertitude du tennis, qu’une bonne probabilité doit quantifier plutôt que masquer. C’est pour cela que le taux de réussite seul est une mauvaise mesure : un modèle qui dit 51 % et un modèle qui dit 95 % pour le même bon pronostic ont le même taux de réussite, mais pas du tout la même valeur.
Le périmètre couvert
Le modèle de Pronocast couvre les circuits ATP, WTA, Challenger hommes et Challenger femmes, en simple et en double. Les tournois ITF ne sont pas pronostiqués, mais leurs résultats alimentent le calcul de la force des joueurs qui y jouent : un joueur qui remonte du circuit ITF arrive en Challenger avec un historique, pas avec un rating vierge.
Les données qui entrent dans le calcul
Le modèle lui-même est un gradient boosting, une famille d’algorithmes qui construit des centaines de petits arbres de décision successifs, chacun corrigeant les erreurs des précédents. Il est entraîné sur l’historique des matchs professionnels depuis 2020. Ce qui compte n’est pas tant l’algorithme que ce qu’on lui donne à lire pour chaque match.
L’Elo, global et par surface
Le premier signal est un rating Elo, une mesure de la force d’un joueur déduite de ses résultats et de la force de ses adversaires. Un Elo global est complété par un Elo par surface (dur, terre battue, gazon), qui capture le fait qu’un joueur n’est pas le même sur terre et sur gazon. Détail qui change tout : l’Elo de surface est initialisé sur le rating global du joueur, pas sur une valeur neutre. Avec trois à quatre fois moins de matchs par surface qu’au global, un rating qui repart de zéro converge mal et finit par prédire moins bien que le rating global tout seul. Nous avons mesuré cet effet directement avant de choisir l’initialisation.
La forme et la fatigue
La forme récente est la proportion de victoires sur les dix derniers matchs. L’indicateur de fatigue compte les matchs joués dans les jours précédents : un joueur qui sort d’un tournoi gagné en six matchs arrive avec une charge que l’Elo ne voit pas.
Les confrontations directes
L’historique des face-à-face est pondéré par la récence : une victoire d’il y a cinq ans ne pèse pas autant qu’une du mois dernier. La pondération suit une décroissance exponentielle avec une demi-vie de l’ordre d’un à deux ans. Un simple compte des victoires, à poids égal, donnerait trop d’importance à des matchs joués par des joueurs qui n’existent plus vraiment sous cette forme.
Le marché, quand il existe
Enfin, la probabilité implicite des cotes est fournie au modèle quand une cote est disponible, après retrait de la marge du bookmaker. Ce choix a une conséquence qu’il faut assumer : un modèle qui lit le marché ne peut plus servir à mesurer s’il le bat. Nous y revenons plus bas.
La règle qui gouverne tout le reste : ne jamais voir le futur
Un modèle de prédiction sportive s’entraîne sur des matchs passés, dont on connaît le résultat, pour prédire des matchs futurs, dont on ne le connaît pas. Le piège central de cet exercice tient en une phrase : si une donnée capture, même indirectement, une information qui n’existait pas encore au moment du match, le modèle paraît excellent en test et s’effondre en production, sans jamais lever la moindre erreur.
Lire avant, écrire après
La parade est une discipline d’implémentation plus qu’une astuce mathématique. L’état de chaque joueur (son Elo, sa forme, ses face-à-face) est lu avant le match, puis mis à jour après, dans cet ordre, match après match, en parcourant l’historique chronologiquement. Et c’est une seule et même implémentation qui sert à construire le jeu d’entraînement et à prédire les matchs du jour. Deux implémentations « équivalentes » divergent tôt ou tard, et la divergence est invisible : le modèle continue de tourner, juste moins bien.
Le cas des statistiques de match
Les statistiques détaillées d’un match (aces, pourcentage de premières balles, points gagnés au service) ne sont connues qu’une fois le match terminé. Elles ne sont donc jamais utilisées telles quelles. Elles n’interviennent que sous forme de moyennes glissantes calculées sur les matchs précédents du joueur. Et, résultat contre-intuitif mesuré sur ce projet, ces moyennes n’ont apporté aucun gain : un joueur qui sert bien gagne plus de matchs, donc a déjà un meilleur Elo. L’information était déjà là.
Comment on vérifie qu’un modèle vaut quelque chose
C’est ici que se joue la différence entre un algorithme sérieux et une vitrine. Trois principes.
Un découpage strictement chronologique
Les matchs d’entraînement précèdent ceux de validation, qui précèdent ceux de test. Jamais de tirage aléatoire, qui reviendrait à entraîner le modèle sur des matchs postérieurs à ceux sur lesquels on l’évalue. Le jeu de validation sert réellement à choisir le modèle et ses réglages ; le jeu de test n’est regardé qu’à la fin, une fois.
Une validation glissante
Un découpage fixe unique peut donner un bon résultat par hasard. On réentraîne donc le modèle à chaque fenêtre, par exemple chaque trimestre, sur tout l’historique disponible jusque-là, et on l’évalue uniquement sur la fenêtre suivante, jamais vue. Sur ce projet, le modèle battait sa référence sur neuf fenêtres sur dix ; la seule exception était la toute première, quand il n’y avait pas encore assez de données. Un découpage fixe n’aurait jamais montré cette nuance.
Les bonnes métriques
Le taux de réussite est lisible, mais il ignore la confiance. Les métriques qui comptent pour un modèle qui affiche une probabilité sont le log-loss et le score de Brier, qui pénalisent la confiance mal placée. Un modèle qui annonce 95 % et se trompe paie très cher ; c’est exactement ce qu’on veut. S’y ajoute une règle de bon sens : toujours établir une référence simple d’abord (« le mieux classé gagne ») et vérifier que le modèle la bat réellement, circuit par circuit.
La calibration, ou pourquoi aucune probabilité ne devrait afficher 100 %
Un modèle bien calibré est un modèle dont les 70 % gagnent effectivement sept fois sur dix. On ajuste souvent les sorties brutes du modèle avec une calibration après coup. Le piège, rencontré sur ce projet : ajustée sur un jeu de validation modeste, une telle calibration peut produire des probabilités exactement égales à 0 ou 1 dans les zones peu représentées. Il suffit alors d’une poignée de ces pronostics « certains » qui se trompent pour faire exploser le log-loss : une seule erreur à confiance absolue coûte autant que des centaines d’erreurs modérées.
Mesuré directement : une calibration qui améliorait le log-loss en validation le dégradait fortement en test, par ce seul mécanisme. La conclusion est simple et vaut pour tout pronostic automatique : la sortie est plafonnée, par exemple entre 3 % et 97 %. Aucun match de tennis n’est joué d’avance, et un modèle qui affiche 100 % ment, au mieux par maladresse.
Le marché des cotes, juge de paix
Si le tennis a un marché de paris actif, les cotes consensus, moyennées sur plusieurs opérateurs et converties en probabilités après retrait de la marge, constituent le meilleur prédicteur public disponible. Sur ce projet, un modèle fondé uniquement sur l’Elo, la forme et les face-à-face plafonnait autour de 65 à 67 % de réussite ; le marché atteignait 68,5 %. Ajouter la probabilité du marché comme donnée d’entrée a permis de rejoindre ce niveau, pas de le dépasser durablement.
Comparer sur le même périmètre
Un piège classique consiste à comparer un modèle sur 100 % des matchs à un marché qui n’en couvre que 90 %. Une comparaison faite ainsi a laissé croire à un gain de 2,3 points qui n’existait pas ; refaite sur l’intersection stricte, l’écart tombait à 0,06 point, c’est-à-dire rien. Toute affirmation du type « notre IA bat les bookmakers » devrait préciser le périmètre et le test de significativité. Sinon, c’est du marketing.
Ce que le modèle apporte alors
Une couverture complète, y compris les centaines de matchs Challenger sans cote, une probabilité calibrée et vérifiable pour chaque match, et une transparence que le marché n’offre pas : chaque pronostic est calculé avant le match, figé, et publié avec le résultat. La précision se recalcule à partir de ces pages, pas d’un chiffre déclaré.
Les limites qu’il faut connaître
- Les blessures, les forfaits de dernière minute et les conditions du jour ne sont pas dans les données. Un joueur diminué garde son Elo jusqu’à ce que ses résultats le fassent baisser.
- Les nouveaux joueurs et les retours de longue absence ont un rating peu fiable, faute d’historique récent. Le facteur K, plus élevé pour eux, accélère la correction sans la rendre instantanée.
- Le double est moins prédictible que le simple : les paires changent, l’historique par équipe est mince et le marché est souvent absent.
- Un modèle réentraîné chaque mois change légèrement de comportement. La version du modèle est indiquée sur chaque pronostic pour cette raison.
Pronostics Pronocast du jour
Le modèle décrit ici calcule chaque matin un pronostic pour tous les matchs des circuits couverts. Les matchs à venir sont visibles sur la page des pronostics du jour, avec les hubs ATP, WTA et Challenger. Une fois le match terminé, le pronostic et le résultat sont publiés sur la page du match, et la précision réelle se recalcule.
Questions fréquentes
- Un algorithme de pronostic tennis peut-il prédire tous les matchs ?
- Non. Un bon modèle a raison sur environ deux matchs sur trois sur l’ensemble des circuits, et davantage sur les matchs déséquilibrés. Le tiers restant n’est pas une erreur de calcul : c’est l’incertitude réelle du tennis, que la probabilité affichée quantifie.
- Quelles données utilise le modèle Pronocast ?
- Un Elo global et un Elo par surface, la forme récente, un indicateur de fatigue, l’historique des confrontations directes pondéré par récence, et la probabilité implicite des cotes quand elle existe. Aucune donnée postérieure au match n’entre dans le calcul.
- Pourquoi la précision réelle est-elle publiée match par match ?
- Parce qu’un taux de réussite annoncé sans les matchs qui le composent est invérifiable. Chaque pronostic est calculé avant le match, figé, puis publié avec le résultat sur sa propre page : la précision se recalcule à partir de ces pages, pas d’un chiffre déclaré.
- Le modèle est-il meilleur que les bookmakers ?
- Sur les matchs où une cote existe, le modèle rejoint la précision du marché sans la dépasser durablement : les cotes consensus sont le meilleur prédicteur public connu. Le modèle apporte surtout une couverture complète, Challenger compris, et une probabilité calibrée pour chaque match.
Autres articles
- Elo au tennis : tout comprendre au classement qui prédit les matchsPourquoi un rating conçu pour les échecs prédit mieux un match de tennis que le classement ATP, et quels ajustements il faut pour qu’il fonctionne vraiment.
- Cote de tennis et probabilité implicite : ce qu’elle dit vraimentComment lire une cote de bookmaker, retirer sa marge, et pourquoi le marché reste la référence que la plupart des modèles ne battent pas durablement.
- Comment parier sur le tennis : bankroll, value bet et risqueCombien miser, ce que veut vraiment dire « value », et pourquoi notre propre modèle perdait 9 % en pariant sur ses désaccords avec le marché.
- Terre battue, dur, gazon : ce que la surface change au tennisSur 36 210 matchs, le niveau général d’un joueur prédit mieux que ses résultats sur la surface du jour, et c’est sur gazon que les favoris tombent le plus.
- Face-à-face au tennis : le H2H prédit-il vraiment le vainqueur ?Sur 38 123 matchs, le meneur au face-à-face gagne moins souvent que le favori de l’Elo. Mais un bilan défavorable au favori, lui, compte vraiment.
- Fatigue au tennis : un joueur fatigué perd-il vraiment plus ?Enchaîner les matchs ne se mesure presque pas. Revenir après un mois sans jouer, si : près de dix points de victoire en moins que ce que l’Elo prévoit.
- Tennis en salle : les favoris sont-ils plus fiables sous un toit ?En salle, le favori gagne 64,9 % de ses matchs, contre 65,0 % sur dur en plein air. Un bon bilan en salle reflète surtout un bon joueur.