Méthode

Notre méthode

Le modèle estime des probabilités à partir des statistiques des matchs joués. Ce n’est ni une prédiction du résultat ni une promesse de gains : c’est une façon de voir quel résultat paraît le plus probable, et pourquoi.

01Données

Les trois dernières saisons de 76 compétitions : résultats, corners, cartons, tirs, possession, arbitres. Les statistiques sont mises à jour toutes les quatre heures, les blessures toutes les deux heures, les cotes des bookmakers deux fois par jour.

02Buts

Au cœur du calcul, le modèle de Dixon-Coles : chaque équipe reçoit une force offensive et une force défensive, l’avantage du terrain est estimé à part. Un match perd du poids avec le temps, la forme récente compte donc davantage que celle de l’an dernier. Une correction pour les scores faibles corrige la faiblesse bien connue des modèles simples, qui surestiment les nuls.

Tous les marchés de buts sont tirés de la même distribution des scores. C’est pourquoi le résultat, les totaux et « les deux équipes marquent » concordent toujours.

03Qualité de jeu

Les buts ne sont pas le seul signal : une équipe peut se créer beaucoup d’occasions sans marquer, ou marquer sur très peu. Le xG, les tirs cadrés et la possession des derniers matchs se combinent en un indice de qualité de jeu qui ajuste la force offensive du modèle au-delà des buts marqués et encaissés. Les tirs et les tirs cadrés ont aussi leur propre modèle de comptage, comme les corners, avec des marchés de totaux séparés.

04Corners et cartons

Ils se calculent de façon similaire, mais suivent une autre distribution : leur dispersion est plus large que celle de Poisson, et un modèle simple sous-estime les totaux extrêmes. Les cartons ont un troisième facteur : l’arbitre. Il est mesuré comme le rapport entre les cartons réels et ceux attendus dans les matchs qu’il a dirigés, pas comme une simple moyenne ; sinon, un arbitre sévère désigné sur des matchs calmes paraîtrait clément.

La couche arbitre n’est activée que là où les données le permettent. Dans certaines ligues, l’arbitre est connu pour moins des trois quarts des matchs : la couche y est désactivée.

05Force des équipes

À côté du modèle de buts, il existe une seconde estimation indépendante de la force : un classement Elo. Il fonctionne autrement : au lieu d’être ajusté sur tout l’historique d’un coup, il est mis à jour après chaque match par un pas d’autant plus grand que le résultat était surprenant. Il est calculé dans un seul pool mondial, toutes compétitions confondues, et non à l’intérieur de chaque ligue, si bien que les équipes de championnats différents sont comparables. Sur la page du match, ce classement s’affiche sur sa propre échelle de zéro à cinq.

Les probabilités du résultat sont un mélange des deux estimations, pas l’une d’elles : l’Elo et le modèle de buts regardent une équipe différemment, et ensemble ils se trompent moins souvent que chacun seul. Un contrôle sur un échantillon réservé de 4 545 matchs a montré que le mélange est plus précis que Dixon-Coles pur et qu’Elo pur. Le gain est faible et nous ne l’embellissons pas : l’erreur moyenne du pronostic passe de 0,2166 à 0,2145 selon le RPS, à la troisième décimale.

Pour les tournois de sélections, le mélange est désactivé. Une équipe n’y cumule qu’une douzaine de matchs sur toute l’histoire de la compétition, au lieu de dizaines par saison en club, et sur un tel échantillon le classement devient bruité : lors d’un contrôle, il a porté à 47 % les chances de la Turquie de battre la France, alors que les deux estimations s’accordaient sur la supériorité française. Pour ces compétitions, le classement est calculé et affiché, mais n’entre pas dans les probabilités.

06Ce qui compte aussi

Les jours de repos et la densité du calendrier sont comptés sur toutes les compétitions à la fois, coupes d’Europe comprises : un mercredi de Ligue des champions est la première source de fatigue. Un match européen à venir compte aussi, quand l’équipe peut ménager des joueurs.

07Calibration

Une fois par semaine, le modèle est vérifié sur des matchs passés : s’il annonçait 60 %, ces événements doivent se produire environ 60 % du temps. Les probabilités sont corrigées d’après ces vérifications. L’ajustement moyen entre ligues reste inférieur à trois points de pourcentage.

Limites

08Ce que nous ne faisons pas

Nous ne prétendons pas battre les bookmakers. Les marchés principaux des grands opérateurs sont cotés très finement, et un backtest honnête le confirme. La valeur est ailleurs : une analyse complète de tous les marchés en un seul endroit, avec les facteurs que vous rassembleriez sinon à la main sur plusieurs sites.

Nous n’affichons pas non plus de taux de réussite inventés. L’archive publique du Pari du jour repose sur des pronostics enregistrés avant le coup d’envoi et impossibles à modifier ; les résultats ne sont jamais réécrits après coup.

↑ Haut de page

Notre méthode — VARstats