Backtest et plages d’erreur
Le backtest rejoue la prévision de chaque semaine de passage passée, dans l’ordre, avec uniquement ce qui était connu à ce moment-là, et la compare à la récolte qui a suivi.
/app/forecast. Le tableau du backtest se trouve sous le graphique.Lire le backtest
GET …/backtest et le tableau de l’application donnent, pour chaque horizon :
| Colonne | Signification |
|---|---|
| Semaines vérifiées | Les prévisions passées qui ont une récolte à laquelle se comparer |
| Erreur moyenne | L’erreur absolue moyenne en kilogrammes (mean_absolute_error_kg) |
| Erreur moyenne en % | L’erreur absolue moyenne en pourcentage de la prévision émise (mean_absolute_percent_error) |
| Répéter la semaine précédente | La même erreur pour la persistance simple (baseline_mean_absolute_percent_error) |
| Dans la fourchette | Le nombre de récoltes tombées entre low_kg et high_kg, par exemple « 5 sur 8 » |
Si l’erreur de la prévision n’est pas inférieure à « Répéter la semaine précédente » sur votre cycle, le modèle de maturation n’y apporte encore rien. Le choix par cycle s’appuie alors déjà sur l’historique pour ces horizons.
Pour les mêmes chiffres regroupés par serre, avec un niveau de fiabilité par horizon, voir Quel crédit accorder à la prévision.
Lire la fourchette d’erreur
- La fourchette apparaît dès qu’un horizon a deux semaines vérifiées. Avant, la prévision est un chiffre unique, sans fourchette.
- Elle correspond à la prévision plus ou moins l’erreur relative moyenne de ce cycle à cet horizon. Ce n’est pas un intervalle de confiance statistique.
- Avec peu de semaines vérifiées, la fourchette peut être trop étroite. Regardez « Dans la fourchette » avant de vous y fier.
- Les semaines les plus lointaines ont en général des fourchettes plus larges, car leurs prévisions étaient plus éloignées.
Prévisions enregistrées
POST …/forecasts émet la prévision du moment et l’enregistre. GET …/forecasts liste les prévisions enregistrées à côté de la récolte saisie depuis : vous vérifiez ainsi ce qui a réellement été annoncé à l’époque, pas seulement une reconstitution.
Le backtest et la fiabilité rejouent chaque semaine passée avec vos corrections de passages telles qu’elles sont aujourd’hui, comme si elles avaient été connues à l’époque. Corriger un ancien passage modifie l’erreur des semaines qu’il a alimentées. Les prévisions enregistrées ne changent pas : elles gardent le chiffre avec lequel elles ont été émises, avant toute correction ultérieure.
Résultats sur données publiques
Aucun jeu de données public ne contient de passages filmés. L’essai en six compartiments a des récoltes mais pas de comptages de fruits : ses chiffres mesurent donc la prévision par l’historique des récoltes, la référence que le modèle de maturation doit battre. L’essai plus petit a aussi des comptages de fruits hebdomadaires, sans stade de maturité : les modèles des passages y ont tourné en traitant chaque fruit comme vert.
| Jeu de données | Modèle | Cette semaine | Semaine suivante | Semaine d’après |
|---|---|---|---|---|
| Essai de tomates cerises en six compartiments 86 / 80 / 74 semaines vérifiées | Répéter la dernière récolte | 48,9 % | 32,0 % | 46,6 % |
| Tel qu’émis (mélange possible) | 47,9 % | 32,2 % | 43,9 % | |
| Essai plus petit, relevé à la main 135 plants en 3 séries, 33 / 30 / 27 semaines vérifiées | Répéter la dernière récolte | 65,4 % | 100,3 % | 102,6 % |
| Tel qu’émis, ancien modèle des passages | 78,5 % | 91,2 % | 70,7 % | |
| Tel qu’émis, modèle des passages actuel | 64,5 % | 69,7 % | 61,3 % |
Sur l’essai en six compartiments, l’erreur pour la semaine même allait de 37,6 % à 67,8 % selon le compartiment. La cueillette a lieu tous les 4 à 5 jours : une semaine compte une ou deux cueillettes, et le total hebdomadaire fait des dents de scie. L’essai plus petit portait sur de petites parcelles avec une cueillette irrégulière : sa récolte variait fortement d’une semaine à l’autre. Le modèle des passages actuel y a réduit l’erreur pour la semaine suivante et celle d’après dans 3 séries sur 3. L’essentiel du gain vient de l’apprentissage du rythme de chaque cycle : la courbe publiée seule, à un rythme de 1, y faisait moins bien que l’ancien modèle.
Lisez ces chiffres avec leurs limites. L’essai plus petit porte sur une seule serre et une seule saison. Ses comptages ne distinguent pas la maturité : le rythme y a été appris à partir des fruits cueillis la semaine suivant un comptage, et non des fruits tournants du passage suivant comme sur vos lignes. Son erreur hebdomadaire reste élevée dans tous les cas. Sur l’essai en six compartiments, les deux modèles des passages donnent les mêmes chiffres, faute de comptages de fruits.