DeepLeaf Yield DeepLeaf Yield

Backtest et plages d’erreur

Le backtest rejoue la prévision de chaque semaine de passage passée, dans l’ordre, avec uniquement ce qui était connu à ce moment-là, et la compare à la récolte qui a suivi.

La page Prévision de l’application pour un cycle de démonstration : le tableau de prévision avec la semaine, la maturation des fruits, la température, la prévision, la base de calcul, la fourchette et la récolte saisie, puis un graphique de la prévision de chaque semaine face à la récolte. Le tableau du backtest, Comparaison des prévisions passées avec la récolte, se trouve plus bas sur la page.
La page Prévision, à l’adresse /app/forecast. Le tableau du backtest se trouve sous le graphique.

Lire le backtest

GET …/backtest et le tableau de l’application donnent, pour chaque horizon :

ColonneSignification
Semaines vérifiéesLes prévisions passées qui ont une récolte à laquelle se comparer
Erreur moyenneL’erreur absolue moyenne en kilogrammes (mean_absolute_error_kg)
Erreur moyenne en %L’erreur absolue moyenne en pourcentage de la prévision émise (mean_absolute_percent_error)
Répéter la semaine précédenteLa même erreur pour la persistance simple (baseline_mean_absolute_percent_error)
Dans la fourchetteLe nombre de récoltes tombées entre low_kg et high_kg, par exemple « 5 sur 8 »

Si l’erreur de la prévision n’est pas inférieure à « Répéter la semaine précédente » sur votre cycle, le modèle de maturation n’y apporte encore rien. Le choix par cycle s’appuie alors déjà sur l’historique pour ces horizons.

Pour les mêmes chiffres regroupés par serre, avec un niveau de fiabilité par horizon, voir Quel crédit accorder à la prévision.

Lire la fourchette d’erreur

  • La fourchette apparaît dès qu’un horizon a deux semaines vérifiées. Avant, la prévision est un chiffre unique, sans fourchette.
  • Elle correspond à la prévision plus ou moins l’erreur relative moyenne de ce cycle à cet horizon. Ce n’est pas un intervalle de confiance statistique.
  • Avec peu de semaines vérifiées, la fourchette peut être trop étroite. Regardez « Dans la fourchette » avant de vous y fier.
  • Les semaines les plus lointaines ont en général des fourchettes plus larges, car leurs prévisions étaient plus éloignées.

Prévisions enregistrées

POST …/forecasts émet la prévision du moment et l’enregistre. GET …/forecasts liste les prévisions enregistrées à côté de la récolte saisie depuis : vous vérifiez ainsi ce qui a réellement été annoncé à l’époque, pas seulement une reconstitution.

Le backtest et la fiabilité rejouent chaque semaine passée avec vos corrections de passages telles qu’elles sont aujourd’hui, comme si elles avaient été connues à l’époque. Corriger un ancien passage modifie l’erreur des semaines qu’il a alimentées. Les prévisions enregistrées ne changent pas : elles gardent le chiffre avec lequel elles ont été émises, avant toute correction ultérieure.

Résultats sur données publiques

Aucun jeu de données public ne contient de passages filmés. L’essai en six compartiments a des récoltes mais pas de comptages de fruits : ses chiffres mesurent donc la prévision par l’historique des récoltes, la référence que le modèle de maturation doit battre. L’essai plus petit a aussi des comptages de fruits hebdomadaires, sans stade de maturité : les modèles des passages y ont tourné en traitant chaque fruit comme vert.

Erreur absolue moyenne en pourcentage, toutes séries confondues
Jeu de donnéesModèleCette semaineSemaine suivanteSemaine d’après
Essai de tomates cerises en six compartiments
86 / 80 / 74 semaines vérifiées
Répéter la dernière récolte48,9 %32,0 %46,6 %
Tel qu’émis (mélange possible)47,9 %32,2 %43,9 %
Essai plus petit, relevé à la main
135 plants en 3 séries, 33 / 30 / 27 semaines vérifiées
Répéter la dernière récolte65,4 %100,3 %102,6 %
Tel qu’émis, ancien modèle des passages78,5 %91,2 %70,7 %
Tel qu’émis, modèle des passages actuel64,5 %69,7 %61,3 %

Sur l’essai en six compartiments, l’erreur pour la semaine même allait de 37,6 % à 67,8 % selon le compartiment. La cueillette a lieu tous les 4 à 5 jours : une semaine compte une ou deux cueillettes, et le total hebdomadaire fait des dents de scie. L’essai plus petit portait sur de petites parcelles avec une cueillette irrégulière : sa récolte variait fortement d’une semaine à l’autre. Le modèle des passages actuel y a réduit l’erreur pour la semaine suivante et celle d’après dans 3 séries sur 3. L’essentiel du gain vient de l’apprentissage du rythme de chaque cycle : la courbe publiée seule, à un rythme de 1, y faisait moins bien que l’ancien modèle.

Lisez ces chiffres avec leurs limites. L’essai plus petit porte sur une seule serre et une seule saison. Ses comptages ne distinguent pas la maturité : le rythme y a été appris à partir des fruits cueillis la semaine suivant un comptage, et non des fruits tournants du passage suivant comme sur vos lignes. Son erreur hebdomadaire reste élevée dans tous les cas. Sur l’essai en six compartiments, les deux modèles des passages donnent les mêmes chiffres, faute de comptages de fruits.