Discovery Machine Learning : 4 semaines pour décider comment appliquer le ML à ton business
Chez Deployr, notre mission est de conseiller, guider et accompagner les entreprises de tous types et de toutes tailles sur le chemin de la mise en production de modèles de machine learning et de la transformation vers une culture data-driven. Mais, bien sûr, toutes les entreprises n’ont pas les ressources pour appliquer efficacement ces outils et tous les problèmes ne doivent pas être résolus avec ces technologies.
C’est pourquoi il est crucial de pouvoir, dans un temps délimité, analyser s’il est faisable d’appliquer du machine learning pour résoudre un problème métier concret. Et on insiste sur le « dans un temps délimité », car la passivité dans ce diagnostic peut avoir des ramifications qui impactent les revenus des organisations.
Comme on va le voir, certains défis peuvent être résolus avec de l’apprentissage automatique bien plus efficacement qu’avec des outils traditionnels, mais cela requiert une série de conditions préalables et du travail dédié à son application. Et pour déterminer si ces conditions sont réunies, on a conçu ce qu’on appelle le processus de Discovery : 4 semaines pour décider comment appliquer le ML à ton business. Dans cet article, on t’explique de quoi il s’agit.

Risky business
Avant de parler de la méthodologie en elle-même, on va analyser brièvement quels sont les risques de ne pas faire une validation rapide de la faisabilité d’un projet de ML. Quelques-uns :
- Coût financier élevé : investir une somme considérable pour acquérir des outils et ressources pour un projet de machine learning qui s’avère ensuite non viable ou inefficace ne représente pas seulement une perte d’argent, mais affecte aussi le budget disponible pour d’autres initiatives clés de l’entreprise.
- Perte de temps : le temps, c’est de l’or, et si on ne valide pas rapidement la viabilité d’un projet de ML, on pourrait gaspiller des mois de travail dans une direction qui ne mène à aucun résultat positif, ce qui retarde la capacité de l’entreprise à innover et s’adapter rapidement au marché.
- Perte d’avantage concurrentiel : dans le monde des affaires actuel, la technologie est clé et ne pas bouger vite te met en désavantage concurrentiel. Si le marché adopte efficacement le machine learning pour rendre ses processus plus efficaces et prendre des décisions plus intelligentes, ton entreprise court le risque de rester à la traîne.
- Risque réputationnel : un projet de machine learning raté peut avoir un impact négatif sur la réputation de l’entreprise. Si on annonce une initiative qui ne tient pas ses promesses, on pourrait perdre la confiance des clients, investisseurs et partenaires clés, et donc affecter notre image et notre crédibilité.
- Démotivation des équipes : les domaines de la technologie sont le moteur de cette transformation digitale orientée données. S’ils investissent du temps et des efforts dans un projet de ML qui ne réussit pas à cause d’une validation insuffisante, ils pourraient se décourager et perdre leur motivation pour les initiatives futures, voire perdre des membres importants qui décideront de partir chez la concurrence.
- Investissement dans les mauvais outils et technologies : acquérir des outils et technologies sans évaluation adéquate conduit à investir dans des solutions qui ne s’alignent pas sur les besoins réels du business. Même si elles peuvent paraître prometteuses au départ, il est essentiel de faire une recherche approfondie pour garantir qu’elles soient appropriées et efficaces pour résoudre les défis auxquels ton entreprise fait face.
Ce ne sont que quelques exemples qui, bien sûr, peuvent générer des problèmes encore plus importants à l’avenir ou s’aggraver entre eux dans un cercle vicieux souvent catastrophique pour les plus petites entreprises ou celles avec moins de marge financière. En revanche, une validation rapide et efficace de cette viabilité nous donne comme avantages l’inverse de ce qu’on vient de décrire : efficacité en termes de coûts, rapidité dans la prise de décisions, avantage concurrentiel, plus grande adaptabilité, focus sur les objectifs clés, qualité du produit et retour sur investissement accéléré.
Il faut souligner que tout ce qui est mentionné précédemment s’applique à n’importe quel projet de développement logiciel, mais dans le cas de la data science, on a une couche de complexité supplémentaire, car on travaille avec des statistiques et des résultats souvent incertains. Alors, est-il possible d’appliquer un processus d’évaluation de faisabilité à ce type de projets ?
Heureusement, la réponse est : oui ! Et voici comment on fait.
On t’accompagne sur le chemin de la découverte
Le processus de Discovery a un objectif très concret : valider en quatre semaines s’il est possible ou non d’appliquer le machine learning pour la résolution d’un problème métier spécifique. Pour cela, chaque semaine est orientée vers la compréhension d’un aspect différent, aussi bien du projet lui-même que de l’entreprise, de ses ressources et du secteur dans lequel elle opère.
En concevant cette méthodologie, on a décidé de diviser le mois de Discovery en ces quatre parties :
- Semaine 1 : définition du problème et collecte de données.
- Semaine 2 : analyse exploratoire et pré-traitement des données.
- Semaine 3 : sélection et entraînement de modèles préliminaires.
- Semaine 4 : évaluation finale et présentation des résultats.
Voyons plus en détail ce qui se passe dans chacune de ces étapes.
Semaine 1
Dans cette première semaine, comme on l’a dit, on se concentre sur la définition du problème et la collecte des données. Cela implique d’abord d’avoir des réunions avec les stakeholders pour comprendre comment fonctionne le business et quel problème ils veulent résoudre. On cherche habituellement à s’immerger dans comment fonctionne le secteur, qui sont les utilisateurs, et quels sont les pain points qu’ont ces utilisateurs et le business.
Et, peut-être encore plus important, de ce travail émerge un des points fondamentaux de cette étape : identifier quelles sont les métriques clés qu’on souhaite améliorer. Les entreprises ne fonctionnent pas dans l’abstrait mais ont des KPIs qui, s’ils sont optimisés, se traduisent en gains tangibles pour le business.
Quelques exemples courants : réduire les temps d’attente dans le support, améliorer l’évaluation de la satisfaction client, réduire les taux d’impayés. Tout projet de machine learning doit être conçu, planifié et développé avec le cap d’améliorer ces KPIs qui se traduisent en avantages financiers et concurrentiels.
En plus de ces deux premiers aspects de la première semaine qui sont plus orientés business, on se concentre sur la génération d’un dataset pour l’analyse et l’exploration, qui nous servira de point de départ pour les trois semaines suivantes.
Semaine 2
La semaine deux est orientée vers l’analyse exploratoire des données, où on prend les données auxquelles on a accédé la première semaine et on plonge dedans pour essayer de les comprendre et de trouver des tendances, des relations et des insights qui nous donnent des pistes sur la façon dont elles peuvent nous aider à résoudre le problème.
On cherche aussi à connecter ces données, qui sont des représentations abstraites de la réalité, à la réalité elle-même pour voir comment elles s’articulent avec le business. En définitive, ce qu’on cherche, c’est de pouvoir raconter une histoire à travers ces données qui nous aide à cristalliser une vision intégrale du panorama qui se dresse devant nous.
Pour cela, de cette étape émergent beaucoup de visualisations des données : des graphiques qui condensent l’information de manière simple à comprendre et qui facilitent l’extraction d’insights et le storytelling, aussi bien pour les équipes techniques que pour les décideurs des organisations.
Semaine 3
À ce stade, on a déjà compris le problème à résoudre et quelles sont les données pertinentes, et on est en condition de commencer le modelage en lui-même. C’est là qu’on identifie le type de problème, et par conséquent de modèle, qu’on va utiliser : classification, régression ou clusterisation.
Les data scientists chargés de l’entraînement s’occupent de définir la métrique avec laquelle on évaluera la performance de ces modèles. Cela ne fait pas référence à ce qu’on a évoqué précédemment sur les KPIs business, mais à des mesures mathématiques de la précision de notre modèle (accuracy, precision, ROC/AUC…). Ce point n’est pas du tout anodin, car le choix d’une métrique adéquate est fondamental dans le succès ou l’échec de ce type de projets, puisqu’en utiliser une mauvaise peut conduire à évaluer comme viable un projet qui ne l’est pas, ou vice versa.
De cette semaine émerge ce qu’on appelle la POC (« preuve de concept »), un modèle initial qui n’est pas nécessairement parfaitement optimisé mais qui fonctionne comme base pour les comparaisons futures et comme matière première de ce qui se passe dans la quatrième semaine.
Semaine 4
Dans l’étape finale de notre processus de discovery, l’équipe prend le modèle entraîné à l’étape précédente et applique quelques optimisations pour son évaluation finale et la présentation des résultats au business.
On se concentre aussi sur l’explicabilité du modèle : ça ne nous sert à rien de dire « la métrique X a donné la valeur Y », on veut y trouver une cohérence et une corrélation avec la réalité. Cela peut se faire grâce à des techniques de feature importance, qui cherchent à exprimer numériquement le poids de chacune des variables pour le modèle. Ce point est très important parce que, dans beaucoup de cas, le client, qui est l’expert métier, peut le valider avec son opinion et sa vision basée sur l’expérience pour comprendre si nos résultats ont du sens.
Enfin, on prépare pour le client une présentation avec tous nos résultats et apprentissages de l’étape de Discovery, ainsi que des recommandations sur les prochaines étapes en fonction des objectifs atteints et de la viabilité du projet. C’est un moment de feedback et d’échange qui sert de clôture à ces quatre semaines de travail intense.

Prochaines étapes
Ces quatre semaines ont été très intenses ! Idéalement, le client repart de là avec des connaissances et des informations qui l’aident dans son travail au quotidien. Cela dit, le processus ne s’arrête pas ici. Après ce mois, il y a beaucoup de choses sur lesquelles on peut continuer à travailler :
- Mise en production du modèle : un modèle entraîné n’est rien de plus qu’un fichier sur l’ordinateur du data scientist. Pour vraiment apporter de la valeur au quotidien, il faut faire ce qu’on appelle du deployment ou mise en production, qui consiste à créer le logiciel qui permettra aux utilisateurs d’utiliser le modèle avec facilité et rapidité.
- A/B testing : au-delà des métriques avec lesquelles on a évalué le modèle, il existe des instances supplémentaires pour garantir sa qualité et son impact dans la réalité. Cela se fait avec des techniques comme l’A/B testing, où on teste des hypothèses statistiques pour s’assurer que le modèle est vraiment de qualité et qu’il fonctionne comme point de comparaison pour n’importe quel développement futur.
- Monitoring et ré-entraînement : la métrique avec laquelle on évalue le modèle n’est ni immuable ni permanente. Les changements dans la distribution des données au fil du temps peuvent dégrader sa performance, donc dans beaucoup de cas il est extrêmement important de mettre en place des mécanismes de monitoring et, éventuellement, de ré-entraînement du modèle avec des données plus récentes.
- Amélioration continue du modèle : cela peut passer par le choix d’algorithmes meilleurs ou plus récents qui peuvent émerger, un travail plus approfondi de sélection de variables, des processus d’optimisation, l’incorporation de métriques complémentaires et une grande diversité d’autres options, jusqu’à trouver la configuration qui s’adapte le mieux aux besoins de chaque business.
Ce ne sont que quelques exemples de prochaines étapes possibles. Chaque client est un monde et chaque problème à résoudre requiert analyse, dédication et engagement, donc il n’existe pas de réponses universellement valables. Mais à la fin du mois de Discovery, chacun doit au moins avoir un panorama clair, une meilleure compréhension des solutions possibles et une feuille de route concrète d’améliorations et d’avancées.
Tu veux en savoir plus ? On te laisse notre playlist de Business Webinars, orientée vers les entreprises qui cherchent à tirer le maximum de valeur de leurs données.
