La qualité des données détermine ce que la BI et l'IA peuvent réellement produire

Des données inexactes, incomplètes ou incohérentes compromettent même les investissements en BI et en IA les mieux conçus. Cette perspective présente les dimensions de la qualité des données que la direction doit gouverner et les pratiques opérationnelles nécessaires pour restaurer la confiance dans les insights d'affaires.

La qualité des données détermine ce que la BI et l'IA peuvent réellement produire.

Lorsqu'un tableau de bord de Business Intelligence produit une tendance trompeuse ou qu'un modèle d'IA renvoie une prédiction peu fiable, le premier réflexe de la direction est souvent de remettre l'outil en question. Dans la plupart des cas, l'outil n'est pas en cause. Ce sont les données qui l'alimentent. Les plateformes de BI et les modèles d'IA constituent une couche d'exécution : ils traitent les données qu'on leur fournit et ne peuvent pas, d'eux-mêmes, distinguer une information exacte d'une information erronée. Lorsque les données sous-jacentes sont défaillantes, le résultat l'est également, quelle que soit la sophistication de la couche analytique ou de modélisation.

Cette distinction est déterminante, car elle change l'endroit où la direction doit porter son attention. Une initiative de BI peu performante est fréquemment traitée comme un problème d'outillage ou de compétences, alors que la véritable contrainte se situe en amont : l'organisation n'a jamais mis en place la discipline opérationnelle nécessaire pour maintenir ses données exactes, complètes, cohérentes et à jour.

Des données inexactes produisent des conclusions confiantes et erronées

Des données inexactes sont souvent plus dangereuses que l'absence de données, car elles ne se signalent pas d'elles-mêmes. Un modèle bâti sur des données inexactes produira tout de même un résultat, et ce résultat aura l'apparence de la complétude et de l'autorité, même s'il est erroné. Trois schémas expliquent la majorité des cas d'inexactitude rencontrés par la direction :

  • Données périmées : des données clients, de marché ou opérationnelles qui n'ont pas été mises à jour depuis des années sont traitées comme actuelles, produisant des conclusions qui ne reflètent plus la réalité.

  • Données dupliquées : un même client, une même transaction ou un même actif apparaît plusieurs fois dans un système, gonflant les décomptes et faussant les indicateurs construits à partir d'eux.

  • Données non validées : des données saisies manuellement, migrées entre systèmes ou obtenues d'un tiers sans validation comportent des erreurs qui s'accumulent à chaque nouvelle utilisation.

Chacun de ces cas produit le même effet en aval : un rapport ou un modèle qui semble fiable tout en induisant activement en erreur les décisions prises sur cette base.

Des données incohérentes et incomplètes compromettent l'analyse avant même qu'elle ne commence

Une deuxième catégorie de défaillance de la qualité des données n'a rien à voir avec l'exactitude factuelle des données et tout à voir avec leur utilisabilité. Des données techniquement exactes mais structurellement incohérentes suffisent à compromettre l'analyse.

  • Formats incohérents : un même champ saisi différemment d'un système à l'autre (formats de date, conventions de nommage, unités de mesure) oblige les analystes à réconcilier manuellement les données avant même de pouvoir commencer une analyse réelle, et chaque étape de réconciliation manuelle constitue une nouvelle occasion d'erreur.

  • Données incomplètes : une analyse menée sur un ensemble de données partiel produit une image partielle, et souvent trompeuse. Une performance commerciale analysée sans l'ensemble complet des transactions, ou une planification de la main-d'œuvre bâtie sur des données d'effectif incomplètes, sous-estimera ou surestimera la situation réelle.

  • Corruption des données : des erreurs introduites lors de l'extraction, de la transformation ou de la migration entre systèmes peuvent altérer silencieusement des valeurs sans déclencher de défaillance visible, ce qui rend cette catégorie d'erreur particulièrement difficile à détecter et particulièrement dommageable une fois découverte.

Une donnée manquante n'est pas une lacune. C'est une décision prise sans disposer de toute l'information

Les données manquantes sont fréquemment perçues comme une limitation mineure, alors qu'elles constituent en réalité une décision prise avec une information incomplète, souvent à l'insu de la direction. Une prévision de la demande bâtie sans historique complet des ventes, ou un modèle de fidélisation entraîné sans historique complet des interactions clients, produira tout de même un résultat. Ce résultat reflète simplement moins d'information que la direction ne le suppose.

Le risque organisationnel tient au fait que les données manquantes ne sont généralement découvertes qu'après qu'une décision fondée sur elles a déjà échoué, moment où l'outil de BI ou le modèle d'IA se voit blâmé pour un résultat que les données n'ont jamais été en mesure de soutenir.

Restaurer la confiance dans les insights d'affaires exige une discipline opérationnelle, pas un nettoyage ponctuel

Un exercice unique de nettoyage des données ne résoudra pas un problème de qualité des données, car la qualité des données n'est pas un projet avec une date de fin définie. C'est une discipline opérationnelle qui doit être maintenue en continu, à mesure que de nouvelles données entrent dans l'organisation. Quatre pratiques constituent le fondement de cette discipline :

  1. Établir des normes de qualité des données. Définir ce que signifient l'exactitude, la complétude, la cohérence et l'actualité pour chaque ensemble de données critique, et valider les nouvelles données selon ces normes dès leur point de saisie plutôt qu'après coup.

  2. Normaliser les formats et les taxonomies. Harmoniser les conventions de nommage, les unités et les structures entre systèmes afin que les données puissent être combinées et analysées sans réconciliation manuelle.

  3. Réaliser un inventaire des sources de données et une évaluation des lacunes. Identifier les ensembles de données qui alimentent les décisions critiques, confirmer leur complétude et combler les lacunes identifiées avant de faire évoluer toute initiative de BI ou d'IA construite sur cette base.

  4. Mettre en place une surveillance continue de la qualité des données. Intégrer des contrôles récurrents dans le pipeline de données afin que les problèmes de qualité soient détectés et corrigés au fur et à mesure, plutôt que découverts en aval dans une décision d'affaires défaillante.

La question de gouvernance que la direction devrait se poser

La question à se poser n'est pas de savoir si les outils de BI et d'IA de l'organisation sont suffisamment performants. C'est de savoir si les données qui alimentent ces outils répondent à une norme sur laquelle l'organisation serait à l'aise de fonder ses décisions. La qualité des données constitue le fondement sur lequel repose tout investissement en BI et en IA, et aucune sophistication d'outillage ne compense un fondement qui n'a pas été gouverné. Les organisations qui traitent la qualité des données comme une discipline opérationnelle continue, plutôt que comme un nettoyage occasionnel, sont celles dont les investissements en BI et en IA livrent réellement les insights pour lesquels ils ont été conçus.

Photo par Claudio Schwarz sur Unsplash