Chaque décision qu'une équipe prend à partir d'un tableau de bord, d'un rapport ou d'un modèle repose sur une hypothèse que personne n'énonce à voix haute : que les données sous-jacentes sont suffisamment fiables pour être utilisées. Les métriques de qualité des données sont la façon dont vous testez cette hypothèse plutôt que d'espérer qu'elle tienne. Elles transforment le vague sentiment que "les chiffres semblent bizarres" en dimensions concrètes et mesurables que vous pouvez noter, suivre et améliorer.

Ce guide explique ce que sont les métriques de qualité des données et pourquoi elles sont importantes, puis passe en revue les six dimensions qui définissent la qualité des données (exactitude, complétude, cohérence, actualité, validité et unicité), avec la façon de mesurer et d'améliorer chacune. Il se termine par un processus pratique et reproductible pour mettre ces métriques en œuvre et une note sur la place du web scraping. À la fin, vous devriez pouvoir regarder n'importe quel jeu de données et dire, avec des preuves, dans quelle mesure il est réellement bon.

Que sont les métriques de qualité des données ?

La qualité des données décrit si les données sont exactes, complètes, fiables et adaptées à l'utilisation que vous en avez en tête. Les métriques de qualité des données sont les indicateurs mesurables, souvent traités comme des indicateurs clés de performance (KPI), qui vous indiquent dans quelle mesure un jeu de données est précieux et pertinent et s'il peut être utilisé en toute confiance. Elles représentent la différence entre affirmer que des données sont bonnes et le prouver.

L'évaluation seule n'est pas le but. La vraie valeur de ces métriques est qu'elles vous permettent de séparer les données de haute qualité des données de faible qualité selon des critères précis et nommés, afin que vous sachiez exactement où un jeu de données est solide et où il vous fait défaut. Au lieu d'un verdict flou, vous obtenez un profil : peut-être que les données sont exactes et uniques mais obsolètes et incohérentes entre les systèmes. C'est ce profil qui vous indique quoi corriger en premier.

Mesurer, puis améliorer. Chaque dimension, exactitude, complétude, cohérence, actualité, validité et unicité, est notée par rapport à des règles, et les échecs alimentent un cycle qui élève la qualité globale.

Pourquoi les métriques de qualité des données comptent

La mauvaise qualité des données est coûteuse d'une manière qu'il est facile de sous-estimer. Si des données de faible qualité alimentent une décision, le résultat est des opportunités manquées, une stratégie défaillante et un retour sur investissement négatif pour le travail qui en dépendait. Des enquêtes menées auprès de professionnels des données montrent régulièrement que la préparation et le nettoyage des données, et non leur analyse, occupent la majorité de leur temps, précisément parce que la qualité ne peut pas être tenue pour acquise. Les cadres dirigeants le ressentent aussi : dans des reportages largement cités de Forbes, une grande majorité de PDG ont exprimé des inquiétudes quant à la qualité des données sur lesquelles reposent leurs décisions.

Maîtriser la qualité et les bénéfices se cumulent. Des données fiables et exactes conduisent à de meilleures décisions plus rapides, à une réduction des risques, à une conformité réglementaire facilitée, à des coûts opérationnels réduits et à une plus grande confiance de la part des personnes qui les utilisent, tant à l'intérieur qu'à l'extérieur de l'organisation. Les systèmes orientés client s'améliorent également, car des enregistrements clients à jour et corrects offrent une meilleure expérience. Le suivi de ces dimensions avec des métriques explicites transforme "nous devrions avoir de bonnes données" en une propriété gérée et améliorable de l'entreprise plutôt qu'en une question de chance.

Les six dimensions de la qualité des données

La qualité des données n'est pas un chiffre unique. Elle est généralement décomposée en six dimensions, chacune mesurant une façon différente dont les données peuvent être correctes ou incorrectes. Un jeu de données peut bien se comporter sur certaines et mal sur d'autres, c'est précisément pourquoi les mesurer séparément est utile. Les sections ci-dessous traitent chaque dimension tour à tour : ce qu'elle mesure, comment la vérifier et comment l'améliorer.

1. Exactitude

L'exactitude mesure dans quelle mesure les données reflètent la réalité : les valeurs sont-elles correctes et précises ? C'est la dimension la plus intuitive et souvent la plus difficile à vérifier, car elle nécessite de comparer vos données avec la vérité qu'elles sont censées représenter. L'exactitude se dégrade facilement, par des enregistrements obsolètes, la saisie manuelle de données ou des erreurs introduites lors du transfert de données entre systèmes.

Pour mesurer l'exactitude, validez les valeurs par rapport à une source de référence fiable et utilisez des techniques de validation croisée pour détecter les enregistrements qui ne concordent pas. Pour l'améliorer, réduisez les moments où les erreurs s'introduisent : automatisez la saisie là où c'est possible, ajoutez une validation au point de capture et actualisez les enregistrements obsolètes selon un calendrier. Dans les domaines à enjeux élevés comme la santé et la finance, l'exactitude est la plus importante, car même une légère erreur peut avoir de graves conséquences.

2. Exhaustivité

La complétude mesure si toutes les données dont vous avez besoin sont effectivement présentes. Des données incomplètes sont souvent effectivement inutilisables : un enregistrement client sans numéro de téléphone ne peut pas soutenir une campagne qui en dépend. La complétude est évaluée à la fois au niveau de l'enregistrement et au niveau de l'attribut, et elle couvre plus que les lacunes évidentes. Lors de sa vérification, tenez compte des champs obligatoires (un numéro de téléphone, par exemple), des champs optionnels (un champ d'intérêt) et des champs pertinents pour chaque enregistrement particulier.

Pour mesurer la complétude, calculez le pourcentage de valeurs manquantes dans les champs qui comptent et comparez votre jeu de données avec un échantillon connu comme complet. Pour l'améliorer, rendez les champs obligatoires non-ignorables lors de la capture, comblez les lacunes à partir de sources secondaires lorsque c'est possible et signalez les enregistrements qui tombent en dessous d'un seuil de complétude pour qu'ils ne soient pas utilisés silencieusement comme s'ils étaient complets.

3. Cohérence

La cohérence mesure si les données concordent avec elles-mêmes à travers différentes sources et au sein d'un même jeu de données. Parce que les organisations répartissent désormais leurs données précieuses sur de nombreux systèmes et appareils pour se prémunir contre les pertes, le même fait peut exister à plusieurs endroits, et ces copies peuvent diverger. Les données sont cohérentes lorsqu'elles sont uniformes dans tous ces systèmes.

L'incohérence est corrosive : des copies contradictoires du même enregistrement introduisent des erreurs et des contradictions qui sapent silencieusement l'exactitude et la fiabilité de tout ce qui est en aval. Pour mesurer la cohérence, mappez les mêmes entités à travers les sources et recherchez les valeurs qui ne concordent pas. Pour l'améliorer, soyez vigilant aux moments où l'incohérence s'introduit, lors de la saisie, de la modification et de l'intégration des données, et lorsque c'est faisable, intégrez les données dans un système unique faisant autorité pour qu'il n'y ait qu'une version de référence. La mise en correspondance d'enregistrements entre sources est une discipline à part entière ; notre guide sur la mise en correspondance des données scrappées couvre les techniques en profondeur.

4. Fraîcheur

L'actualité mesure si les données sont disponibles et à jour lorsque vous en avez réellement besoin. Il y a une distinction subtile mais importante ici entre des données qui sont mises à jour et des données qui sont disponibles. Les données peuvent être parfaitement actuelles et ne pas passer le test d'actualité si elles ne sont pas disponibles au moment où une décision doit être prise. Des données mal temporisées, fraîches mais inaccessibles, peuvent nuire à la fois à la prise de décision et à la réputation d'une organisation.

Pour mesurer l'actualité, suivez la différence de temps entre le moment où les données sont collectées et celui où elles deviennent disponibles, et mesurez la fréquence à laquelle elles sont actualisées. Pour l'améliorer, raccourcissez le pipeline entre la collecte et la disponibilité, automatisez les cycles d'actualisation pour que les données ne deviennent pas obsolètes entre les mises à jour manuelles et alignez la fréquence de mise à jour sur la rapidité avec laquelle la réalité sous-jacente change. L'actualité est au cœur de la gestion des bases de données : la question à laquelle elle répond est de savoir si les informations requises sont disponibles au moment demandé.

5. Validité

La validité mesure si les données sont conformes aux règles, formats et standards qu'elles sont censées respecter. Une valeur peut être présente et même exacte dans le fond tout en étant invalide si elle enfreint le format défini, par exemple une date dans le mauvais format ou un code en dehors de l'ensemble autorisé. Les données invalides proviennent généralement d'erreurs de saisie causées par des formats incohérents, de la collecte auprès de sources peu fiables ou de données stockées ou traitées incorrectement. Non contrôlées, les valeurs invalides se propagent vers l'extérieur et nuisent également à la complétude du jeu de données.

Pour mesurer la validité, calculez le pourcentage de valeurs qui enfreignent vos règles et validez les données par rapport à vos exigences métier. Pour l'améliorer, définissez des règles explicites de format et de plage en amont, appliquez-les au point de saisie plutôt qu'après coup, et rejetez ou mettez en quarantaine les enregistrements qui les violent avant qu'ils n'atteignent les systèmes qui dépendent d'entrées propres.

6. Unicité

L'unicité mesure si chaque entité réelle apparaît une seule fois, sans enregistrements en double gonflant vos comptages ou divisant un seul client sur plusieurs lignes. C'est une dimension vitale car les doublons corrompent silencieusement l'exactitude : les chiffres agrégés surestiment la réalité, et les mises à jour appliquées à une copie laissent les autres incorrectes. Les doublons ont tendance à apparaître à partir d'enregistrements obsolètes persistant à côté de leurs remplaçants ou de données copiées à travers de nombreux transferts.

Pour mesurer l'unicité, calculez le pourcentage d'enregistrements en double dans le jeu de données. Pour l'améliorer, attribuez des identifiants uniques stables pour que les doublons puissent être détectés et fusionnés, et exécutez la déduplication régulièrement plutôt que d'attendre que les doublons causent un problème visible. Cela n'arrive peut-être pas souvent, mais cela arrive assez souvent pour que l'unicité mérite une attention délibérée.

Les dimensions de la qualité des données en un coup d'œil

Les six dimensions sont plus faciles à appliquer lorsque vous pouvez les voir côte à côte. Le tableau ci-dessous résume ce que chacune mesure et une façon pratique de la vérifier.

Dimension Ce qu'elle mesure Comment la vérifier
Exactitude Si les valeurs sont correctes et précises Validation croisée et comparaison avec une source fiable
Complétude Si toutes les données requises sont présentes Mesurer le pourcentage de valeurs manquantes par rapport à un échantillon connu comme complet
Cohérence Si les données concordent entre et au sein des sources Mapper la même entité dans les systèmes et signaler les valeurs qui ne concordent pas
Actualité Si les données sont actuelles et disponibles au besoin Suivre le délai entre collecte et disponibilité et la fréquence d'actualisation
Validité Si les données sont conformes aux règles et formats définis Mesurer le pourcentage de valeurs qui enfreignent les règles métier
Unicité Si chaque entité n'apparaît qu'une seule fois Mesurer le pourcentage d'enregistrements en double

Comment mettre en pratique les métriques de qualité des données

Connaître les dimensions est une chose ; les appliquer comme une discipline continue en est une autre. Les étapes ci-dessous transforment les métriques en un cycle reproductible. Ce n'est pas un projet ponctuel : maintenir la qualité des données est un effort continu, car les données et l'entreprise qui les entoure évoluent constamment.

Définissez vos indicateurs de qualité des données

Commencez par choisir les métriques qui comptent pour vos objectifs. Chaque entreprise est différente, alors sélectionnez les dimensions, complétude, exactitude, cohérence, actualité, unicité, validité, ou un sous-ensemble, qui correspondent à vos objectifs. Des métriques claires aident la direction à présenter des données fiables aux clients, à identifier où l'exactitude se perd et à localiser les enregistrements incomplets, invalides ou incohérents avant qu'ils ne se propagent.

Établir des règles de qualité des données

Pour chaque métrique que vous avez choisie, définissez la règle qui détermine ce qui est considéré comme bon. Si la complétude est l'une de vos métriques, la règle pourrait être que chaque champ obligatoire doit être rempli pour qu'un enregistrement soit valide. Les règles définissent les seuils qui séparent les données de haute qualité des données de faible qualité, et elles donnent à tout le monde un standard commun. Pour la cohérence au sein d'une organisation, chaque équipe impliquée dans la gestion des données doit accepter et appliquer les mêmes règles.

Développer et exécuter des tests de qualité des données

Créez des tests qui mesurent les données par rapport à vos règles. Selon la complexité des données et des règles, ces tests peuvent être automatisés ou manuels. Ensuite, exécutez-les et enregistrez le résultat de chaque test, ce qui est l'un des meilleurs moyens de renforcer la confiance dans un jeu de données. Lorsque vous les exécutez, surveillez les signes classiques de mauvaise qualité : champs avec peu ou pas d'informations, valeurs inexactes ou incomplètes, formatage irrégulier, éléments redondants et anciens enregistrements à mettre à jour. Exécutez ces vérifications régulièrement pour que même les petites erreurs soient détectées plutôt que négligées.

Crawlbase Crawling API

Lorsque les données que vous évaluez proviennent du web, les problèmes de qualité commencent souvent lors de la collecte : les requêtes bloquées, les pages partielles et les extraits incohérents alimentent directement les problèmes d'exactitude, de complétude et de cohérence. La Crawlbase Crawling API gère le rendu, la rotation des IP et la résolution des CAPTCHA pour vous, de sorte que les pages reviennent complètes et que vous ne payez que pour les requêtes réussies, ce qui signifie une entrée plus propre avant même qu'une vérification de qualité ne soit effectuée.

Analyser les résultats et s'améliorer

Après avoir exécuté les tests, analysez les résultats par rapport aux règles que vous avez définies. C'est ainsi que vous mesurez la réelle qualité des données, et l'analyse révèle souvent pourquoi les problèmes existent, ce qui vous indique la correction à apporter. Utilisez ces informations pour affiner les règles et rendre les données plus fiables. Ensuite, agissez : corrigez les erreurs que vous avez trouvées et, tout aussi important, changez les pratiques qui les ont causées, que cela signifie renforcer la saisie des données, réviser les règles d'une métrique ou en ajouter de nouvelles pour détecter un mode d'échec que vous avez manqué. Éviter que la même erreur ne se reproduise est ce qui rend l'amélioration durable.

Surveiller en continu

Améliorer la qualité des données n'est pas un processus ponctuel ; c'est un parcours continu. Surveillez les données en permanence pour confirmer qu'elles continuent à respecter vos règles définies, et révisez ces règles régulièrement, car l'environnement commercial évolue et les seuils d'hier peuvent ne plus convenir. La surveillance continue vous donne la flexibilité nécessaire pour vous adapter avant que la qualité ne se dégrade, et c'est la pratique qui maintient la fiabilité d'un jeu de données sur le long terme. Pour la mise en forme et la validation des données lors de leur transit, notre note sur la façon de structurer et nettoyer les données scrappées couvre les étapes de nettoyage qui alimentent ces vérifications, et notre vue d'ensemble de l'architecture des pipelines de données montre où les portes de qualité s'inscrivent dans le flux global.

Web scraping et qualité des données

Le web scraping est la collecte automatisée de données provenant de sites web, utilisée dans la recherche de marché, la surveillance des prix et l'analyse de données. Parce que tant de modélisation et d'analyse dépendent désormais de données extraites du web, la qualité de cette étape de collecte fixe un plafond à tout ce qui suit. Si les pages reviennent bloquées, partielles ou avec une structure incohérente, le jeu de données résultant est compromis en termes d'exactitude, de complétude et de cohérence avant même qu'un seul test de qualité ne soit exécuté.

Un bon outillage de collecte protège ces dimensions à la source. Un service de scraping capable peut récupérer des données complètes et pertinentes de sites complexes à la demande, s'adapter aux changements de site et gérer les parseurs, proxies et navigateurs pour vous. Le résultat est une entrée plus propre, ce qui signifie moins de problèmes de qualité à résoudre ultérieurement. Une fois les données en main, les six mêmes dimensions s'appliquent, et des outils comme pandas permettent de profiler facilement les valeurs manquantes, les doublons et les enregistrements hors plage dans le cadre de vos vérifications habituelles.

Scraper de façon responsable

Qualité et responsabilité vont de pair. Lorsque vous collectez des données sur le web, ne scrapez que des données publiques, respectez les conditions d'utilisation de chaque site et ses directives robots.txt, et maintenez un taux de requêtes raisonnable pour ne pas surcharger les serveurs sur lesquels vous comptez. Lorsque les données impliquent des informations personnelles, traitez-les conformément aux réglementations telles que le RGPD et le CCPA. La collecte responsable n'est pas seulement une base éthique ; elle tend également à produire des données plus stables et plus cohérentes, ce qui se répercute directement sur la qualité.

Récapitulatif

Points clés

  • Les métriques remplacent les suppositions. Les métriques de qualité des données transforment le vague sentiment que les chiffres semblent bizarres en dimensions mesurables que vous pouvez noter, suivre et améliorer.
  • Six dimensions définissent la qualité. L'exactitude, la complétude, la cohérence, l'actualité, la validité et l'unicité capturent chacune une façon différente dont les données peuvent être correctes ou incorrectes, mesurez-les séparément.
  • Chaque dimension a une vérification concrète. De la validation croisée par rapport à une source fiable au comptage des valeurs manquantes, des doublons et des échecs de règles, chaque dimension correspond à une mesure pratique.
  • La qualité est un cycle continu. Définissez des métriques, établissez des règles, créez et exécutez des tests, analysez, améliorez, puis surveillez ; les données et l'entreprise qui les entoure continuent d'évoluer, donc le travail ne s'arrête jamais.
  • La collecte fixe le plafond. Lorsque les données proviennent du web, un scraping propre et complet protège l'exactitude, la complétude et la cohérence avant qu'un test de qualité ne soit effectué.

Foire aux questions

Quelles sont les six métriques de qualité des données ?

Les six dimensions les plus couramment utilisées pour mesurer la qualité des données sont l'exactitude (les valeurs sont-elles correctes ?), la complétude (toutes les données requises sont-elles présentes ?), la cohérence (les données concordent-elles entre et au sein des sources ?), l'actualité (sont-elles actuelles et disponibles au besoin ?), la validité (respectent-elles les règles et formats définis ?) et l'unicité (chaque entité n'apparaît-elle qu'une seule fois ?). Un jeu de données peut bien se comporter sur certaines et mal sur d'autres, c'est pourquoi chacune est mesurée séparément.

Comment mesurer la qualité des données ?

Vous la mesurez dimension par dimension. L'exactitude est vérifiée par validation croisée par rapport à une source fiable ; la complétude par le pourcentage de valeurs manquantes ; la cohérence en mappant la même entité dans les systèmes et en signalant les désaccords ; l'actualité par le délai entre collecte et disponibilité et la fréquence d'actualisation ; la validité par le pourcentage de valeurs qui enfreignent vos règles métier ; et l'unicité par le pourcentage d'enregistrements en double. Ensemble, ces éléments donnent un profil plutôt qu'un score unique.

Qu'est-ce qu'une approche de la qualité des données fondée sur des métriques ?

Une approche basée sur les métriques analyse plusieurs aspects des données pour établir des scores de qualité et les gère ensuite comme un cycle continu. Les étapes sont : définir vos métriques de qualité des données, établir des règles pour chacune, développer des tests, exécuter ces tests et enregistrer les résultats, analyser les résultats, améliorer les données et les pratiques qui les sous-tendent, et surveiller en continu pour que la qualité soit maintenue à mesure que les conditions changent.

Pourquoi la qualité des données est-elle importante pour l'entreprise ?

Les décisions ne valent que ce que valent les données qui les sous-tendent. Des données de haute qualité conduisent à de meilleures décisions plus rapides, à une réduction des risques, à une conformité réglementaire facilitée, à des coûts opérationnels réduits et à une plus grande confiance de la part des utilisateurs internes et des clients. Des données de mauvaise qualité produisent l'effet inverse : opportunités manquées, stratégie défaillante et efforts gaspillés. C'est pourquoi les enquêtes montrent régulièrement que les professionnels des données passent la majeure partie de leur temps à préparer les données et pourquoi la plupart des PDG font état d'inquiétudes quant à la qualité des données sur lesquelles ils s'appuient.

Quelle est la différence entre exactitude et validité des données ?

L'exactitude concerne la correction : si une valeur correspond au fait réel qu'elle représente. La validité concerne la conformité : si une valeur respecte les règles, formats et plages définis. Une valeur peut être valide mais inexacte, par exemple un numéro de téléphone correctement formaté qui appartient à la mauvaise personne, ou exacte dans le sens mais invalide parce qu'elle est stockée dans le mauvais format. Une solide qualité des données nécessite les deux.

Comment le web scraping influe-t-il sur la qualité des données ?

Le web scraping est souvent l'étape de collecte qui alimente l'analyse, donc sa fiabilité fixe un plafond sur la qualité. Les requêtes bloquées, les pages partielles et la structure incohérente nuisent à l'exactitude, à la complétude et à la cohérence avant qu'une vérification ne soit effectuée. Un scraping robuste qui gère le rendu, la rotation et les blocages renvoie des pages complètes et cohérentes, ce qui signifie une entrée plus propre et moins de problèmes de qualité à résoudre en aval.

Commencer à construire

Crawlez n'importe quel site à grande échelle, sans combattre l'infrastructure.

Crawlbase gère les proxies, les empreintes et les CAPTCHA afin que votre équipe livre des pipelines de données au lieu de maintenir la plomberie de crawl. 1 000 requêtes gratuites, sans carte requise.

En libre-service · Sans appel commercial requis · Volumes de crawl entreprise disponibles