Comment la raffinerie MyWaypoint transforme l'information publique en produits de données gouvernés, consultables et accessibles via API.
L'information publique est abondante. Elle est aussi incohérente, dispersée et difficile à exploiter.
L'information publiquement disponible se présente sous des dizaines de formats — fichiers CSV d'une source, flux JSON d'une autre, tableaux HTML intégrés dans des pages web, PDF contenant des données structurées qui ne peuvent pas être interrogées. Différentes sources utilisent des schémas incompatibles. Aucune norme commune ne s'applique à l'ensemble du paysage. Les cadences de mise à jour varient. Les noms de champs changent sans préavis. Les métadonnées sont absentes, incomplètes ou appliquées de façon irrégulière.
Le résultat est un grand volume d'information qui existe mais qui ne peut pas être facilement assemblé, comparé, consulté ou consommé par des systèmes automatisés. Les données sont là. La convivialité, non.
Juridictions multiples
Nombreuses juridictions et types de sources
Variation de formats
CSV, JSON, XML, API, PDF
Incohérence des schémas
Noms de champs, types et conventions différents
Mises à jour irrégulières
Cadences variables, aucune norme
Métadonnées manquantes
Attribution incomplète ou absente
Non lisible par machine
Nécessite une extraction avant utilisation
La raffinerie MyWaypoint a été appliquée à des sources d'information publiques en utilisant le même pipeline à sept étapes qu'elle applique à tout environnement de données.
Chaque étape a répondu à un problème précis dans le paysage des données publiques — formats incohérents, attribution manquante, absence de consultabilité, manque de gouvernance.
Le pipeline n'exigeait pas que les sources soient propres ou cohérentes avant l'ingestion. Corriger les incohérences, c'est précisément ce que fait la raffinerie.
Acquérir
Collecter auprès de sources publiques — portails, registres, sites web, fichiers et flux de données dans différentes juridictions et types de sources.
Valider
Analyser chaque source entrante pour vérifier son exhaustivité, son intégrité structurelle et la conformité de son format. Signaler les enregistrements présentant des champs manquants, des violations structurelles ou des problèmes de qualité avant qu'ils n'entrent dans le pipeline.
Normaliser
Convertir les CSV, JSON, XML et réponses d'API en un schéma d'enregistrement unifié. Standardiser les noms de champs, les formats de valeurs et les types de données entre des sources qui n'ont jamais été conçues pour être cohérentes entre elles.
Enrichir
Associer des métadonnées — attribution à la source, catégories de collecte, horodatages de mise à jour, contexte géographique et classification thématique. Ajouter un contexte sémantique qui rend les enregistrements trouvables et utiles au-delà de la simple recherche par correspondance exacte.
Gouverner
Consigner la traçabilité complète de chaque jeu de données — URL source, date d'acquisition, historique de traitement, suivi des versions et fréquence de mise à jour. Appliquer des normes de documentation afin que chaque jeu de données dispose d'un enregistrement précis et maintenable de ce qu'il est et de sa provenance.
Rechercher
Indexer les enregistrements normalisés et enrichis pour la recherche en texte intégral, le filtrage à facettes et la récupération sémantique. Chaque jeu de données devient découvrable par mot-clé, catégorie et recherche contextuelle.
Diffuser
Mettre à disposition via le catalogue MyCleanData — interface consultable, collections organisées, points de terminaison API structurés et fichiers de jeux de données téléchargeables. Le résultat est accessible publiquement et maintenu de façon opérationnelle.
MyCleanData est ce que la raffinerie a produit. Une plateforme de données accessible au public à mycleandata.ca, construite entièrement à partir du pipeline à sept étapes.
Elle contient des jeux de données publiquement disponibles qui ont été acquis, validés, normalisés, enrichis, gouvernés, indexés et rendus accessibles pour la recherche, l'accès API et le téléchargement. Chaque jeu de données porte une attribution à la source, un historique de traitement et une documentation générée par la raffinerie — et non rédigée manuellement après coup.
La plateforme est opérationnelle. Elle est maintenue grâce au même pipeline qui l'a construite. Lorsque les sources se mettent à jour, la raffinerie s'exécute. Lorsque de nouvelles sources sont ajoutées, elles passent par le même processus. La gouvernance ne se dégrade pas avec le temps parce qu'elle est intégrée au modèle opérationnel, et non appliquée une seule fois puis abandonnée.
Catalogue consultable
Jeux de données gouvernés et accessibles au public
Les 7 étapes
Pipeline complet de la raffinerie appliqué à chaque jeu de données
Maintenu
Exploité en continu grâce au même pipeline
Chaque fonctionnalité de MyCleanData est issue directement du pipeline de la raffinerie. Rien n'a été construit séparément.
Recherche en texte intégral et à facettes sur l'ensemble des jeux de données. Rendu possible parce que chaque enregistrement a été normalisé et indexé dans le pipeline — et non parce que la recherche a été ajoutée après coup.
Produit par : étapes Normaliser → Rechercher
Regroupements organisés de jeux de données connexes, classés par thème, zone géographique ou catégorie de données. Les collections sont issues de la classification et de l'enrichissement appliqués lors de l'étape Enrichir.
Produit par : étapes Enrichir → Gouverner
Points de terminaison API structurés livrant le contenu des jeux de données et leurs métadonnées de façon programmatique. Rendu possible parce que la normalisation a créé des schémas cohérents et prévisibles qui correspondent directement aux champs des API.
Produit par : étapes Normaliser → Diffuser
Attribution à la source, traçabilité des données et historique des mises à jour pour chaque jeu de données. Les registres de gouvernance ont été produits par le pipeline, et non rédigés manuellement — ils sont un résultat direct de l'étape Gouverner.
Produit par : étapes Acquérir → Gouverner
Descriptions des jeux de données, schémas de métadonnées, définitions de champs et notes de provenance générés par le processus de la raffinerie. La documentation est un résultat structurel — pas un contenu rédigé séparément après coup.
Produit par : étapes Enrichir → Gouverner
Tutoriels et guides d'utilisation expliquant comment accéder aux données et les exploiter. Développés en parallèle de la plateforme dans le cadre de la couche de gouvernance et de documentation, et non comme un ajout tardif.
Produit par : étapes Gouverner → Diffuser
MyCleanData démontre ce que produit la raffinerie. Les déploiements en entreprise appliquent le même processus à des environnements de données privés, internes et personnalisés.
La plateforme n'est pas différente pour un usage en entreprise. Ce qui diffère, ce sont les sources. Les contrôles de gouvernance, les étapes du pipeline et les formats de sortie sont identiques.
Davantage de jeux de données n'a pas créé davantage de valeur. Des jeux de données uniformément raffinés, oui. Les décisions qui ont amélioré la consultabilité, la fiabilité des API et la qualité de la gouvernance étaient des décisions de qualité, non de quantité. Une couverture sans qualité produit une grande collection d'informations peu fiables — pas une plateforme utile.
À l'échelle d'un catalogue, maintenir la qualité manuellement n'est pas réaliste. Une gouvernance intégrée dans le pipeline — traçabilité des données, attribution à la source, journaux de traitement — ne se dégrade pas avec la croissance. Une gouvernance appliquée comme couche manuelle après coup, si. Le modèle de raffinerie a été conçu de sorte que la gouvernance soit une propriété structurelle de chaque résultat, et non une activité superposée.
Des données non documentées ne sont pas des données utiles — ce sont des données qui nécessitent un travail supplémentaire avant de pouvoir être utilisées. Intégrer la génération de documentation dans les étapes Enrichir et Gouverner a fait en sorte que la documentation existait dès la production d'un jeu de données, et non comme tâche ultérieure. Cela a rendu la plateforme navigable dès le lancement et la maintient navigable à mesure que de nouveaux jeux de données sont ajoutés.
La recherche sémantique, la génération augmentée par récupération (RAG) et la découverte assistée par l'IA opèrent toutes sur le contenu enrichi et normalisé produit par la raffinerie — pas sur les données brutes de la source. La qualité de l'information qui entre dans la couche de recherche et de récupération détermine directement la qualité de ce qui en sort. Raffiner avant d'indexer n'est pas facultatif pour une récupération IA fiable. C'en est le fondement.
Un catalogue où 90 % des jeux de données suivent un schéma cohérent et 10 % non est moins utile que ce chiffre de 90 % ne le suggère. L'incohérence dans les 10 % restants brise des hypothèses sur lesquelles comptent développeurs et analystes. Des schémas prévisibles permettent des intégrations fiables. Une gouvernance cohérente instaure la confiance. La raffinerie produit la cohérence de façon systématique — elle ne repose pas sur la discipline individuelle appliquée source par source.
À propos de cette étude de cas
MyCleanData est notre étude de cas publique actuelle — une démonstration en conditions réelles de la raffinerie appliquée à de l'information publiquement disponible. Les déploiements en entreprise impliquant des données privées ou propriétaires sont régis par des accords de confidentialité. D'autres études de cas issues d'engagements en entreprise seront publiées à mesure qu'elles deviendront disponibles, selon les modalités de divulgation appropriées.
MyCleanData est en ligne à mycleandata.ca. Le même modèle de raffinerie est disponible pour les environnements de données privés, d'entreprise et personnalisés.