Hybridation des sources de données : principes, méthodes et enjeux pour la mesure d’audience

Face à la multiplication des données et à la fragmentation des usages, les méthodes de mesure évoluent. L’hybridation des sources s’impose comme une approche clé pour croiser, enrichir et fiabiliser les mesures, et mieux répondre aux exigences croissantes de précision et de compréhension des usages.

Qu'est-ce que l'hybridation de données ?

L’hybridation des sources de données consiste à combiner plusieurs sources complémentaires afin d’améliorer la qualité, la précision ou la richesse d’une mesure. Cette approche s’inscrit dans le prolongement des méthodes statistiques fondées sur des échantillons probabilistes, qui ont constitué tout au long du XXe siècle le socle de la production d’informations quantitatives fiables dans de nombreux domaines, de la statistique statistique La statistique ou science des données (Data Science en anglais) est un domaine des mathématiques qui étudie des phénomènes à travers la collecte de données, leur traitement, leur analyse, leur représentation graphique ou visualisation (Data Visualization en anglais) et l'interprétation des résultats. En savoir plus publique à l’épidémiologie en passant par l’économie et les sciences sociales. 

Leur force repose sur un cadre théorique rigoureux, permettant de produire des estimations non biaisées assorties d’une mesure de précision. Mais face à la demande croissante d’informations plus fréquentes, plus fines et plus granulaires, les approches reposant uniquement sur des échantillons montrent aujourd’hui certaines limites

Ces limites sont particulièrement manifestes dans la production de statistiques locales, où les estimations directes issues des enquêtes souffrent d’une variance variance La variance d'une distribution statistique est la moyenne des carrés des écarts entre les valeurs de la distribution et leur moyenne. La détermination d'un écart-type passe toujours par celle de la variance, dont il est la racine carrée. En savoir plus  élevée, voire deviennent inexploitables. Pour répondre à ces enjeux, de nombreux instituts statistiques, entreprises et organismes de recherche, ont développé des approches hybrides, combinant données d’enquêtes, sources administratives, données de recensement recensement Technique de recueil d'informations s'appliquant à la totalité d'une population, par opposition au sondage, qui ne s'applique par définition qu'à un échantillon. Le plus souvent, un recensement consiste en un dénombrement exhaustif, au cours duquel sont, de plus, posées quelques questions de nature socio-démographique. Exemple : le recensement national de la population par l'INSEE qui donne lieu à une publication de résultats tous les ans. En savoir plus ou données massives.

La mesure d’audience n’échappe pas à cette dynamique d’évolution profonde des méthodes : la fragmentation des usages et la multiplication des accès aux contenus met les instituts au défi de pallier les limites des approches par sondage sondage Méthode statistique qui vise à produire des informations sur une population en n’interrogeant qu’une partie de celle-ci (échantillon). Ce mot est généralement utilisé pour désigner une enquête menée auprès d'un échantillon, interrogé par questionnaire ou observé de façon systématique. En savoir plus en utilisant la profondeur de données massives aujourd’hui disponibles.

Image
Qu'est-ce que l'hybridation de données
Image
Pourquoi l'hybridation des données s'inscrit dans la théorie des sondages

Pourquoi l'hybridation des données s'inscrit dans la théorie des sondages ?

Si le terme « hybridation hybridation En statistique, approche consistant à mélanger deux sources d’informations de natures et de niveaux différents pour en créer une troisième plus riche ou plus fine. En savoir plus » est apparu assez récemment dans le contexte de la statistique statistique La statistique ou science des données (Data Science en anglais) est un domaine des mathématiques qui étudie des phénomènes à travers la collecte de données, leur traitement, leur analyse, leur représentation graphique ou visualisation (Data Visualization en anglais) et l'interprétation des résultats. En savoir plus , le concept est ancien et trouve son origine dans les travaux fondateurs de la théorie des sondages. Le principe est simple : lorsqu’on dispose d’une information auxiliaire, il faut chercher à l’utiliser.  Deville & Särndal ont formalisé le cadre des estimateurs par calage en sondage sondage Méthode statistique qui vise à produire des informations sur une population en n’interrogeant qu’une partie de celle-ci (échantillon). Ce mot est généralement utilisé pour désigner une enquête menée auprès d'un échantillon, interrogé par questionnaire ou observé de façon systématique. En savoir plus , dont l’objectif est d’améliorer l’estimation des totaux de population population Univers d'une enquête composé des unités statistiques de base. Ces unités peuvent être des personnes physiques, des foyers, des entreprises, des communes... La population sert de base de sondage pour le choix de l'échantillon, et de base de calcul pour les extrapolations de l'échantillon. En savoir plus en utilisant des informations auxiliaires connues. 

Les méthodes d’hybridation se sont sophistiquées avec la nature des données traitées et la puissance puissance Indicateur d'évaluation des supports dans le cadre d'un plan média. C'est la hiérarchisation des supports en fonction de leur audience utile. En savoir plus des outils capables de les traiter, mais la philosophie reste la même : utiliser plusieurs sources de données pour en créer une nouvelle plus fine ou plus riche.

La logique de la mesure hybride mesure hybride En statistique, approche consistant à mélanger deux sources d’informations de natures et de niveaux différents pour en créer une troisième plus riche ou plus fine. En savoir plus repose sur quatre grands principes fondamentaux.

- Complémentarité : aucune source ne suffit à elle seule. L’objectif est de combler les lacunes d’une source par les qualités d’une autre.

- Alignement temporel et structurel : pour combiner des données, il faut qu’elles soient alignées dans le temps (par exemple, sur la même période) et dans leurs définitions (unités de mesure comparables).

- Modélisation : l’hybridation passe par la construction d’un modèle statistique pour combiner les différentes sources de données.

- Gouvernance des sources : une mesure hybride suppose un cadre clair, et en particulier la plus grande transparence sur les données partagées.

Quelles sont les principales méthodes d'hybridation des sources de données ?

Il existe de nombreuses méthodes statistiques de rapprochement de données de sources différentes, voire des combinaisons de plusieurs méthodes statistiques. On peut distinguer quelques grandes familles répondant chacune à des besoins distincts. 

 

  1. Fusion statistique Fusion statistique La fusion statistique est une méthode utilisée afin de rapprocher des données provenant d'enquêtes différentes. Elle consiste à compléter un échantillon dit "receveur", où certaines informations ne sont pas présentes, à l'aide d'un échantillon dit "donneur" portant sur d'autres individus. Pour cela, les deux échantillons doivent disposer d'informations communes, appelées variables de pont. La fusion statistique est un cas particulier du traitement de la non-réponse. En savoir plus : rapprocher plusieurs bases de manière probabiliste probabiliste Le terme de donnée ou data probabiliste désigne un processus d'identification d'un individu qui se base sur un modèle probabiliste plutôt que sur un identifiant considéré comme "infaillible" grâce à son unicité. En savoir plus

Basée sur les techniques d’imputation, elle consiste à rapprocher plusieurs bases de données afin de créer un ensemble enrichi de données, cohérent et plus complet. Elle est utilisée lorsqu’aucune source ne contient l’ensemble des variables d’intérêt utiles et que les différentes sources de données ne peuvent pas être directement appariées à l’aide d’un identifiant commun.

L’objectif est de reconstituer une base de données similaire à ce que l’on aurait obtenu si toutes les variables avaient été collectées sur les mêmes individus. Le rapprochement des bases de données s’appuie sur la similarité des individus sur un ensemble de variables communes aux différentes bases : on définit une distance entre les individus des différentes bases et on les associe ensuite en fonction de leur similarité.

La fusion permet de limiter le fardeau de réponse* des panélistes ou interviewés et de reconstituer une base de données complète similaire aux données d’origine et donc facilement exploitable dans des outils de restitution classiques. En revanche, les variables spécifiques à chaque base de données ne sont jamais observées conjointement. La qualité de la fusion repose donc fortement sur le pouvoir explicatif des variables communes sur les variables spécifiques. En l’absence de variables communes pertinentes, la fusion sera proche de l’aléatoire.


*Le fardeau de réponse (response burden en anglais) désigne la charge (temps, effort de mémoire, complexité…) imposée aux répondants à une enquête enquête Dispositif de recueil d'informations. On distingue les enquêtes téléphoniques, postales, en face-à-face, en ligne. Bien qu'ayant un sens plus large, le terme d'étude est souvent utilisé comme synonyme. En savoir plus . C’est un concept central en méthodologie d’enquête car il influence directement la qualité de la participation et la fiabilité des réponses.

 

Image
fusion-statistique.

 2. Calage  : améliorer la précision d’un échantillon à partir d’une source exhaustive

Cette approche est utilisée lorsqu’on dispose d’une source de données issue d’un échantillon ou d’un panel et d’une autre source de mesure exhaustive. Dans ce cas, on veut utiliser l’information issue de la mesure exhaustive, qui correspond à un total connu sur l’ensemble de la population , pour améliorer la précision statistique , réduire la variabilité des résultats ou corriger un biais de sélection sur l’échantillon ou le panel. L’approche consiste à introduire des contraintes de calage supplémentaires dans le redressement de l’échantillon ou du panel.

Le calage assure la cohérence des deux sources de données sans avoir à en modifier la structure. Par ailleurs, il ne nécessite pas d’avoir accès à la donnée brute de la mesure exhaustive, d’une volumétrie souvent très importante, mais uniquement aux totaux sur les variables de calage. En revanche, les différentes sources de données doivent être parfaitement comparables, ce qui n’est pas toujours nativement le cas. Des pré-traitements peuvent donc être nécessaires pour mettre en cohérence les périmètres mesurés et les indicateurs calculés.

Image
calage

 3. Profiling : enrichir une mesure exhaustive grâce à un panel panel Échantillon pour lequel le recueil de l'information s'inscrit dans le temps. Il peut être interrogé plusieurs fois à intervalles réguliers. Cette méthode est pertinente pour l'étude des évolutions de comportement. L'échantillon peut être interrogé en continu : - soit, il est demandé à chaque individu du panel de remplir un questionnaire journalier relatif au sujet de l'étude. C'est le cas du panel Radio. - soit, l'information est enregistrée et restituée régulièrement. C'est le cas du panel Médiamat. Cette méthode est pertinente pour saisir les habitudes de comportement et leur évolution si la durée du panel est suffisamment longue. En savoir plus qualifié

Il est utilisé lorsqu’on dispose d’une source de données très qualifiée, généralement issue d’un échantillon ou d’un panel, et d’une autre source de mesure exhaustive et que l’on veut enrichir la mesure exhaustive à l’aide des informations, souvent très riches, issues de l’autre source. En effet, la donnée exhaustive permet d’observer des usages encore rares ou occasionnels qu’un échantillon ne peut mesurer avec précision.

L’approche consiste à construire un modèle statistique statistique La statistique ou science des données (Data Science en anglais) est un domaine des mathématiques qui étudie des phénomènes à travers la collecte de données, leur traitement, leur analyse, leur représentation graphique ou visualisation (Data Visualization en anglais) et l'interprétation des résultats. En savoir plus de qualification sur les données de l’échantillon ou du panel et de l’appliquer ensuite sur la donnée exhaustive pour l’enrichir.

Elle améliore la compréhension des usages émergents ou rares sans avoir à augmenter significativement la taille des échantillons. Cependant les données exhaustives étant généralement collectées en silo, les variables explicatives à disposition pour la modélisation sont relativement pauvres, ce qui limite la capacité d’un modèle à estimer des profils de manière fiable.

Image
calage

4. Génération de population population Univers d'une enquête composé des unités statistiques de base. Ces unités peuvent être des personnes physiques, des foyers, des entreprises, des communes... La population sert de base de sondage pour le choix de l'échantillon, et de base de calcul pour les extrapolations de l'échantillon. En savoir plus synthétique : créer socle pour rapprocher plusieurs sources

La génération de population synthétique n’est pas propre aux approches hybrides mais elle peut être utilisée comme étape préalable au rapprochement de différentes sources de données. Elle est particulièrement utile lorsqu’au moins une source de données provient d’une mesure exhaustive. Cette approche est utilisée à l’origine pour l’analyse spatiale à un niveau fin. Elle consiste à construire un ensemble exhaustif et représentatif de la population sur lequel peuvent être distribués des résultats d’enquêtes ou de panels et des data . Cette redistribution pourra faire appel à des méthodes déterministes lorsqu’un identifiant commun est disponible entre les différentes sources ou à des méthodes stochastiques ou probabilistes dans le cas contraire. Les techniques de fusion ou de qualification détaillées précédemment pourront s’appliquer sur une population synthétique, tout comme les techniques de probabilisation .

 

Ainsi, la génération de population synthétique permet de combiner différentes sources, même lorsqu’elles ne portent pas sur des univers strictement comparables, tout en facilitant la préservation des caractéristiques des données d’origine. Elle permet également d’envisager l’exploitation à grande échelle de données individuelles très fines, sans se heurter aux enjeux de confidentialité associés.

La qualité et la conformité de la population synthétique sont très dépendantes de la quantité et de la granularité des informations mises à disposition par les instituts nationaux de statistique statistique La statistique ou science des données (Data Science en anglais) est un domaine des mathématiques qui étudie des phénomènes à travers la collecte de données, leur traitement, leur analyse, leur représentation graphique ou visualisation (Data Visualization en anglais) et l'interprétation des résultats. En savoir plus . Ensuite, comme toute approche par modèle, la fiabilité des résultats dépend du pouvoir explicatif des variables communes sur les variables spécifiques.

Image
calage

En résumé

L’hybridation des sources de données consiste à combiner plusieurs sources complémentaires pour produire une mesure plus précise, plus riche ou plus robuste. Cette approche, dans la continuité des travaux fondateurs de la théorie des sondages, mobilise différentes méthodes statistiques pour répondre aux limites des mesures fondées sur une seule source, notamment dans un contexte de baisse des taux de réponse aux enquêtes et de fragmentation croissante des usages.