L'échantillonnage : théorie et pratique pour représenter une population
Un échantillon représentatif permet de refléter une population afin de produire des résultats fiables. Historiquement défini comme un modèle réduit de la population, il repose aujourd’hui sur un principe probabiliste : chaque individu doit avoir une probabilité connue d’être sélectionné. En pratique, deux grandes approches coexistent, les méthodes probabilistes, au cadre théorique solide, et les méthodes non probabilistes, dont la méthode des quotas, largement utilisées en France par les instituts de sondage privés sous réserve d’une mise en œuvre rigoureuse limitant les biais.
Pourquoi la notion d’échantillon représentatif a-t-elle évolué ?
La question question Interrogation posée à l'identique à toutes les personnes participant à une même enquête, dans le but d'obtenir des réponses de même nature. On distingue les questions fermées, dont les réponses sont à choisir parmi les modalités proposées (échelles, oui ou non, modalités d'une nomenclature, etc...), des questions ouvertes, pour lesquelles aucune modalité de réponse n'est proposée. Dans ce dernier cas, c'est la réponse spontanée des personnes interrogées qui est recueillie. En savoir plus de la représentativité est au cœur des sondages depuis la fin du XIXe siècle. Initialement, un échantillon était considéré comme représentatif représentatif Un échantillon est dit représentatif lorsqu'il provient d’un tirage représentatif, ce qui signifie que tous les individus de la population ont une probabilité non nulle d’être sélectionnés. La représentativité est une propriété d'un échantillon et non d'une unité de la population. Elle n’est pas synonyme d'échantillon proportionnel ou de "modèle réduit" de la population étudiée. On démontre en théorie des sondages, qu’une stratégie d’échantillonnage optimale consiste à organiser l’échantillon selon les variables les plus corrélées à l’objet de l’étude. En savoir plus lorsqu’il reproduisait fidèlement la structure de la population population Univers d'une enquête composé des unités statistiques de base. Ces unités peuvent être des personnes physiques, des foyers, des entreprises, des communes... La population sert de base de sondage pour le choix de l'échantillon, et de base de calcul pour les extrapolations de l'échantillon. En savoir plus , avec chaque catégorie présente dans les mêmes proportions. Cette vision reposait sur une logique intuitive : celle d’un modèle réduit.
Un tournant majeur intervient en 1934 avec Jerzy Neyman dans son article « On two different aspects of the representative method: the method of stratified sampling and the method of purposive sampling ». La représentativité n’est plus définie comme une ressemblance descriptive, mais comme une propriété du processus de sélection, fondée sur le calcul des probabilités, apportant ainsi aux sondages des fondements mathématiques rigoureux.
La définition de la représentativité devient alors : chaque unité de la population a une probabilité probabilité La probabilité d'un événement est un nombre réel compris entre 0 et 1 reflétant la chance que cet événement a de se réaliser. Un événement impossible a une probabilité égale à 0 ; un événement certain a une probabilité égale à 1. La théorie et le calcul des probabilités sont à la base de la statistique mathématique et des sondages. En savoir plus connue et non nulle d’être incluse dans l’échantillon.
Comment fonctionnent les méthodes probabilistes ?
Les méthodes probabilistes s’appuient sur la théorie des probabilités et offrent un cadre théorique pour la construction d’échantillon.
Elles supposent que l’on puisse déterminer, pour chaque individu, sa probabilité probabilité La probabilité d'un événement est un nombre réel compris entre 0 et 1 reflétant la chance que cet événement a de se réaliser. Un événement impossible a une probabilité égale à 0 ; un événement certain a une probabilité égale à 1. La théorie et le calcul des probabilités sont à la base de la statistique mathématique et des sondages. En savoir plus d’être sélectionné. Cela nécessite de disposer d’une base de sondage base de sondage Liste des individus ou unités statistiques composant une population au sein de laquelle on souhaite tirer un échantillon sur lequel sera recueillie l'information requise. Par exemple, l'ensemble des abonnés au téléphone peut constituer la base de sondage de certaines études. En savoir plus exhaustive ainsi que d’un plan de sondage sondage Méthode statistique qui vise à produire des informations sur une population en n’interrogeant qu’une partie de celle-ci (échantillon). Ce mot est généralement utilisé pour désigner une enquête menée auprès d'un échantillon, interrogé par questionnaire ou observé de façon systématique. En savoir plus , permettant de calculer pour chaque unité sa probabilité d’être sélectionnée dans l’échantillon.
Dans ce cadre, la validité des résultats repose sur une hypothèse forte : toutes les unités sélectionnées doivent répondre. Or, en pratique, la non-réponse est fréquente. Pour maintenir la validité théorique, il faut alors démontrer que cette non-réponse est aléatoire, c’est-à-dire qu’elle n’est pas liée aux variables étudiées. Si cette condition n’est pas remplie, l’absence de biais biais Le biais d'un résultat statistique est l'écart entre le résultat obtenu et la valeur exacte que l'on recherche. On distingue trois types de biais : biais d'échantillonnage (par exemple : utilisation d'une base de sondage inadaptée), biais d'observation (par exemple : mauvais libellé d'une question ou d'une grille de réponse), biais d'estimation (par exemple : mauvaise prise en compte des modalités de tirage de l'échantillon). En savoir plus ne peut plus être garantie.
Pourquoi les méthodes non probabilistes sont-elles utilisées ?
En l’absence de base de sondage base de sondage Liste des individus ou unités statistiques composant une population au sein de laquelle on souhaite tirer un échantillon sur lequel sera recueillie l'information requise. Par exemple, l'ensemble des abonnés au téléphone peut constituer la base de sondage de certaines études. En savoir plus exhaustive, les méthodes probabilistes deviennent impossibles à mettre en œuvre. Les méthodes non probabilistes constituent alors une alternative opérationnelle.
Elles reposent sur une approche empirique visant à se rapprocher d’une sélection aléatoire, même si aucune probabilité probabilité La probabilité d'un événement est un nombre réel compris entre 0 et 1 reflétant la chance que cet événement a de se réaliser. Un événement impossible a une probabilité égale à 0 ; un événement certain a une probabilité égale à 1. La théorie et le calcul des probabilités sont à la base de la statistique mathématique et des sondages. En savoir plus de sélection n’est formellement définie. Dans ce contexte, le rôle de l’enquêteur devient central : il applique des consignes précises pour limiter les biais biais Le biais d'un résultat statistique est l'écart entre le résultat obtenu et la valeur exacte que l'on recherche. On distingue trois types de biais : biais d'échantillonnage (par exemple : utilisation d'une base de sondage inadaptée), biais d'observation (par exemple : mauvais libellé d'une question ou d'une grille de réponse), biais d'estimation (par exemple : mauvaise prise en compte des modalités de tirage de l'échantillon). En savoir plus de sélection.
Ces méthodes présentent des avantages pratiques importants. Elles sont plus simples à déployer, moins coûteuses et permettent d’obtenir rapidement un échantillon. En revanche, elles ne garantissent pas, en théorie, que chaque individu ait une probabilité non nulle et connue d’être sélectionné.
Leur validité repose donc largement sur la rigueur du processus mis en œuvre, notamment à travers la multiplication des tentatives de contacts, la neutralité de l’accroche et plus généralement la capacité à éviter les biais de sélection des individus.
La méthode des quotas : une approche opérationnelle de la représentativité
La méthode des quotas méthode des quotas Méthode d'échantillonnage qui consiste en une sélection "raisonnée" de l’échantillon selon les caractéristiques (sexe, âge, région, etc...) des unités interrogées de manière à respecter une structure prédéfinie. En savoir plus est la méthode non probabiliste probabiliste Le terme de donnée ou data probabiliste désigne un processus d'identification d'un individu qui se base sur un modèle probabiliste plutôt que sur un identifiant considéré comme "infaillible" grâce à son unicité. En savoir plus la plus utilisée en France par les instituts de sondage sondage Méthode statistique qui vise à produire des informations sur une population en n’interrogeant qu’une partie de celle-ci (échantillon). Ce mot est généralement utilisé pour désigner une enquête menée auprès d'un échantillon, interrogé par questionnaire ou observé de façon systématique. En savoir plus privés.
Son principe consiste à reproduire la structure de la population population Univers d'une enquête composé des unités statistiques de base. Ces unités peuvent être des personnes physiques, des foyers, des entreprises, des communes... La population sert de base de sondage pour le choix de l'échantillon, et de base de calcul pour les extrapolations de l'échantillon. En savoir plus de référence de l’enquête sur certains critères (souvent socio-démographiques et géographiques). L’échantillon est ainsi construit pour refléter des proportions connues, par exemple la répartition répartition Terme utilisé dans le sens de distribution d'une variable ; on parle aussi de structure. En statistique, la fonction de répartition d'une variable quantitative donne pour chaque valeur x de cette variable la proportion d'individus pour lesquels la valeur de la variable est inférieure ou égale à x. En savoir plus hommes/femmes.
Cette approche ne permet toutefois pas de définir une probabilité probabilité La probabilité d'un événement est un nombre réel compris entre 0 et 1 reflétant la chance que cet événement a de se réaliser. Un événement impossible a une probabilité égale à 0 ; un événement certain a une probabilité égale à 1. La théorie et le calcul des probabilités sont à la base de la statistique mathématique et des sondages. En savoir plus de sélection pour chaque individu. Le plan de sondage étant inconnu, elle ne s’inscrit pas dans le cadre théorique probabiliste.
Malgré cela, cette méthode repose sur des fondements solides. Si les critères de quotas expliquent correctement les variables étudiées, les estimations peuvent être efficaces, c’est-à-dire avec un biais biais Le biais d'un résultat statistique est l'écart entre le résultat obtenu et la valeur exacte que l'on recherche. On distingue trois types de biais : biais d'échantillonnage (par exemple : utilisation d'une base de sondage inadaptée), biais d'observation (par exemple : mauvais libellé d'une question ou d'une grille de réponse), biais d'estimation (par exemple : mauvaise prise en compte des modalités de tirage de l'échantillon). En savoir plus limité. Par ailleurs, cette méthode permet d’intégrer des informations auxiliaires utiles dès la phase de construction de l’échantillon.
En général, une enquête enquête Dispositif de recueil d'informations. On distingue les enquêtes téléphoniques, postales, en face-à-face, en ligne. Bien qu'ayant un sens plus large, le terme d'étude est souvent utilisé comme synonyme. En savoir plus par quotas produit des résultats plus précis qu’une enquête probabiliste, au sens d’une variance variance La variance d'une distribution statistique est la moyenne des carrés des écarts entre les valeurs de la distribution et leur moyenne. La détermination d'un écart-type passe toujours par celle de la variance, dont il est la racine carrée. En savoir plus plus faible. C’est pourquoi, pour de petits échantillons (jusqu’à 1 000 ou 2 000 personnes interrogées), on considère souvent que la méthode des quotas offre le meilleur compromis entre biais et variance.
Mais la méthode des quotas n’est efficace que si elle est appliquée avec rigueur.
Pour cela, il faut choisir des quotas adaptés au sujet de l’enquête, sélectionner les personnes de la manière la plus proche possible de l’aléatoire, et veiller à interroger des individus issus de l’ensemble de la population.
Sinon, l’échantillon peut être affecté par un biais de sélection, car certaines catégories de personnes risquent d’être sur- ou sous-représentées, voire absentes. Ce risque existe aussi dans les enquêtes probabilistes, mais il y est généralement mieux contrôlé grâce au tirage aléatoire.
À retenir sur les échantillons représentatifs et la méthode des quotas
En dehors de la statistique statistique La statistique ou science des données (Data Science en anglais) est un domaine des mathématiques qui étudie des phénomènes à travers la collecte de données, leur traitement, leur analyse, leur représentation graphique ou visualisation (Data Visualization en anglais) et l'interprétation des résultats. En savoir plus publique, les instituts ont souvent recours à des méthodes non probabilistes, notamment la méthode des quotas méthode des quotas Méthode d'échantillonnage qui consiste en une sélection "raisonnée" de l’échantillon selon les caractéristiques (sexe, âge, région, etc...) des unités interrogées de manière à respecter une structure prédéfinie. En savoir plus . Même si ces approches ne relèvent pas du cadre théorique des sondages probabilistes, elles peuvent produire des résultats fiables lorsque les critères de quotas sont pertinents, que le terrain terrain Ensemble des opérations organisant le travail des enquêteurs : descriptif des personnes à interroger, instructions pour le choix des interviewés, quotas, passation du questionnaire, contrôles de qualité, etc. On appelle " terrain téléphonique " l'ensemble du dispositif physique (salles, micro-ordinateurs, téléphones...) propre aux enquêtes par téléphone, et l'organisation qui s'y rapporte. En savoir plus est rigoureux et que les biais biais Le biais d'un résultat statistique est l'écart entre le résultat obtenu et la valeur exacte que l'on recherche. On distingue trois types de biais : biais d'échantillonnage (par exemple : utilisation d'une base de sondage inadaptée), biais d'observation (par exemple : mauvais libellé d'une question ou d'une grille de réponse), biais d'estimation (par exemple : mauvaise prise en compte des modalités de tirage de l'échantillon). En savoir plus de sélection sont maîtrisés.