Redressement d’échantillon : principe et méthodes
Le redressement d’échantillon consiste à corriger les déformations de l’échantillon pour rapprocher sa structure de celle de la population étudiée. À travers le calage sur marges ou des algorithmes comme CALMAR et Ridge, il contribue à limiter les biais, renforcer la précision statistique et fiabiliser les indicateurs issus des enquêtes.
Qu'est-ce qu'un échantillon représentatif ?
Un sondage sondage Méthode statistique qui vise à produire des informations sur une population en n’interrogeant qu’une partie de celle-ci (échantillon). Ce mot est généralement utilisé pour désigner une enquête menée auprès d'un échantillon, interrogé par questionnaire ou observé de façon systématique. En savoir plus n’est pas un recensement recensement Technique de recueil d'informations s'appliquant à la totalité d'une population, par opposition au sondage, qui ne s'applique par définition qu'à un échantillon. Le plus souvent, un recensement consiste en un dénombrement exhaustif, au cours duquel sont, de plus, posées quelques questions de nature socio-démographique. Exemple : le recensement national de la population par l'INSEE qui donne lieu à une publication de résultats tous les ans. En savoir plus . Le sondage est une méthode qui consiste à interroger une partie de la population population Univers d'une enquête composé des unités statistiques de base. Ces unités peuvent être des personnes physiques, des foyers, des entreprises, des communes... La population sert de base de sondage pour le choix de l'échantillon, et de base de calcul pour les extrapolations de l'échantillon. En savoir plus – un échantillon - et à l’analyser afin d’extrapoler les résultats de l’échantillon à l’ensemble de la population. Toutes les enquêtes par sondage sont sujettes à différents types d’erreur, dont la principale est l’erreur d’échantillonnage. Celle-ci est due à l’aléa du tirage de l’échantillon.
Pour maîtriser l’erreur d’échantillonnage et améliorer la précision des résultats de l’enquête, on utilise des informations auxiliaires. Il s’agit d’informations recueillies dans l’enquête et dont on connaît les valeurs dans la totalité de la population. Ces informations peuvent intervenir à plusieurs niveaux : lors de la conception du plan de sondage avec la stratification ou les quotas, ou lors du traitement avec le redressement redressement Traitement statistique dont le but est de corriger les écarts de structure, sur une ou plusieurs variables, entre l'échantillon et l'ensemble de la population étudiée (strucure connue par exemple par un recensement ou une étude de cadrage). Ce traitement consiste à calculer pour chaque individu enquêté un coefficient, dit de redressement, qui se conjugue à l'extrapolation pour donner son poids et ainsi faire coïncider la structure pondérée de l'échantillon avec celle de la population. En savoir plus .
Pourquoi le redressement d'échantillon est-il indispensable ?
Un échantillon ne peut pas être une copie conforme de la population population Univers d'une enquête composé des unités statistiques de base. Ces unités peuvent être des personnes physiques, des foyers, des entreprises, des communes... La population sert de base de sondage pour le choix de l'échantillon, et de base de calcul pour les extrapolations de l'échantillon. En savoir plus étudiée. Si l'on publie les résultats « bruts », on obtient une image déformée de la réalité.
Le redressement redressement Traitement statistique dont le but est de corriger les écarts de structure, sur une ou plusieurs variables, entre l'échantillon et l'ensemble de la population étudiée (strucure connue par exemple par un recensement ou une étude de cadrage). Ce traitement consiste à calculer pour chaque individu enquêté un coefficient, dit de redressement, qui se conjugue à l'extrapolation pour donner son poids et ainsi faire coïncider la structure pondérée de l'échantillon avec celle de la population. En savoir plus (ou calage) consiste à corriger a posteriori les déformations de l’échantillon sur un certain nombre de critères, en attribuant à chaque répondant un poids poids 1. Proportion d'une catégorie d'individus par rapport à la totalité de la population. Par exemple, au 1er janvier 2020, le poids des femmes est de 51,7% de la population des ménages. 2. Le poids de sondage désigne le coefficient affecté à chaque individu de l'échantillon et qui représente l'inverse de sa probabilité d'appartenir à l'échantillon. Par exemple, pour un échantillon de 20 000 individus tirés aléatoirement au sein d'une population de 40 millions d'individus, le poids de sondage est de 2 000. 3. Le poids de redressement désigne le coefficient affecté à chaque individu après redressement de l'échantillon et qui correspond au nombre d'individus que cet individu de l'échantilllon représente dans la population. En savoir plus qui reflète ce qu'il représente dans la population. Concrètement, un individu appartenant à une catégorie sous-représentée recevra un poids supérieur à 1 (sa réponse « comptera davantage »), et inversement pour une catégorie surreprésentée.
L'enjeu est double :
- Fiabilité : garantir que les indicateurs publiés ne sont pas biaisés du fait de la structure de l'échantillon.
- Précision : un redressement sur des critères corrélés aux variables d'intérêt réduit la variance variance La variance d'une distribution statistique est la moyenne des carrés des écarts entre les valeurs de la distribution et leur moyenne. La détermination d'un écart-type passe toujours par celle de la variance, dont il est la racine carrée. En savoir plus des estimations et améliore la précision des résultats.
Principe du redressement d'échantillon : comment sont calculés les poids ?
On dispose d'informations fiables sur la population population Univers d'une enquête composé des unités statistiques de base. Ces unités peuvent être des personnes physiques, des foyers, des entreprises, des communes... La population sert de base de sondage pour le choix de l'échantillon, et de base de calcul pour les extrapolations de l'échantillon. En savoir plus , par exemple les données de l'Insee pour les critères socio-démographiques. L'objectif est de faire en sorte que la structure de l'échantillon un fois pondéré coïncide avec ces données de cadrage sur chaque critère critère Objet informatique ou statistique regroupant une même information pour tous les individus de la population de l'étude. La variable ÂGE va par exemple représenter l'âge de tous les individus de la population étudiée. Les variables peuvent être qualitatives (par exemple le SEXE ou la CSP) ou quantitative (comme l'ÂGE ou la TAILLE). En savoir plus retenu.
Cas simple : un seul critère
Si l'on souhaite redresser l’échantillon sur un seul critère, le genre par exemple, alors il s’agit d’une simple règle de trois. Par exemple, si les femmes représentent 52 % de la population mais seulement 40 % de l'échantillon, chaque femme reçoit un poids poids 1. Proportion d'une catégorie d'individus par rapport à la totalité de la population. Par exemple, au 1er janvier 2020, le poids des femmes est de 51,7% de la population des ménages. 2. Le poids de sondage désigne le coefficient affecté à chaque individu de l'échantillon et qui représente l'inverse de sa probabilité d'appartenir à l'échantillon. Par exemple, pour un échantillon de 20 000 individus tirés aléatoirement au sein d'une population de 40 millions d'individus, le poids de sondage est de 2 000. 3. Le poids de redressement désigne le coefficient affecté à chaque individu après redressement de l'échantillon et qui correspond au nombre d'individus que cet individu de l'échantilllon représente dans la population. En savoir plus de 52/40 = 1,30 et chaque homme un poids de 48/60 = 0,80.
Cas classique : plusieurs critères - le calage sur marges
En pratique, on redresse simultanément sur plusieurs critères (sexe, âge, CSP CSP La CSP (catégorie socioprofessionnelle), remplacée en 1982 par la nomenclature des professions et catégories socioprofessionnelles (PCS), est une nomenclature définie par l'Insee qui permet de classer la population selon une synthèse de la profession (ou de l'ancienne profession), de la position hiérarchique et du statut (salarié ou non). En savoir plus , région région Découpage géographique. La France métropolitaine est organisée administrativement en 13 régions (régions INSEE - anciennement 22). En savoir plus , type d'habitat…). On ne connaît en général que les distributions marginales sans disposer de la totalité des distributions croisées. La méthode du calage sur marges consiste alors à trouver des poids qui respectent toutes ces marges à la fois, tout en restant aussi proches que possible des poids initiaux.
Il s’agit d’un problème d'optimisation sous contraintes : on minimise une fonction de distance entre les poids de sondage sondage Méthode statistique qui vise à produire des informations sur une population en n’interrogeant qu’une partie de celle-ci (échantillon). Ce mot est généralement utilisé pour désigner une enquête menée auprès d'un échantillon, interrogé par questionnaire ou observé de façon systématique. En savoir plus et les poids de calage, sous la contrainte que les marges soient exactement respectées.
Quelles sont les principales méthodes de redressement d’échantillon ?
La méthode itérative RAS : ajuster progressivement les poids poids 1. Proportion d'une catégorie d'individus par rapport à la totalité de la population. Par exemple, au 1er janvier 2020, le poids des femmes est de 51,7% de la population des ménages. 2. Le poids de sondage désigne le coefficient affecté à chaque individu de l'échantillon et qui représente l'inverse de sa probabilité d'appartenir à l'échantillon. Par exemple, pour un échantillon de 20 000 individus tirés aléatoirement au sein d'une population de 40 millions d'individus, le poids de sondage est de 2 000. 3. Le poids de redressement désigne le coefficient affecté à chaque individu après redressement de l'échantillon et qui correspond au nombre d'individus que cet individu de l'échantilllon représente dans la population. En savoir plus de l’échantillon
La méthode la plus intuitive est le RAS (Raking Adjustment System ou iterative proportional fitting). Le principe est simple :
1. On ajuste d'abord les poids pour que la marge du premier critère critère Objet informatique ou statistique regroupant une même information pour tous les individus de la population de l'étude. La variable ÂGE va par exemple représenter l'âge de tous les individus de la population étudiée. Les variables peuvent être qualitatives (par exemple le SEXE ou la CSP) ou quantitative (comme l'ÂGE ou la TAILLE). En savoir plus (par exemple le sexe) soit exacte.
2. Puis on réajuste pour que la marge du deuxième critère (l'âge) soit respectée — ce qui peut légèrement déformer la première marge.
3. On recommence sur le premier critère, et ainsi de suite, en boucle.
À chaque passage, les poids sont multipliés par le rapport entre la marge théorique et la marge estimée dans l'échantillon pondéré :
où Mj est le total de population population Univers d'une enquête composé des unités statistiques de base. Ces unités peuvent être des personnes physiques, des foyers, des entreprises, des communes... La population sert de base de sondage pour le choix de l'échantillon, et de base de calcul pour les extrapolations de l'échantillon. En savoir plus dans la catégorie j et le dénominateur est le total pondéré courant dans cette catégorie.
L'algorithme converge généralement en quelques itérations. Sa fonction de distance sous-jacente est G(x)=xlog(x)-x+1, ce qui garantit des poids poids 1. Proportion d'une catégorie d'individus par rapport à la totalité de la population. Par exemple, au 1er janvier 2020, le poids des femmes est de 51,7% de la population des ménages. 2. Le poids de sondage désigne le coefficient affecté à chaque individu de l'échantillon et qui représente l'inverse de sa probabilité d'appartenir à l'échantillon. Par exemple, pour un échantillon de 20 000 individus tirés aléatoirement au sein d'une population de 40 millions d'individus, le poids de sondage est de 2 000. 3. Le poids de redressement désigne le coefficient affecté à chaque individu après redressement de l'échantillon et qui correspond au nombre d'individus que cet individu de l'échantilllon représente dans la population. En savoir plus strictement positifs. En revanche, il peut produire des poids très élevés si les écarts entre l'échantillon et la population population Univers d'une enquête composé des unités statistiques de base. Ces unités peuvent être des personnes physiques, des foyers, des entreprises, des communes... La population sert de base de sondage pour le choix de l'échantillon, et de base de calcul pour les extrapolations de l'échantillon. En savoir plus sont importants.
La macro CALMAR de l'INSEE, une méthode de référence pour le calage sur marges
Développée par l'Insee, la macro CALMAR (CALage sur MARges) formalise le calage comme un problème d'optimisation : trouver les poids poids 1. Proportion d'une catégorie d'individus par rapport à la totalité de la population. Par exemple, au 1er janvier 2020, le poids des femmes est de 51,7% de la population des ménages. 2. Le poids de sondage désigne le coefficient affecté à chaque individu de l'échantillon et qui représente l'inverse de sa probabilité d'appartenir à l'échantillon. Par exemple, pour un échantillon de 20 000 individus tirés aléatoirement au sein d'une population de 40 millions d'individus, le poids de sondage est de 2 000. 3. Le poids de redressement désigne le coefficient affecté à chaque individu après redressement de l'échantillon et qui correspond au nombre d'individus que cet individu de l'échantilllon représente dans la population. En savoir plus wkminimisant une fonction de distance G par rapport aux poids de sondage sondage Méthode statistique qui vise à produire des informations sur une population en n’interrogeant qu’une partie de celle-ci (échantillon). Ce mot est généralement utilisé pour désigner une enquête menée auprès d'un échantillon, interrogé par questionnaire ou observé de façon systématique. En savoir plus dk, sous les contraintes de calage :
Le système est résolu par l'algorithme de Newton. La macro CALMAR propose cinq fonctions de distance asymptotiquement équivalentes : le choix entre elles est en pratique guidé par l'allure de la distribution des poids poids 1. Proportion d'une catégorie d'individus par rapport à la totalité de la population. Par exemple, au 1er janvier 2020, le poids des femmes est de 51,7% de la population des ménages. 2. Le poids de sondage désigne le coefficient affecté à chaque individu de l'échantillon et qui représente l'inverse de sa probabilité d'appartenir à l'échantillon. Par exemple, pour un échantillon de 20 000 individus tirés aléatoirement au sein d'une population de 40 millions d'individus, le poids de sondage est de 2 000. 3. Le poids de redressement désigne le coefficient affecté à chaque individu après redressement de l'échantillon et qui correspond au nombre d'individus que cet individu de l'échantilllon représente dans la population. En savoir plus et par la volonté d'éviter des valeurs extrêmes.
L'approche Ridge : une méthode plus souple quand les critères sont nombreux
Lorsque les critères de calage sont nombreux ou partiellement colinéaires, le système d'équations peut devenir instable ou ne pas converger. L'approche Ridge (ou régularisation L2) offre une solution en ajoutant un terme de pénalisation à la matrice du système.
Dans le cadre du calage, au lieu de résoudre β^ = (X' X)-1 X' Y, on résout :
β^ridge = (X' X + λI)-1 X' Y
Le paramètre λ>0 régularise la matrice X' X en la rendant mieux conditionnée : les valeurs proches de zéro sont « relevées », ce qui stabilise l'inversion. Le prix à payer est un léger
biais
biais
Le biais d'un résultat statistique est l'écart entre le résultat obtenu et la valeur exacte que l'on recherche. On distingue trois types de biais : biais d'échantillonnage (par exemple : utilisation d'une base de sondage inadaptée), biais d'observation (par exemple : mauvais libellé d'une question ou d'une grille de réponse), biais d'estimation (par exemple : mauvaise prise en compte des modalités de tirage de l'échantillon).
En savoir plus
sur les coefficients, compensé par une réduction substantielle de la
variance
variance
La variance d'une distribution statistique est la moyenne des carrés des écarts entre les valeurs de la distribution et leur moyenne. La détermination d'un écart-type passe toujours par celle de la variance, dont il est la racine carrée.
En savoir plus
.
En pratique, cette approche est utile lorsque :
Le nombre de critères de calage est élevé par rapport à la
taille de l'échantillon
taille de l'échantillon
Nombre d'unités statistiques constituant un échantillon. La précision d'un sondage dépend grandement de la taille de l'échantillon.
En savoir plus
;
Les informations auxiliaires sont elles-mêmes issues d’enquêtes et sujettes à des marges d’erreur ;
On souhaite un calage « souple » qui ne respecte pas exactement les marges mais produit des poids plus stables.
À retenir sur le redressement d’échantillon
Le redressement redressement Traitement statistique dont le but est de corriger les écarts de structure, sur une ou plusieurs variables, entre l'échantillon et l'ensemble de la population étudiée (strucure connue par exemple par un recensement ou une étude de cadrage). Ce traitement consiste à calculer pour chaque individu enquêté un coefficient, dit de redressement, qui se conjugue à l'extrapolation pour donner son poids et ainsi faire coïncider la structure pondérée de l'échantillon avec celle de la population. En savoir plus n'est pas une opération cosmétique : bien conduit, il améliore significativement la précision des estimations. Le choix de la méthode dépend du contexte, du nombre de critères, de la qualité des données de cadrage et des contraintes opérationnelles.