Les verbatim analysés dans ce dashboard sont issus d'une consultation ouverte à l'ensemble des agents du Service statistique public (SSP) dans le cadre du projet stratégique Cap sur 2035. Les agents étaient invités à exprimer librement leurs propositions d'ateliers thématiques via la question suivante :
Voici quelques exemples de questions qui pourraient être traitées dans des ateliers en petits groupes :
Quel(s) sujet(s) d'atelier aimeriez-vous à votre tour proposer ?
Le corpus comprend 920 réponses distinctes au 20 avril, caractérisées par le lieu de travail du répondant (Insee à la DG, en DR ou en SSM). Chaque réponse formule une ou plusieurs suggestions d'atelier.
La nomenclature finale et les intitulés d'ateliers sont le résultat d'un processus en deux temps, chacun s'appuyant sur un passage complet de la chaîne de classification décrite en section 3.
Une première nomenclature a été élaborée à partir des 320 premiers verbatim recueillis, par analyse automatisée par un modèle d'IA et relecture manuelle.
Une première passe de classification automatique a ensuite été menée sur l'intégralité des 920 verbatim dans cette nomenclature initiale. Le résultat a fourni à l'équipe de pilotage de Cap sur 2035 une grille d'analyse des thématiques portées par les agents, ainsi qu'un outil d'exploration des verbatims.
Cette première grille a été confrontée aux entretiens stratégiques conduits en parallèle avec les directions de l'Insee et les Services statistiques ministériels (SSM). De cette confrontation sont issus :
Une seconde passe de classification, selon la même chaîne en trois étapes (section 3), a alors été conduite dans cette nomenclature finale. C'est cette seconde classification qui est ici restituée, afin que chaque verbatim soit rattaché aux ateliers finalement retenus, pour en faciliter l'exploration.
La même chaîne technique a été appliquée pour chacune des deux passes décrites en section 2. Elle s'articule autour de deux modèles indépendants :
La classification automatique peut comporter des erreurs. C'est précisément pour cela que deux modèles indépendants sont mobilisés pour la classification restituée ici : les cas de désaccord entre Gemma et Mistral signalent les classifications ambiguës, voire potentiellement erronées. Aucun travail manuel de relecture ou de correction n'a été entrepris ; les badges affichés sur chaque carte (IA convergente / IA divergente) traduisent uniquement la convergence ou non des deux modèles.
Le taux de convergence sur la classe primaire constitue ainsi un indicateur global de fiabilité : une convergence élevée sur un atelier signale une thématique clairement identifiable, tandis qu'une divergence fréquente peut indiquer une frontière sémantique floue entre deux ateliers proches.