Cap sur 2035 · Consultation des agents Quelles propositions sont liées à votre sujet d'atelier ?
1227
Suggestions
799
Réponses
9
Thématiques
🔍
Répartition par thématique et atelier

Tous les verbatim

1Corpus et collecte

Les verbatim analysés dans ce dashboard sont issus d'une consultation ouverte à l'ensemble des agents du Service statistique public (SSP) dans le cadre du projet stratégique Cap sur 2035. Les agents étaient invités à exprimer librement leurs propositions d'ateliers thématiques via la question suivante :

Voici quelques exemples de questions qui pourraient être traitées dans des ateliers en petits groupes :

  • Les données de la statistique publique font autorité, mais n'arrivent-elles pas trop tard ? Comment être plus réactif ?
  • Comment nous préparer à l'introduction de l'IA dans nos activités régulières ?
  • Quels outils communs développer entre l'Insee et les SSM ?
  • Comment faciliter la réponse à nos enquêtes ?
  • Quel rôle doit jouer la statistique publique dans la lutte contre la désinformation ?
  • Comment répondre au besoin croissant de statistique locale ?
  • La statistique publique doit-elle collaborer davantage avec la recherche ?
  • Comment rendre nos statistiques plus faciles à comprendre et à utiliser sans les dénaturer ?
  • Comment être acteur de la transition écologique ?
  • Comment améliorer les parcours de carrière ?
  • Comment chacun peut-il contribuer pour être ambassadeur de la statistique publique ?

Quel(s) sujet(s) d'atelier aimeriez-vous à votre tour proposer ?

Le corpus comprend 920 réponses distinctes au 20 avril, caractérisées par le lieu de travail du répondant (Insee à la DG, en DR ou en SSM). Chaque réponse formule une ou plusieurs suggestions d'atelier.

2Construction itérative de la nomenclature et des ateliers

La nomenclature finale et les intitulés d'ateliers sont le résultat d'un processus en deux temps, chacun s'appuyant sur un passage complet de la chaîne de classification décrite en section 3.

Première analyse — nomenclature exploratoire

Une première nomenclature a été élaborée à partir des 320 premiers verbatim recueillis, par analyse automatisée par un modèle d'IA et relecture manuelle.

Une première passe de classification automatique a ensuite été menée sur l'intégralité des 920 verbatim dans cette nomenclature initiale. Le résultat a fourni à l'équipe de pilotage de Cap sur 2035 une grille d'analyse des thématiques portées par les agents, ainsi qu'un outil d'exploration des verbatims.

Affinage et nomenclature retenue

Cette première grille a été confrontée aux entretiens stratégiques conduits en parallèle avec les directions de l'Insee et les Services statistiques ministériels (SSM). De cette confrontation sont issus :

  • une nomenclature affinée : 9 thématiques et 69 ateliers
  • la rédaction des intitulés d'ateliers finalement retenus pour le brainstorming collectif

Une seconde passe de classification, selon la même chaîne en trois étapes (section 3), a alors été conduite dans cette nomenclature finale. C'est cette seconde classification qui est ici restituée, afin que chaque verbatim soit rattaché aux ateliers finalement retenus, pour en faciliter l'exploration.

3Pipeline de classification automatique

La même chaîne technique a été appliquée pour chacune des deux passes décrites en section 2. Elle s'articule autour de deux modèles indépendants :

A
Séparation des sous-questions et première classification
Chaque verbatim est d'abord soumis à un modèle de langage open source hébergé sur l'infrastructure SSP Cloud, qui réalise deux tâches successives :
  • Séparation des sous-questions — afin de rapprocher chaque réponse obtenue des questions retenues pour la consultation, le modèle peut reformuler une contribution en une ou plusieurs questions distinctes. Il s'agit le plus souvent d'un écart marginal à la formulation initiale, mais des erreurs sont possibles ; le texte original (parfois multi-questions) reste consultable sur chaque carte via le bouton « Texte original », lorsqu'il diffère du texte affiché.
  • Classification — pour chaque question issue de la reformulation, le modèle assigne une classe primaire (atelier principal) et jusqu'à trois classes secondaires à partir du descriptif de chaque atelier.
Le modèle utilisé pour cette étape a évolué entre les deux passes :
  • Première passe (nomenclature initiale) : gpt-oss-120b, modèle open-weight d'OpenAI
  • Seconde passe (restituée dans ce dashboard) : Gemma gemma4:26b, modèle open source de Google DeepMind — architecture Mixture-of-Experts à 26 milliards de paramètres dont 4 milliards activés par token (128 experts au total, 8 activés à la fois)
B
Mistral mistral-large-latest — seconde classification indépendante
La même nomenclature est soumise en parallèle à Mistral Large via l'API Mistral AI. Cette seconde classification, indépendante, sert à évaluer la robustesse des résultats (voir section 4).
C
Mistral mistral-large-latest — Filtres préalables
Les verbatim non signifiants ("ne sait pas", "/", "aucun", "RAS", etc.) ainsi que les très rares verbatims hors de propos ont été écartés avant cette restitution. À l'inverse, les réponses qui reprennent l'un des exemples proposés dans le questionnaire n'ont pas été écartées : la présence de ces exemples au moment de l'interrogation peut expliquer certaines redondances dans les verbatim affichés.

4Robustesse de la classification

La classification automatique peut comporter des erreurs. C'est précisément pour cela que deux modèles indépendants sont mobilisés pour la classification restituée ici : les cas de désaccord entre Gemma et Mistral signalent les classifications ambiguës, voire potentiellement erronées. Aucun travail manuel de relecture ou de correction n'a été entrepris ; les badges affichés sur chaque carte (IA convergente / IA divergente) traduisent uniquement la convergence ou non des deux modèles.

Le taux de convergence sur la classe primaire constitue ainsi un indicateur global de fiabilité : une convergence élevée sur un atelier signale une thématique clairement identifiable, tandis qu'une divergence fréquente peut indiquer une frontière sémantique floue entre deux ateliers proches.

 de classifications validées (convergence Gemma / Mistral)

5Limites et précautions

  • La classification automatique peut commettre des erreurs, notamment sur des verbatim courts, ambigus ou portant sur plusieurs thèmes simultanément.
  • La séparation préalable des sous-questions par le modèle peut introduire à la marge des écarts au texte original ; celui-ci reste systématiquement consultable sur chaque carte via le bouton « Texte original ».
  • Les verbatim sans rapport direct avec les thématiques d'atelier retenues sont regroupés dans la catégorie « Non classés ».
  • Pour chaque carte verbatim, un badge indique si Gemma et Mistral convergent sur la classe primaire (IA convergente) ou divergent (IA divergente). Les classes secondaires et le détail de la classification Mistral restent disponibles dans les données sources mais ne sont pas restituées pour simplifier la visualisation des données.