Données d'entraînement multilingues pour un chatbot de services aux citoyens dans un programme d'IA gouvernemental
Une initiative de services numériques du secteur public avait besoin de données d'entraînement dans plusieurs langues locales pour lancer un chatbot de services aux citoyens capable de répondre aux questions courantes sur les services publics dans les langues réellement parlées par les habitants.
Client snapshot
| Industry | Services numériques de l'administration et du secteur public |
|---|---|
| Region | Afrique de l'Ouest |
| Engagement type | Collecte et évaluation de données d'entraînement conversationnelles multilingues |
The challenge
Le prototype de chatbot existant du programme ne fonctionnait qu'en anglais, ce qui excluait une grande part de la population qu'il devait servir, et aucun fournisseur existant ne pouvait démontrer une véritable couverture de locuteurs natifs dans les langues locales requises au volume nécessaire.
The approach
Jwuma a recruté des contributeurs locuteurs natifs des langues locales requises pour produire des exemples représentatifs de requêtes de citoyens et évaluer l'exactitude et la pertinence des réponses du chatbot dans chaque langue, avec une remontée de revue pour les jugements contestés ou ambigus sur la qualité des réponses.
Results
Le programme a étendu la couverture linguistique fonctionnelle de son chatbot aux langues locales les plus couramment parlées par la population qu'il servait, élargissant sensiblement le nombre de personnes pouvant utiliser le service dans leur propre langue.
Frequently asked questions
Pourquoi les services d'IA du secteur public ont-ils spécifiquement besoin de données d'entraînement en langue maternelle ?
Parce que les chatbots de services aux citoyens qui ne fonctionnent que dans la langue officielle ou administrative d'un pays excluent de larges pans de la population qui parlent au quotidien d'autres langues locales.
Comment Jwuma trouve-t-elle des locuteurs natifs pour des langues moins souvent prises en charge ?
Par un recrutement de contributeurs vérifiés directement dans les régions où ces langues sont parlées, plutôt que par le recours à des intermédiaires bilingues.
Cette approche peut-elle s'étendre à d'autres langues à mesure qu'un programme se développe ?
Oui, à condition que des réseaux de contributeurs locuteurs natifs existent ou puissent être constitués pour les langues cibles supplémentaires.
Related case studies
Données de vérification faciale et d'identité pour une plateforme mondiale de mobilité
Une plateforme mondiale de mobilité et de VTC avait besoin de données faciales et d'identité vérifiées dans plusieurs régions pour renforcer un système de vérification de sécurité des conducteurs et des passagers, dans le respect d'exigences strictes de consentement et de traitement des données biométriques.
Collecte de données vidéo égocentriques pour un programme d'IA en robotique
Une entreprise d'IA en robotique avait besoin de vidéos à la première personne d'humains exécutant des tâches physiques quotidiennes, captées de façon cohérente dans des environnements et des morphologies variés, pour entraîner un modèle d'IA incarnée à généraliser au-delà d'un seul cadre de laboratoire.
Évaluation RLHF pour un modèle d'IA conversationnelle
Une entreprise d'IA conversationnelle avait besoin d'un pipeline d'évaluation humaine structuré et évolutif pour noter la qualité des réponses de son chatbot dans son processus d'affinage RLHF, après que son groupe d'évaluateurs ad hoc eut produit des notations incohérentes.
Published 2026-10-02 by Jwuma, operated by Corpshore AI. This case study is an anonymized composite representative of the kind of work Jwuma performs in this industry, described by industry, region and engagement type rather than by company name, since this engagement is not yet cleared for public naming. Discuss a similar program at client.corpshore.ai.