L’IA multilingue ne passera pas à l’échelle sans une redistribution du pouvoir
Current AI et le Programme des Nations Unies pour le développement (PNUD) publient en collaboration une nouvelle note d'orientation intitulée Présentation de la chaîne de valeur des données à l'IA : promouvoir la diversité linguistique et culturelle pour la diffusion de l'IA. Cette note se penche sur la question suivante : pourquoi tant d’efforts visant à développer l’IA pour des langues locales prennent fin avant d'aboutir à la création d'outils utilisables par le public ? Elle présente également ce que les gouvernements et institutions peuvent mettre en place afin de transformer des travaux prometteurs en services utilisés par le plus grand nombre.
Cette analyse tire ses enseignements de deux années d'activité du programme Local Language Accelerator («accélérateur de langues locales ») du PNUD dans 11 pays, des AI Landscape Assessments (« évaluations du paysage de l'IA ») menées par le PNUD dans 26 pays, ainsi que du financement par Current AI de projets de préservation culturelle en Afrique, en Amérique latine et au Moyen-Orient. La conclusion principale de la note est que la seule collecte de données linguistiques n’est pas suffisante pour aboutir à une IA que les communautés peuvent utiliser, façonner et pérenniser. La Chaîne de valeur des données à l’IA du PNUD détaille les étapes nécessaires pour atteindre ces objectifs, de la collecte des données à leur déploiement et à leur réutilisation. Les gouvernements et les bailleurs de fonds doivent soutenir l’ensemble du processus, tandis que les communautés contribuent à déterminer ce qui est construit, gardent le contrôle sur l’utilisation de leurs connaissances et participent à la valeur créée.
Le fossé linguistique ne cesse de se creuser
La recherche et le financement de l’IA se concentrent sur des langues qui bénéficient déjà d’importants ensembles de données numériques et de nombreux modèles. Ces travaux génèrent encore plus de données et de modèles pour les mêmes langues, creusant ainsi le fossé avec les langues qui reçoivent de faibles investissements. L’anglais gagne jusqu’à 50 000 nouveaux modèles par an, tandis que des langues telles que le swahili congolais, le wolaytta, le kwangali et le kuanyama n’en gagnent que 4,15 par an en moyenne.
À Kisumu, au Kenya, la propriétaire d’une petite entreprise ne peut pas accéder à un outil de demande de prêt ou de service client en dholuo, car personne n’en a construit un. La technologie existe, mais le modèle commercial dominant n’incite pas les entreprises à la développer. Les services d’IA divisent le texte en unités appelées jetons, et un mot qui compte pour un jeton en anglais peut en compter pour quatre ou cinq en dholuo. Comme les prestataires facturent au jeton, chaque requête en dholuo coûte plus cher.
La coordination ne peut pas changer la façon dont les modèles actuels traitent le dholuo, mais les gouvernements peuvent résoudre d’autres problèmes. Ils peuvent réduire les coûts de développement en partageant l’infrastructure informatique, créer de la demande en achetant des outils pour les services publics et pérenniser le fonctionnement de ces services via des budgets de fonctionnement. Pourtant, de nombreuses subventions couvrent la collecte de données et prennent fin avant que les organisations qu’elles financent aient pu préparer les données, entraîner et tester un modèle, déployer un service et en assurer la maintenance.
La préparation des données pour l’entraînement des modèles repose sur des personnes qui étiquettent et transcrivent les données. Leur travail est essentiel, mais elles sont souvent sous-rémunérées et invisibles au sein des chaînes d’approvisionnement des institutions qui bénéficient de leur travail.
Un échange équitable est une condition préalable au passage à l’échelle. La rémunération des annotatrices et annotateurs doit être équitable, et les communautés qui contribuent des enregistrements et des savoirs culturels doivent conserver le contrôle sur l’utilisation de ces contributions et bénéficier d’une part de la valeur qu’elles créent.
Sans échange équitable, le pouvoir reste concentré au sein des entreprises qui développent des modèles de pointe, des fournisseurs de cloud et des propriétaires de plateformes. Ces entreprises décident ce qui est construit, la façon dont les services sont déployés et qui capte la valeur créée.
L’IA multilingue est donc un test concret de la souveraineté IA. Les communautés ont la capacité d’agir quand elles peuvent gérer leurs connaissances et façonner les systèmes qui s’en inspirent. Les pays sont souverains quand ils peuvent choisir, inspecter, adapter ou remplacer l’infrastructure dont ils dépendent.
De la stratégie à la pratique : deux nouveaux cadres
La note d'orientation co-publiée ce mois-ci par Current AI et le PNUD présente deux nouveaux cadres qui peuvent être lus conjointement.
La Chaîne de valeur des données à l’IA du PNUD offre une vision systémique des actions nécessaires, de la collecte des données jusqu’à leur déploiement et leur réutilisation. Elle montre aux gouvernements et aux organismes de financement où un soutien est nécessaire et où les progrès peuvent être entravés.
La Pipeline de préservation culturelle de Current AI montre ce qui doit être mis en place quand l’IA est mobilisée pour préserver et transmettre les connaissances culturelles. Cela passe par la gouvernance des communautés et leur implication alors que leurs connaissances sont collectées, numérisées, utilisées pour entraîner des modèles, testées pour assurer leur exactitude culturelle puis transformées en outils. Les personnes qui détiennent ces connaissances choisissent ce qui peut être partagé et ce qui doit rester protégé.

Chez Current AI, nous mettons cette approche en pratique à travers notre cohorte de subventions pilotes pour la préservation culturelle qui soutient quatre organisations en Afrique subsaharienne, dans la région arabe et en Amazonie brésilienne avec un budget de 3,2 millions de dollars. Portal sem Porteiras travaille avec des communautés autochtones de l’Amazonie brésilienne et du Cerrado pour construire des outils fonctionnant en priorité hors ligne, hébergés localement. Les communautés décident quels outils développer et comment les utiliser, et les données restent sur leur territoire.
Construire ensemble sans céder le contrôle
Aucun pays ne peut fournir seul l’ensemble des données, des modèles, des méthodes de test et des ressources informatiques nécessaires pour bâtir et entretenir une IA couvrant des milliers de langues. Les pays peuvent partager leurs infrastructures et préserver leur souveraineté lorsqu’aucun participant ne possède tout le système ni ne peut révoquer les accès des autres.
L’AI Potluck est le modèle de Current AI pour cette forme de propriété partagée. Les gouvernements, les organisations, ainsi que les développeuses et développeurs contribuent au mieux de leurs capacités sans laisser le résultat entre les mains d’une seule entreprise ou d’un pays unique.
Cette semaine, Current AI a rejoint 59 autres organisations qui s’engagent à aider 3,4 milliards de personnes à utiliser l’IA dans leur propre langue et avec leur propre voix d’ici les cinq prochaines années. Pour atteindre ce public, toutes les dimensions de la Chaîne de valeur de la donnée à l’IA devront être mobilisées, les communautés et institutions publiques façonnant ce qui est construit et gardant le contrôle sur leurs contributions.
Cet engagement importera à condition que les communautés conservent l'autorité sur les connaissances qu'elles apportent et participent à la valeur ainsi créée, tandis que les pays peuvent choisir, contrôler, adapter ou remplacer les infrastructures dont ils dépendent.

