OLKERIActus IA
← Toutes les actus IA
Le fossé linguistique de l'IA : pourquoi la plus grande partie du monde reçoit une IA moins bonne

Image: Olkeri

Société & CultureMonde29 août 20264 min de lecture

Par Olkeri.space

Le fossé linguistique de l'IA : pourquoi la plus grande partie du monde reçoit une IA moins bonne

Des modèles entraînés surtout en anglais servent mal des milliards de personnes. Voici ce que cela coûte et qui s'y attaque.

Lire cet article en: English · Deutsch · Español

L'intelligence artificielle fonctionne le mieux en anglais, correctement dans une poignée de grandes langues, et mal ou pas du tout dans la plupart des milliers de langues que les gens parlent réellement. Ce fossé détermine qui profite de la technologie.

Pourquoi ce fossé existe :

Les modèles de langue apprennent à partir de textes. Le volume de texte numérique disponible diffère de plusieurs ordres de grandeur selon les langues : l'anglais domine, suivi de quelques langues largement numérisées, tandis que la plupart des langues du monde n'ont que très peu d'écrits en ligne.

Un modèle entraîné majoritairement sur de l'anglais développe de fortes capacités en anglais et des capacités plus faibles ailleurs, à peu près en proportion des données disponibles. Pour des langues presque dépourvues de corpus numérique, les performances peuvent être inutilisables.

Le problème s'aggrave de lui-même. De mauvaises performances font que moins de gens utilisent ces systèmes dans leur langue, ce qui génère moins de texte nouveau, ce qui maintient la rareté des données.

Qui est concerné :

La gravité varie. De grandes langues comme le chinois, l'espagnol, l'arabe, l'hindi, le portugais, le français, le russe et le japonais disposent de ressources substantielles et de performances correctes, quoique encore inférieures à l'anglais.

En dessous se trouvent des centaines de langues comptant chacune des dizaines de millions de locuteurs et de maigres ressources numériques : swahili, amharique, yoruba, haoussa, igbo, dialectes du bengali, javanais, tagalog, variétés régionales du vietnamien, kazakh et bien d'autres.

En dessous encore, des milliers de langues à tradition écrite limitée ou à faible nombre de locuteurs, pour lesquelles il n'existe aucun argument commercial à la prise en charge par un modèle.

L'Afrique est le continent le plus touché, avec plus de 2 000 langues et une présence minime dans les données d'entraînement. La seule Papouasie-Nouvelle-Guinée compte plus de 800 langues.

Ce que cela coûte :

Les conséquences sont concrètes. Un agriculteur qui ne parle qu'une langue locale ne peut pas utiliser un agent conversationnel de conseil agricole. Un patient ne peut pas décrire ses symptômes à un outil de diagnostic. Un citoyen ne peut pas accéder à un service public. Les interfaces vocales, qui comptent le plus là où l'alphabétisation est limitée, sont précisément celles où les écarts de performance sont les plus grands.

Résultat : les populations qui bénéficieraient le plus d'un accès à l'information et aux services médiatisé par l'IA sont celles que la technologie sert le plus mal.

Il y a aussi une dimension culturelle. Les systèmes entraînés sur des textes anglais encodent des présupposés, des références et des cadrages issus de contextes anglophones, et les réponses les reflètent même une fois traduites.

Qui y travaille :

Les travaux les plus significatifs viennent des communautés. Des réseaux bénévoles et universitaires à travers l'Afrique ont bâti des jeux de données, des tests de référence et des modèles pour les langues africaines, souvent avec des moyens minimes, et leur travail est aujourd'hui la base sur laquelle se construit l'essentiel des technologies des langues africaines.

Des programmes nationaux existent aussi. L'Islande finance les technologies de la langue islandaise explicitement au titre de la politique culturelle. L'Inde a beaucoup investi dans des jeux de données et des modèles pour ses langues, la majorité de sa population n'utilisant pas l'anglais. La Suède, la Finlande, l'Estonie, la Lettonie et d'autres financent leurs propres modèles de langue. Les États du Golfe financent la capacité en arabe. Le Japon, la Corée du Sud et Taïwan financent la leur.

L'économie diffère radicalement d'un cas à l'autre : les langues à grand marché attirent l'investissement commercial, les petites langues exigent un financement public, et les langues à la fois petites et pauvres n'obtiennent ni l'un ni l'autre.

Ce qui aiderait :

Les besoins pratiques sont peu glorieux : du texte numérisé, de la parole transcrite, des tests d'évaluation, et des locuteurs correctement payés pour créer et valider les données.

Les modèles à poids ouverts aident ici de façon disproportionnée, car une communauté disposant d'un jeu de données modeste peut adapter un modèle performant existant plutôt que d'en entraîner un depuis zéro, ce qui est autrement financièrement impossible.

Le fossé ne se comblera pas de lui-même. Il se comble là où quelqu'un décide qu'une langue mérite l'investissement, et cette décision est aujourd'hui prise par les marchés pour la plus grande partie du monde.