OLKERINoticias de IA
← Todas las noticias de IA
La brecha lingüística de la IA: por qué gran parte del mundo recibe peor IA

Imagen: Olkeri

Sociedad y culturaGlobal29 de agosto de 20264 min de lectura

Por Olkeri.space

La brecha lingüística de la IA: por qué gran parte del mundo recibe peor IA

Los modelos entrenados sobre todo en inglés atienden mal a miles de millones de personas. Esto es lo que cuesta y quién lo está resolviendo.

Leer este artículo en: English · Français · Deutsch

La inteligencia artificial funciona mejor en inglés, razonablemente bien en un puñado de lenguas mayoritarias, y mal o nada en la mayoría de los miles de idiomas que la gente habla de verdad. Esa brecha determina quién se beneficia de la tecnología.

Por qué existe la brecha:

Los modelos de lenguaje aprenden de texto. El volumen de texto digital disponible difiere en órdenes de magnitud entre lenguas: el inglés domina, seguido de unas pocas lenguas ampliamente digitalizadas, mientras que la mayoría de los idiomas del mundo tienen muy poco material escrito en línea.

Un modelo entrenado predominantemente con texto en inglés desarrolla una fuerte capacidad en inglés y una capacidad más débil en el resto, aproximadamente en proporción a los datos disponibles. En lenguas casi sin corpus digital, el rendimiento puede ser inservible.

El problema se retroalimenta. Un rendimiento pobre hace que menos gente use estos sistemas en su idioma, lo que genera menos texto nuevo, lo que mantiene la escasez de datos.

A quién afecta:

La gravedad varía. Lenguas mayoritarias como el chino, el español, el árabe, el hindi, el portugués, el francés, el ruso y el japonés cuentan con recursos sustanciales y un rendimiento razonable, aunque todavía por debajo del inglés.

Por debajo hay cientos de lenguas con decenas de millones de hablantes cada una y recursos digitales escasos: suajili, amárico, yoruba, hausa, igbo, variedades del bengalí, javanés, tagalo, variedades regionales del vietnamita, kazajo y muchas más.

Más abajo aún hay miles de lenguas con tradición escrita limitada o pocos hablantes, para las que no existe ningún argumento comercial que justifique el soporte de un modelo.

África es el continente más afectado, con más de 2.000 lenguas y una presencia mínima en los datos de entrenamiento. Solo Papúa Nueva Guinea tiene más de 800 idiomas.

Lo que cuesta:

Las consecuencias son concretas. Un agricultor que solo habla una lengua local no puede usar un asistente de asesoramiento agrícola. Un paciente no puede describir síntomas a una herramienta de diagnóstico. Un ciudadano no puede acceder a un servicio público. Las interfaces de voz, que más importan donde la alfabetización es limitada, son precisamente donde las brechas de rendimiento son mayores.

El resultado es que las poblaciones que más se beneficiarían de un acceso a información y servicios mediado por IA son las que peor atiende la tecnología.

Hay también una dimensión cultural. Los sistemas entrenados con texto en inglés codifican supuestos, referencias y encuadres de contextos anglófonos, y las respuestas los reflejan incluso traducidas.

Quién trabaja en ello:

El trabajo más significativo lo impulsan las comunidades. Redes de voluntarios y académicos de toda África han construido conjuntos de datos, pruebas de referencia y modelos para lenguas africanas, a menudo con financiación mínima, y su trabajo es hoy la base sobre la que se construye la mayor parte de la tecnología de las lenguas africanas.

También existen programas nacionales. Islandia financia la tecnología del islandés explícitamente como política cultural. India ha invertido de forma sustancial en conjuntos de datos y modelos para sus idiomas, dado que la mayor parte de su población no usa el inglés. Suecia, Finlandia, Estonia, Letonia y otros financian sus propios modelos de lenguaje. Los Estados del Golfo financian la capacidad en árabe. Japón, Corea del Sur y Taiwán financian la suya.

La economía difiere de raíz entre estos casos: las lenguas con mercados grandes atraen inversión comercial, las lenguas pequeñas requieren financiación pública, y las lenguas que son a la vez pequeñas y pobres no obtienen ninguna de las dos.

Qué ayudaría:

Las necesidades prácticas son poco vistosas: texto digitalizado, habla transcrita, pruebas de evaluación y hablantes pagados debidamente para crear y validar los datos.

Los modelos de pesos abiertos ayudan aquí de forma desproporcionada, porque una comunidad con un conjunto de datos modesto puede adaptar un modelo competente existente en lugar de entrenar uno desde cero, algo por lo demás financieramente imposible.

La brecha no se cerrará sola. Se cierra allí donde alguien decide que una lengua merece la inversión, y para la mayor parte del mundo esa decisión la toman hoy los mercados.