La IA que todavía no sabe escuchar

En Accra, el Pan African AI & Innovation Summit desplazó una parte del debate sobre las lenguas africanas. El problema no es solo qué idiomas entiende una IA, sino qué forma de comunicación espera encontrar.

·Martín González Senosiain

La IA que todavía no sabe escuchar

En Accra, el Pan African AI & Innovation Summit desplazó una parte del debate sobre las lenguas africanas. El problema no es solo qué idiomas entiende una inteligencia artificial, sino qué forma de comunicación espera encontrar. Buena parte de la IA actual presupone a alguien que escribe, lee y permanece conectado. En muchos contextos, la vida lingüística funciona de otra manera.

Durante el segundo día del Pan African AI & Innovation Summit 2026, celebrado en Accra, una intervención condensó en pocas palabras un problema que suele quedar oculto detrás de las discusiones sobre modelos, capacidad de cómputo y soberanía digital. La jornada estaba dedicada al talento y al impacto, con sesiones sobre formación, construcción de soluciones africanas y aplicaciones en ámbitos como salud, agricultura o clima.

“NLP in Ghana is not a text problem. It is a voice problem.”

El razonamiento que siguió era sencillo. Un modelo lingüístico en una lengua local puede tener poco valor práctico si las personas a las que pretende llegar no utilizan esa lengua principalmente mediante la escritura. Algunas de las personas que más podrían beneficiarse de estas tecnologías escuchan y hablan, aunque no necesariamente leen. Desde esa perspectiva, el punto de partida deja de ser añadir otra lengua a un sistema textual y pasa a ser diseñar desde la voz.

La observación parece menor hasta que se examinan las condiciones sobre las que se construye buena parte de la inteligencia artificial contemporánea. Escribir una instrucción en una caja de texto presupone alfabetización, una pantalla, un teclado o una interfaz táctil, cierta familiaridad con la lógica de una consulta y, normalmente, conexión suficiente para mantener una conversación con servidores remotos. Ese conjunto de condiciones se ha vuelto tan habitual para una parte de quienes diseñan sistemas digitales que puede desaparecer de la vista.

No es una interfaz neutral. Contiene una idea de la persona que la utilizará.

Antes del modelo están los datos

La misma presentación mostró hasta qué punto la desigualdad lingüística precede al propio modelo. Según explicó quien intervenía, Whisper, uno de los sistemas de reconocimiento de voz más conocidos, se entrenó con unas 680.000 horas de audio. El proyecto local que presentaba disponía de 16.

“¿Cómo compites?”, preguntó.

Su respuesta no consistía en esperar hasta reunir un corpus equivalente. El proyecto había empezado a producir pares de audio, texto y traducción y a compartirlos abiertamente para que otros equipos pudieran reutilizarlos. Cada hora liberada era una hora que el siguiente proyecto ya no tendría que construir desde cero.

La diferencia entre 680.000 y 16 horas ayuda a entender la palabra escasez de otra manera. Una lengua puede estar presente en conversaciones, mercados, hogares, emisoras de radio, celebraciones o redes familiares y seguir apareciendo como pobre en datos para una máquina. La vida lingüística y la disponibilidad computacional no son lo mismo.

Para convertirse en materia de entrenamiento, la voz tiene que ser grabada. Después puede necesitar transcripción, etiquetado, clasificación, almacenamiento y permisos de uso. Aquello que no atraviesa esa cadena queda fuera de buena parte de la representación estadística del lenguaje.

La tarde añadió otra capa. En una presentación sobre la construcción de una empresa tecnológica en Ghana se señaló que buena parte de los datos con los que trabajan los sistemas de IA procede de Internet, un espacio descrito allí como predominantemente anglófono y occidental. La misma intervención pasó inmediatamente después al problema lingüístico cotidiano. Una persona puede utilizar varias lenguas a lo largo de un mismo día y modificar también el tono dependiendo de dónde esté y con quién hable. Traducir ese movimiento al inglés y devolverlo después a otra lengua puede conservar parte de la información y perder justamente aquello que daba sentido social al intercambio.

Un chiste deja de ser el mismo chiste. Una forma de dirigirse a alguien puede perder parentesco, distancia, respeto, ironía o intimidad. La lengua no funciona únicamente como un contenedor intercambiable de significado.

El dato también tiene contexto

Esta dificultad toca un punto central para la antropología de la inteligencia artificial. Los grandes modelos trabajan extraordinariamente bien con regularidades. Pero las personas no hablan solo mediante regularidades gramaticales.

Cambian de registro. Alternan lenguas. Acortan una frase porque la otra persona conoce la historia anterior. Utilizan una expresión cuyo significado depende del barrio, la generación, el parentesco o una experiencia compartida. Hablan de forma distinta en una institución, en casa o durante una compra.

Cuando toda esa actividad se transforma en texto normalizado, una parte de la estructura social que acompañaba a las palabras puede desaparecer.

Por eso aumentar el número de idiomas soportados no resuelve automáticamente el problema. Una interfaz puede ofrecer cien lenguas y seguir imaginando el mismo tipo de uso. Una persona escribe, la máquina procesa y devuelve otra secuencia textual. El multilingüismo aparece entonces como una propiedad del sistema, pero no necesariamente como una propiedad de la vida que intenta representar.

Accra mostró otra posibilidad.

Offline antes que universal

Durante el Hack-AI-Thon apareció Haska AI, una aplicación destinada a conectar a quienes producen residuos de la industria del cacao con posibles usos y compradores. En la presentación se destacó que sus modelos funcionan completamente sin conexión y que la aplicación dispone de varias lenguas locales. La explicación fue deliberadamente concreta. Una persona en una zona remota no debería necesitar acceso a Internet ni utilizar obligatoriamente el modo en inglés para interactuar con la herramienta.

No era el único proyecto que incorporaba el funcionamiento offline. Otra propuesta para laboratorios médicos defendió también la posibilidad de utilizar sus modelos sin conexión, precisamente pensando en instalaciones con recursos limitados. La recurrencia importa. Offline no aparecía como una función secundaria añadida después del producto principal. Formaba parte de las condiciones de diseño.

Ese desplazamiento resulta significativo. Una tecnología puede presentarse como universal porque funciona en cualquier navegador y, al mismo tiempo, depender de condiciones que están lejos de ser universales.

La discusión del jurado terminó por formular el criterio de manera casi antropológica. Al evaluar las propuestas, se preguntó si una solución era capaz de integrarse en la vida cotidiana sin obligar a quienes la utilizan a reorganizar sus prácticas para adaptarse a la IA. El ejemplo fue el dinero móvil y los mensajes de texto. Una tecnología resulta más fácil de incorporar cuando entra por un comportamiento ya aprendido.

La diferencia parece pequeña, pero invierte el sentido habitual de la adaptación. En lugar de pedir a las personas que aprendan cómo quiere ser utilizada la inteligencia artificial, el sistema empieza por aprender cómo viven quienes deberían utilizarlo.

Una máquina que escucha

La promesa de una IA africana suele formularse alrededor de modelos propios, centros de datos, capacidad de cómputo, inversión y soberanía tecnológica. Todos esos elementos estuvieron presentes en Accra y serán decisivos. Pero las conversaciones del segundo día dejaron también una capa más próxima a la experiencia cotidiana.

Quién puede hablarle a una máquina.

En qué lengua.

De qué manera.

Con qué conexión.

Y qué parte del significado sobrevive cuando esa voz se convierte en datos.

Construir sistemas voice-first, capaces de operar offline y preparados para contextos multilingües no implica desarrollar una versión reducida de las interfaces dominantes. Puede significar partir de otra descripción de la realidad.

La inteligencia artificial que conocemos se ha acostumbrado a esperar una instrucción escrita. En muchos lugares, aprender a escuchar puede ser una innovación bastante más profunda.

Fuentes

Temas