OLKERINoticias de IA
← Todas las noticias de IA
Los chips de IA explicados: por qué las GPU mueven la inteligencia artificial del mundo

Imagen: Olkeri

Hardware y chipsGlobal29 de agosto de 20266 min de lectura

Por Olkeri.space

Los chips de IA explicados: por qué las GPU mueven la inteligencia artificial del mundo

Por qué los chips gráficos se convirtieron en el motor de la inteligencia artificial, en qué se diferencian GPU, TPU y NPU, y por qué el ancho de banda de memoria decide el rendimiento real.

Leer este artículo en: English · Français · Deutsch

La inteligencia artificial funciona sobre una clase de hardware estrecha, cara y estratégicamente disputada. Entender por qué explica buena parte del sector: por qué un fabricante de chips se convirtió en una de las empresas más valiosas del mundo, por qué los gobiernos tratan la exportación de chips como una cuestión de seguridad nacional y por qué la capacidad de cómputo es la verdadera restricción del avance de la IA.

Por qué precisamente los chips gráficos:

Entrenar una red neuronal es, en términos matemáticos, una montaña enorme de multiplicaciones de matrices. La misma operación aritmética sencilla se repite miles de millones de veces sobre números distintos.

Las unidades centrales de proceso, las CPU, están construidas para el problema contrario. Una CPU tiene un puñado de núcleos potentes, optimizados para ejecutar deprisa secuencias de instrucciones complicadas e impredecibles, una tras otra. Eso es ideal para un sistema operativo y para casi todo el software, y malo para hacer una operación sencilla miles de millones de veces.

Las unidades de proceso gráfico se diseñaron para calcular a la vez el color de millones de píxeles, de modo que tienen miles de núcleos más simples pensados para hacer lo mismo en paralelo. Esa arquitectura, desarrollada para los videojuegos, resultó ser casi exactamente lo que necesitan las redes neuronales.

El factor decisivo fue el software. Nvidia publicó CUDA en 2007 y permitió a los desarrolladores programar las GPU para cálculo general. Cuando el aprendizaje profundo despegó hacia 2012, ya existía todo un ecosistema de herramientas, bibliotecas e ingenieros formados. Desde entonces otros han construido silicio comparable; igualar ese ecosistema de software ha resultado mucho más difícil.

La sopa de siglas: GPU, TPU, NPU y ASIC:

La GPU es el caballo de batalla polivalente de la IA. Lo bastante flexible para entrenar cualquier arquitectura de modelo, lo bastante potente para las cargas más grandes y disponible en centros de datos de todo el mundo.

Una TPU, o unidad de procesamiento tensorial, es el chip a medida de Google, construido específicamente para operaciones de redes neuronales. Especializarse reduce la flexibilidad pero mejora la eficiencia en las cargas a las que apunta. Varias grandes tecnológicas diseñan ya sus propios equivalentes, en parte por rendimiento y en parte para reducir su dependencia de un único proveedor.

Una NPU, o unidad de procesamiento neuronal, es un acelerador pequeño y de bajo consumo integrado en teléfonos, portátiles y cámaras. Ejecuta modelos modestos en local para que el procesado de fotos, el reconocimiento de voz y la traducción funcionen sin enviar datos a un servidor. Eso mejora la latencia, la privacidad y el funcionamiento sin conexión.

ASIC es el término general para cualquier chip diseñado para una tarea concreta. Las TPU y las NPU son ejemplos. El compromiso es siempre el mismo: cuanto más estrecho el propósito, mejor la eficiencia y mayor el riesgo de que la carga de trabajo cambie y el silicio deje de encajar.

Entrenamiento e inferencia son problemas distintos:

El entrenamiento construye el modelo. Es un cálculo único y enorme que exige miles de chips trabajando juntos durante semanas y consume megavatios de potencia. El coste de entrenar un modelo de frontera se cuenta en decenas o cientos de millones de dólares.

La inferencia consiste en usar el modelo entrenado para responder a una petición. Cada inferencia por separado es pequeña, pero un producto popular realiza miles de millones. A lo largo de la vida de un modelo exitoso, el dinero y la energía dedicados a la inferencia suelen superar lo gastado en entrenarlo.

Ambas cargas premian hardware distinto. El entrenamiento premia el rendimiento bruto y las interconexiones rápidas entre muchos chips. La inferencia premia la latencia baja, la capacidad de memoria y el coste por consulta. Cada vez más, los chips se diseñan para lo uno o lo otro, no para ambos.

El ancho de banda de memoria es el verdadero cuello de botella:

El marketing de chips subraya el rendimiento bruto de cálculo, pero en la práctica el factor limitante suele ser el ancho de banda de memoria: la velocidad a la que los datos se mueven entre la memoria y los núcleos de cálculo.

Los aceleradores modernos hacen aritmética mucho más deprisa de lo que la memoria puede suministrarles números. Los núcleos quedan ociosos esperando datos. Por eso importa tanto la memoria de alto ancho de banda, o HBM. La HBM apila chips de memoria en vertical y los conecta mediante caminos muy anchos y muy rápidos, y su suministro limitado ha estrangulado repetidamente todo el mercado de hardware de IA. En varios periodos recientes la restricción decisiva ha sido la escasez de memoria, no de procesadores.

Los chips no trabajan solos:

Un modelo de frontera se entrena en miles de chips a la vez, lo que obliga a intercambiar resultados constantemente. Si la red que los conecta es lenta, aceleradores carísimos esperan.

Por eso las redes se han vuelto centrales en la infraestructura de IA, y por eso hoy se venden como un único producto sistemas completos: bastidores enteros en los que chips, memoria, red y refrigeración se diseñan en conjunto. El rendimiento es una propiedad del sistema, no de ningún componente aislado.

La electricidad y la refrigeración se convirtieron en la restricción:

El límite práctico a la expansión de la IA es cada vez más la electricidad. Un gran centro de datos de IA puede consumir tanto como una ciudad pequeña, y el crecimiento del sector ha chocado con el ritmo al que se pueden ampliar las redes eléctricas y aprobar las conexiones.

Al consumo le sigue el calor. La densidad de los bastidores de IA ha empujado al sector de la refrigeración por aire hacia la refrigeración líquida, lo que cambia la forma de construir un centro de datos. Los operadores eligen hoy la ubicación tanto por la disponibilidad de energía y el acceso al agua como por la cercanía a la red, razón por la cual la energía nuclear, la geotérmica y los acuerdos de generación dedicada forman ya parte de la estrategia de IA.

Por qué los chips se volvieron geopolítica:

La cadena de suministro tiene cuellos de botella extremos. Los chips más avanzados los fabrica un número reducido de fundiciones, abrumadoramente en Taiwán y Corea del Sur. Las máquinas que los producen, en particular los sistemas de litografía ultravioleta extrema, proceden esencialmente de una sola empresa de los Países Bajos. Buena parte del software de diseño es estadounidense.

Esa concentración convirtió los semiconductores en un instrumento político. Los controles a la exportación restringen qué chips pueden venderse a qué países; los programas de subvenciones intentan repatriar la fabricación; y una escasez o una interrupción del transporte se convierte en un acontecimiento económico.

Qué significa en la práctica:

El cómputo es el insumo escaso de la inteligencia artificial. Acceder a él determina quién puede entrenar modelos de frontera, con qué rapidez mejoran los productos y cuánto cuesta operarlos.

Para la mayoría de las organizaciones la implicación es sencilla: alquilará esa capacidad en lugar de poseerla, sus costes vendrán marcados por el volumen de inferencia y no por el entrenamiento, y la eficiencia del modelo que elija pesará más en su presupuesto que cualquier cifra de referencia destacada.