OLKERIActus IA
← Toutes les actus IA
Les puces d'IA expliquées : pourquoi les GPU font tourner l'intelligence artificielle mondiale

Image: Olkeri

Matériel & PucesMonde29 août 20266 min de lecture

Par Olkeri.space

Les puces d'IA expliquées : pourquoi les GPU font tourner l'intelligence artificielle mondiale

Pourquoi les puces graphiques sont devenues le moteur de l'intelligence artificielle, en quoi GPU, TPU et NPU diffèrent, et pourquoi la bande passante mémoire décide des performances réelles.

Lire cet article en: English · Deutsch · Español

L'intelligence artificielle fonctionne sur une catégorie de matériel étroite, coûteuse et stratégiquement disputée. Comprendre pourquoi éclaire une grande partie du secteur : pourquoi un fabricant de puces est devenu l'une des entreprises les plus valorisées au monde, pourquoi les gouvernements traitent les exportations de puces comme un enjeu de sécurité nationale, et pourquoi la capacité de calcul est la véritable contrainte sur les progrès de l'IA.

Pourquoi les puces graphiques, précisément :

Entraîner un réseau de neurones revient, mathématiquement, à un empilement colossal de multiplications de matrices. La même opération arithmétique simple est répétée des milliards de fois sur des nombres différents.

Les processeurs centraux, les CPU, sont conçus pour le problème inverse. Un CPU dispose d'une poignée de cœurs puissants, optimisés pour exécuter rapidement des séquences d'instructions compliquées et imprévisibles, l'une après l'autre. C'est idéal pour un système d'exploitation et pour la plupart des logiciels, et médiocre pour répéter une opération simple des milliards de fois.

Les processeurs graphiques ont été conçus pour calculer simultanément la couleur de millions de pixels : ils comportent donc des milliers de cœurs plus simples, taillés pour faire la même chose en parallèle. Cette architecture, mise au point pour le jeu vidéo, s'est révélée être presque exactement ce dont les réseaux de neurones ont besoin.

Le facteur décisif fut le logiciel. Nvidia a publié CUDA en 2007, permettant aux développeurs de programmer les GPU pour du calcul générique. Lorsque l'apprentissage profond a décollé vers 2012, tout un écosystème d'outils, de bibliothèques et d'ingénieurs formés existait déjà. Des concurrents ont depuis conçu du silicium comparable ; égaler cet écosystème logiciel s'est avéré bien plus difficile.

La soupe de sigles : GPU, TPU, NPU et ASIC :

Le GPU est la bête de somme polyvalente de l'IA. Assez souple pour entraîner n'importe quelle architecture de modèle, assez puissant pour les charges les plus lourdes, et disponible dans les centres de données du monde entier.

Le TPU, ou unité de traitement tensoriel, est la puce sur mesure de Google, conçue spécifiquement pour les opérations de réseaux de neurones. La spécialisation réduit la souplesse mais améliore l'efficacité sur les charges visées. Plusieurs grandes entreprises technologiques conçoivent désormais leurs propres équivalents, en partie pour la performance, en partie pour réduire leur dépendance à un fournisseur unique.

Le NPU, ou unité de traitement neuronal, est un petit accélérateur basse consommation intégré aux téléphones, aux ordinateurs portables et aux appareils photo. Il exécute localement des modèles modestes, afin que le traitement des photos, la reconnaissance vocale et la traduction fonctionnent sans envoyer de données à un serveur. Cela améliore la latence, la confidentialité et le fonctionnement hors ligne.

ASIC est le terme générique désignant toute puce conçue pour une tâche précise. Les TPU et les NPU en sont deux exemples. Le compromis est toujours le même : plus la finalité est étroite, meilleure est l'efficacité, et plus grand est le risque que la charge de travail évolue et que le silicium ne convienne plus.

Entraînement et inférence sont deux problèmes distincts :

L'entraînement construit le modèle. C'est un calcul unique et gigantesque, qui mobilise des milliers de puces travaillant de concert pendant des semaines et consomme des mégawatts. Le coût d'entraînement d'un modèle de pointe se chiffre en dizaines, voire en centaines de millions de dollars.

L'inférence consiste à utiliser le modèle entraîné pour répondre à une requête. Chaque inférence prise isolément est légère, mais un produit à succès en effectue des milliards. Sur la durée de vie d'un modèle qui marche, l'argent et l'énergie consacrés à l'inférence dépassent en général ce qu'a coûté l'entraînement.

Les deux charges récompensent des matériels différents. L'entraînement valorise le débit brut et des interconnexions rapides entre de nombreuses puces. L'inférence valorise la faible latence, la capacité mémoire et le coût par requête. De plus en plus, les puces sont conçues pour l'une ou pour l'autre, plutôt que pour les deux.

La bande passante mémoire est le vrai goulot d'étranglement :

Le marketing des puces met en avant le débit de calcul brut, mais en pratique le facteur limitant est le plus souvent la bande passante mémoire : la vitesse à laquelle les données circulent entre la mémoire et les cœurs de calcul.

Les accélérateurs modernes calculent bien plus vite que la mémoire ne peut leur fournir des nombres. Les cœurs restent inactifs, à attendre les données. C'est pourquoi la mémoire à haute bande passante, ou HBM, compte tant. La HBM empile les puces mémoire verticalement et les relie par des chemins très larges et très rapides ; son approvisionnement limité a contraint à plusieurs reprises l'ensemble du marché du matériel d'IA. Une pénurie de mémoire, et non de processeurs, a été la contrainte déterminante lors de plusieurs périodes récentes.

Les puces ne travaillent pas seules :

Un modèle de pointe est entraîné simultanément sur des milliers de puces, qui doivent donc échanger constamment leurs résultats. Si le réseau qui les relie est lent, des accélérateurs coûteux attendent.

C'est pourquoi le réseau est devenu central dans l'infrastructure d'IA, et pourquoi des systèmes complets, des baies entières où puces, mémoire, réseau et refroidissement sont conçus ensemble, se vendent désormais comme un produit unique. La performance est une propriété du système, pas d'un composant isolé.

L'électricité et le refroidissement sont devenus la contrainte :

La limite pratique à l'expansion de l'IA est de plus en plus l'électricité. Un grand centre de données d'IA peut consommer autant qu'une petite ville, et la croissance du secteur s'est heurtée au rythme auquel les réseaux électriques peuvent être étendus et les raccordements approuvés.

La chaleur suit la puissance. La densité des baies d'IA a fait passer le secteur du refroidissement à air au refroidissement liquide, ce qui change la manière de construire un centre de données. Les exploitants choisissent désormais leurs sites autant pour la disponibilité électrique et l'accès à l'eau que pour la proximité réseau, d'où l'intégration du nucléaire, de la géothermie et d'accords de production dédiée dans les stratégies d'IA.

Pourquoi les puces sont devenues géopolitiques :

La chaîne d'approvisionnement comporte des points de passage obligés extrêmes. Les puces les plus avancées sont fabriquées par un très petit nombre de fonderies, très majoritairement à Taïwan et en Corée du Sud. Les machines qui les produisent, en particulier les systèmes de lithographie dans l'ultraviolet extrême, proviennent essentiellement d'une seule entreprise néerlandaise. Une grande part des logiciels de conception est américaine.

Cette concentration a fait des semi-conducteurs un instrument de politique publique. Des contrôles à l'exportation limitent quelles puces peuvent être vendues à quels pays ; des programmes de subventions tentent de relocaliser la fabrication ; et une pénurie ou une perturbation logistique devient un événement économique.

Ce que cela signifie concrètement :

Le calcul est la ressource rare de l'intelligence artificielle. Y accéder détermine qui peut entraîner des modèles de pointe, à quelle vitesse les produits s'améliorent, et ce qu'ils coûtent à exploiter.

Pour la plupart des organisations, l'implication est simple : vous louerez cette capacité plutôt que de la posséder, vos coûts seront tirés par le volume d'inférence et non par l'entraînement, et l'efficacité du modèle que vous choisirez pèsera davantage sur votre budget que n'importe quel score affiché.