GPU
Le moteur de calcul massivement parallèle
- Architectures Ada Lovelace, Blackwell, RDNA : ce qui change réellement d'une génération à l'autre.
- Cœurs CUDA pour le calcul générique, Tensor cores pour les multiplications matricielles des réseaux.
- Précisions FP16, BF16, FP8 : arbitrer entre vitesse brute et stabilité numérique.
- PCIe 5.0 et NVLink : la bande passante d'interconnexion conditionne le passage au multi-GPU.
| RTX 4090 | ≈ 330 TFLOPS |
|---|---|
| RTX 5090 | ≈ 420 TFLOPS |
| H100 SXM | ≈ 990 TFLOPS |