Hardware & studio

Comprendre la machine, jusqu'au silicium

Un logiciel de qualité naît d'une compréhension fine de ce qui l'exécute : silicium, mémoire, flux thermiques. Cette culture matérielle guide chacun de mes choix d'architecture.

Défiler

01 · Accélération

Hardware pour l'IA

GPU, VRAM, inférence, entraînement : savoir où va chaque téraflop pour dimensionner des machines qui servent réellement les modèles.

GPU

Le moteur de calcul massivement parallèle

  • Architectures Ada Lovelace, Blackwell, RDNA : ce qui change réellement d'une génération à l'autre.
  • Cœurs CUDA pour le calcul générique, Tensor cores pour les multiplications matricielles des réseaux.
  • Précisions FP16, BF16, FP8 : arbitrer entre vitesse brute et stabilité numérique.
  • PCIe 5.0 et NVLink : la bande passante d'interconnexion conditionne le passage au multi-GPU.
Débit FP16 (Tensor cores, dense)
RTX 4090≈ 330 TFLOPS
RTX 5090≈ 420 TFLOPS
H100 SXM≈ 990 TFLOPS

VRAM

La contrainte n° 1 des modèles locaux

  • La taille du modèle dicte tout : poids, activations et cache KV doivent tenir ensemble en mémoire.
  • Quantization Q4/Q8 (GGUF, AWQ) : diviser l'empreinte mémoire par trois avec une perte maîtrisée.
  • Le cache KV grandit avec le contexte : 128k tokens se paient en gigaoctets supplémentaires.
  • Offloading CPU/NVMe : possible, mais chaque couche déportée se paie en latence.
VRAM requise en inférence (Q4)
Modèle 7B≈ 5 Go
Modèle 13B≈ 9 Go
Modèle 70B≈ 40 Go

Inférence

Servir vite, servir juste

  • Latence du premier token vs débit soutenu : deux optimisations différentes, deux architectures.
  • Batching continu (vLLM, TGI) : mutualiser le GPU entre requêtes sans exploser la latence.
  • Serveurs locaux : llama.cpp et Ollama rendent l'inférence privée accessible sur station de travail.
  • C'est la bande passante mémoire, pas le calcul, qui limite le débit en tokens par seconde.
Ordres de grandeur en local
7B Q4 · RTX 4090≈ 120 tokens/s
70B Q4 · 2 × 24 Go≈ 15 tokens/s
Premier token visé< 300 ms

Entraînement

Là où le matériel devient système

  • Multi-GPU : data, tensor ou pipeline parallelism selon la taille du modèle et le budget mémoire.
  • Interconnexion NVLink et InfiniBand : nourrir les GPU plus vite qu'ils ne calculent.
  • Refroidissement et alimentation : à 700 W par carte, la thermique devient un choix de design.
  • Checkpointing sur NVMe : sauvegarder souvent sans étrangler la boucle d'entraînement.
Fine-tuning : VRAM typique
7B · LoRA1 × 24 Go
13B · QLoRA1 × 24 Go
70B · LoRA4 × 80 Go

02 · Anatomie

Anatomie d'une machine

Sept composants, un équilibre : chaque pièce est choisie pour le rôle qu'elle joue dans la chaîne — pas pour sa fiche marketing.

Le chef d'orchestre : il séquence tout ce que la machine exécute. Fréquence, nombre de cœurs et cache L3 déterminent la réactivité du système et la vitesse des compilations.

  • Cœurs performance vs efficience
  • Cache L3 : le nerf de la compilation
  • TDP réel sous charge soutenue

01 / 07

03 · Le studio

Le studio

Le poste de travail maison : pensé pour la concentration, calibré pour la couleur, silencieux sous charge.

Points d'intérêt du studio

  1. Écran principal

    Dalle 27 pouces 4K calibrée à la sonde chaque mois : le pixel que je vois est celui que le client verra.

    27" · 4K · 99 % DCI-P3

  2. Station de travail

    Machine principale montée à la main : silencieuse au repos, stable sous charge d'inférence prolongée.

    Ryzen 9 · 64 Go DDR5 · RTX 4090 24 Go

  3. Périphériques

    Clavier mécanique profil bas et trackball vertical : l'ergonomie d'un geste répété huit heures par jour.

    Switchs silencieux · trackball vertical

  4. Audio

    Monitoring de proximité et micro dynamique pour les visios : un son propre, sans post-traitement.

    Moniteurs 5" · micro dynamique XLR

  5. Éclairage

    Lumière bias derrière l'écran, température réglable : moins de fatigue, meilleure lecture des contrastes.

    2700–6500 K · IRC > 95

  6. Serveur local

    Un nœud silencieux sous le bureau : CI locale, sauvegardes chiffrées et modèles open source servis en réseau.

    Proxmox · 32 Go ECC · 2 × 2 To NVMe

Une machine bien pensée, un logiciel bien livré

Parlons de votre produit — l'infrastructure suivra.

© 2020–2026 Davy Nana — Tous droits réservés

--:--