← Retour aux analyses
Intelligence Artificielle2026

Benchmark Inférence LLM : RTX 4090 vs Dual RTX 3090 (24GB vs 48GB VRAM)

Mesures réelles de tokens/sec, quantification AWQ vs GGUF et allocation mémoire sur modèles 14B, 32B et 70B.

Cadre d'essai
Protocole & Métrologie
Plateforme
ToxieLabs Benchmarks
Date
2026
Catégorie
Intelligence Artificielle
OllamavLLMCUDA 12.8PyTorch

Contexte de l’étude

Le déploiement local de grands modèles de langage (LLM) nécessite un arbitrage rigoureux entre bande passante mémoire (VRAM), débit de calcul brut (TFLOPS) et budget matériel. Cette analyse compare les performances réelles d’une carte unique très rapide face à un ensemble multi-GPU à haute capacité.

Banc d’essai et méthodologie

Tous les tests ont été réalisés sur une station dédiée sous environnement Linux bare-metal standard :

  • Moteur d’inférence : Ollama v0.5 et vLLM avec backend PagedAttention.
  • Modèles évalués : Qwen 2.5 (14B et 32B) et Llama 3.3 (70B).
  • Formats de quantification : FP16, AWQ (4-bit) et GGUF Q4_K_M / Q8_0.
  • Métrique principale : Débit en génération continue (tokens/seconde) et latence au premier token (TTFT).

Résultats et observations

  1. Sur les modèles 14B et 32B : La RTX 4090 domine en vitesse pure grâce à la rapidité de la mémoire GDDR6X (plus de 78 tokens/sec sur le 14B Q4).
  2. Sur le modèle 70B : L’architecture Dual RTX 3090 (48GB cumulés) permet de charger le modèle complet en VRAM sans aucun déchargement sur la RAM système (CPU), maintenant un débit stable de 18 à 22 tokens/sec, là où une carte unique de 24GB plafonne ou nécessite un délestage sévère.

Recommandations

Pour les laboratoires indépendants et analystes nécessitant des contextes larges (32k+ tokens) ou des modèles 70B, la topologie multi-GPU 24GB offre le ratio capacité/coût le plus résilient.