Serveurs dédiés pour l'inférence IA
Passthrough GPU pour les charges de travail d'inférence IA sérieuses. RTX PRO 4500 (32 Go VRAM) ou RTX PRO 6000 (96 Go VRAM). CUDA complet, pas de découpage MIG.
Best-fit dedicated plans
These are the closest stock plans in our catalogue for AI inference server workloads. Fully customizable — port, storage, RAM, DDoS profile.
VPS GPU · RTX PRO 4500
16 vCPU · 128 Go DDR5 · 1 TB NVMe Gen5 · RTX PRO 4500 (32 Go VRAM) passthrough complet
VPS GPU · RTX PRO 6000
32 vCPU · 256 Go DDR5 · 2 TB NVMe Gen5 · RTX PRO 6000 (96 Go VRAM) passthrough complet
Clusters GPU 2× / 4× / 8×
Devis personnalisé par configuration — plusieurs GPU Blackwell / L40S / L4, NVLink là où c'est pris en charge
About AI inference server
Les charges de travail d'inférence exigent trois choses d'un hôte GPU : suffisamment de VRAM pour contenir le modèle, une bande passante PCIe complète pour l'alimenter, et aucune contention de la part de voisins bruyants. Notre niveau GPU dédié vous offre les trois — pas de découpage MIG, pas de GPU partagé avec 8 autres locataires.
La RTX PRO 4500 Blackwell (32 Go VRAM) prend en charge confortablement les modèles quantifiés 13-14B (Llama 3, Mistral, Qwen en INT4/INT8) ou les modèles pleine précision 7-8B. Débit typique : 40-80 tokens/s en flux unique, 200-400 tokens/s en lot. La RTX PRO 6000 (96 Go VRAM) s'adapte aux modèles quantifiés 70B ou pleine précision 34B — 15-40 tokens/s en flux unique, 100-250 en lot.
Toutes les configurations sont livrées avec Ubuntu 22.04 + CUDA 12.4, cuDNN, TensorRT, PyTorch/JAX/vLLM préinstallés. Docker + NVIDIA Container Toolkit prêts à l'emploi. IPMI 2.0 pour la récupération hors bande. 1 TB de stockage NVMe Gen5 pour les poids des modèles + cache chaud.
Pour les charges de travail multi-GPU (2× / 4× / 8× GPU par boîtier, NVLink là où c'est pris en charge) — devis personnalisé par configuration. Tâches d'entraînement multi-locataires, fine-tuning LoRA, service LLM à l'échelle — envoyez la charge de travail, nous spécifierons le boîtier.
Frequently asked questions
Quelle taille de modèle tient dans 32 Go de VRAM ?
FP16 complet : 7-8B (Llama 3 8B, Mistral 7B). INT8 : 13-14B. INT4 : 30-34B. Avec le déchargement CPU de certaines couches, vous pouvez atteindre 70B en INT4, mais le débit diminue considérablement.
Vaut-il mieux opter pour une RTX PRO 6000 ou plusieurs 4500 ?
Cela dépend. Pour le service d'un modèle unique à faible latence → préférez une seule 6000 (96 Go). Pour le service multi-locataires avec de nombreux petits modèles → plusieurs 4500s sont plus économiques à l'échelle.
Proposez-vous des H100 ou H200 ?
Actuellement en rupture de stock. Si votre charge de travail nécessite des H100, nous pouvons les sourcer et les installer — devis personnalisé, délai de 2-3 semaines.