all systems operational
Get started
RTX PRO 4500 / 6000 Blackwell · dédié

Serveurs dédiés pour l'inférence IA

Passthrough GPU pour les charges de travail d'inférence IA sérieuses. RTX PRO 4500 (32 Go VRAM) ou RTX PRO 6000 (96 Go VRAM). CUDA complet, pas de découpage MIG.

32 / 96 GB
VRAM par GPU
PCIe 5.0 x16
passthrough pleine vitesse
CUDA 12 +
préinstallé
from $550
/mois (RTX PRO 4500)

About AI inference server

Les charges de travail d'inférence exigent trois choses d'un hôte GPU : suffisamment de VRAM pour contenir le modèle, une bande passante PCIe complète pour l'alimenter, et aucune contention de la part de voisins bruyants. Notre niveau GPU dédié vous offre les trois — pas de découpage MIG, pas de GPU partagé avec 8 autres locataires.

La RTX PRO 4500 Blackwell (32 Go VRAM) prend en charge confortablement les modèles quantifiés 13-14B (Llama 3, Mistral, Qwen en INT4/INT8) ou les modèles pleine précision 7-8B. Débit typique : 40-80 tokens/s en flux unique, 200-400 tokens/s en lot. La RTX PRO 6000 (96 Go VRAM) s'adapte aux modèles quantifiés 70B ou pleine précision 34B — 15-40 tokens/s en flux unique, 100-250 en lot.

Toutes les configurations sont livrées avec Ubuntu 22.04 + CUDA 12.4, cuDNN, TensorRT, PyTorch/JAX/vLLM préinstallés. Docker + NVIDIA Container Toolkit prêts à l'emploi. IPMI 2.0 pour la récupération hors bande. 1 TB de stockage NVMe Gen5 pour les poids des modèles + cache chaud.

Pour les charges de travail multi-GPU (2× / 4× / 8× GPU par boîtier, NVLink là où c'est pris en charge) — devis personnalisé par configuration. Tâches d'entraînement multi-locataires, fine-tuning LoRA, service LLM à l'échelle — envoyez la charge de travail, nous spécifierons le boîtier.

/faq

Frequently asked questions

Quelle taille de modèle tient dans 32 Go de VRAM ?

FP16 complet : 7-8B (Llama 3 8B, Mistral 7B). INT8 : 13-14B. INT4 : 30-34B. Avec le déchargement CPU de certaines couches, vous pouvez atteindre 70B en INT4, mais le débit diminue considérablement.

Vaut-il mieux opter pour une RTX PRO 6000 ou plusieurs 4500 ?

Cela dépend. Pour le service d'un modèle unique à faible latence → préférez une seule 6000 (96 Go). Pour le service multi-locataires avec de nombreux petits modèles → plusieurs 4500s sont plus économiques à l'échelle.

Proposez-vous des H100 ou H200 ?

Actuellement en rupture de stock. Si votre charge de travail nécessite des H100, nous pouvons les sourcer et les installer — devis personnalisé, délai de 2-3 semaines.

Chat with us@hostfory