Servidores dedicados para inferência de IA
Passthrough de GPU para cargas de trabalho sérias de inferência de IA. RTX PRO 4500 (32 GB VRAM) ou RTX PRO 6000 (96 GB VRAM). CUDA completo, sem fatiamento MIG.
Best-fit dedicated plans
These are the closest stock plans in our catalogue for AI inference server workloads. Fully customizable — port, storage, RAM, DDoS profile.
GPU VPS · RTX PRO 4500
16 vCPU · 128 GB DDR5 · 1 TB NVMe Gen5 · RTX PRO 4500 (32 GB VRAM) passthrough completo
GPU VPS · RTX PRO 6000
32 vCPU · 256 GB DDR5 · 2 TB NVMe Gen5 · RTX PRO 6000 (96 GB VRAM) passthrough completo
Clusters de 2× / 4× / 8× GPU
Orçamento personalizado por configuração — múltiplas GPUs Blackwell / L40S / L4, NVLink onde suportado
About AI inference server
Cargas de trabalho de inferência exigem três coisas de um host de GPU: VRAM suficiente para armazenar o modelo, largura de banda PCIe total para alimentá-lo e zero contenção de vizinhos barulhentos. Nosso nível de GPU dedicado oferece tudo isso — sem fatiamento MIG, sem GPU compartilhada com outros 8 locatários.
A RTX PRO 4500 Blackwell (32 GB VRAM) atende confortavelmente a modelos quantizados de 13-14B (Llama 3, Mistral, Qwen em INT4/INT8) ou modelos de precisão total de 7-8B. Taxa de transferência típica: 40-80 tokens/s em fluxo único, 200-400 tokens/s em lote. A RTX PRO 6000 (96 GB VRAM) escala para 70B quantizados ou 34B completos — 15-40 tokens/s em fluxo único, 100-250 em lote.
Todas as configurações vêm com Ubuntu 22.04 + CUDA 12.4, cuDNN, TensorRT, PyTorch/JAX/vLLM pré-instalados. Docker + NVIDIA Container Toolkit prontos. IPMI 2.0 para recuperação fora de banda. Armazenamento NVMe Gen5 de 1 TB para pesos de modelo + cache quente.
Para cargas de trabalho multi-GPU (2× / 4× / 8× GPU por caixa, NVLink onde suportado) — orçamento personalizado por configuração. Trabalhos de treinamento multi-locatário, fine-tuning LoRA, serviço de LLM em escala — envie a carga de trabalho, nós especificaremos a caixa.
Frequently asked questions
Qual tamanho de modelo cabe em 32 GB VRAM?
FP16 completo: 7-8B (Llama 3 8B, Mistral 7B). INT8: 13-14B. INT4: 30-34B. Com descarregamento de algumas camadas para a CPU, você pode atingir 70B em INT4, mas a taxa de transferência cai significativamente.
Vale a pena optar pela RTX PRO 6000 em vez de múltiplas 4500s?
Depende. Serviço de modelo único com baixa latência → prefira uma única 6000 (96 GB). Serviço multi-locatário com muitos modelos pequenos → múltiplas 4500s escalam melhor economicamente.
Vocês oferecem H100 ou H200?
Atualmente sem estoque. Se sua carga de trabalho exigir H100, podemos adquiri-las e instalá-las — orçamento personalizado, prazo de entrega de 2-3 semanas.